本周五,AI社区热烈讨论一个端侧大模型部署技术——名为FreeToken的全新开源边缘端推理系统,由UC Berkeley、MIT等机构联合开发。它能让笔记本RTX 4060跑Qwen 3.6-35B,桌面RTX 5090跑满血DeepSeek-V4-Flash 284B,而且都是单卡、满血模型。
性能表现
Codex生产trace的中位decode速度是33 token/s,笔记本RTX 4060跑Qwen3.6-35B的39.3 token/s已经超过了这个数。
技术原理
FreeToken利用智能token缓存和动态卸载技术,将大模型的权重组态灵活分配到GPU显存和系统内存之间,在单卡条件下实现大模型推理。相比传统的量化方案,FreeToken保持了模型的原始精度,不牺牲输出质量。
适用场景
- 个人开发者本地运行大模型进行代码辅助
- 隐私敏感场景(医疗、金融)的本地推理
- 边缘计算设备上的AI应用部署
- 教育培训场景中的大模型演示
项目已开源,可在GitHub上找到,支持PyTorch后端。最低配置要求为6GB显存,推荐12GB以上以获得更好的体验。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END















![囧次元[樱花动漫]去广告纯净版 - 浩宇工作室](https://umwx.oss-cn-shenzhen.aliyuncs.com/wp-content/uploads/2023/01/7ef194ec378b-1024x768.jpg)

![[电脑软件]抖音采集/下载工具TikTokDownloader 5.3 - 浩宇工作室](https://umwx.oss-cn-shenzhen.aliyuncs.com/wp-content/uploads/2024/05/20240510151922787-234818cqqjoo83p5s2us3e-1024x516.png)






暂无评论内容