FreeToken开源:单卡RTX 5090跑满血DeepSeek V4 Flash,笔记本也能玩大模型

本周五,AI社区热烈讨论一个端侧大模型部署技术——名为FreeToken的全新开源边缘端推理系统,由UC Berkeley、MIT等机构联合开发。它能让笔记本RTX 4060跑Qwen 3.6-35B,桌面RTX 5090跑满血DeepSeek-V4-Flash 284B,而且都是单卡、满血模型。

性能表现

Codex生产trace的中位decode速度是33 token/s,笔记本RTX 4060跑Qwen3.6-35B的39.3 token/s已经超过了这个数。

技术原理

FreeToken利用智能token缓存和动态卸载技术,将大模型的权重组态灵活分配到GPU显存和系统内存之间,在单卡条件下实现大模型推理。相比传统的量化方案,FreeToken保持了模型的原始精度,不牺牲输出质量。

适用场景

  • 个人开发者本地运行大模型进行代码辅助
  • 隐私敏感场景(医疗、金融)的本地推理
  • 边缘计算设备上的AI应用部署
  • 教育培训场景中的大模型演示

项目已开源,可在GitHub上找到,支持PyTorch后端。最低配置要求为6GB显存,推荐12GB以上以获得更好的体验。

© 版权声明
THE END
喜欢就支持一下吧
点赞19 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容