资讯

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

InfoQ中文·2026/9/5 17:00:00🔗 原文

📋总体概括

伯克利与MIT团队联合开源推理框架FreeToken,通过优化CPU-GPU协同与内存调度,让消费级显卡RTX 4060(仅8GB显存)也能跑动35B参数大模型,推理速度达到每秒39个Token。该项目主打在低配硬件上高效运行大模型,显著降低了本地部署门槛,为端侧与低成本推理提供了新的开源选择。

关键信息

  • 伯克利与MIT联合开源大模型推理框架FreeToken
  • 在仅8GB显存的RTX 4060上运行35B参数模型
  • 推理速度达每秒39个Token,可用性接近流畅阅读水平
  • 项目完全开源,主打低配硬件部署大模型的能力

🔥犀利点评

8GB卡跑35B还跑到39 token/s,靠的不是魔法而是把权重塞内存、算子搬CPU再拿流水线掩盖延迟——本质是拿带宽换显存。真正的问题是FP16还是量化、上下文长了还剩几成速度,这些宣传里往往语焉不详。但方向没错:让闲置的消费级硬件跑大模型,比堆H100更普惠。

本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文