资讯

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

InfoQ中文·2026/9/5 17:00:00🔗 原文

📋总体概括

伯克利与MIT团队联合开源推理加速项目FreeToken,宣称可在RTX 4060这类消费级显卡上运行35B参数大模型,并实现约每秒39个Token的生成速度。若数据属实,意味着高参数量模型的推理门槛被显著下探——无需数据中心级GPU,普通消费级硬件也有机会承担大模型部署,对边缘侧与本地化推理场景具有参考价值。目前公开细节有限,具体加速机制与实测条件有待进一步验证。

关键信息

  • 伯克利与MIT团队联合开源大模型推理加速项目FreeToken
  • 宣称在RTX 4060消费级显卡上运行35B参数模型
  • 生成速度达到约每秒39个Token
  • 若属实,35B级模型推理门槛从数据中心级GPU下探到消费级硬件

🔥犀利点评

4060跑35B还敢标39 Token每秒,要么是激进量化叠加投机解码的极限操作,要么就是特定prompt下的实验室数字。开源是好姿态,但低空领域和老司机们都懂:demo速度和真实负载速度是两回事。等第三方复现数据出来再上头不迟,目前这更像一篇论文宣传语而非可用产品承诺。

本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文