郭明錤:英伟达重启推理预填充优化芯片Rubin CPX项目
📌 概要
英伟达悄然重启一项一度被市场认为已经放弃的芯片项目,目标直指AI推理成本较高的预填充(Prefill)环节。 知名分析师郭明錤最新产业调查显示, 英伟达已重新启动AI推理预填充加速GPU项目“Rubin CPX”,并对产品设计进行大幅调整。按照目前规划,新版Rubin CPX预计于2027年第一季度开始生产。 此次项目重启释放出一个明确信号: 英伟达正在加码解决AI推理阶段的预填充性能与成
⚡ 关键要点
- ▸英伟达悄然重启一项一度被市场认为已经放弃的芯片项目,目标直指AI推理成本较高的预填充(Prefill)环节。
- ▸知名分析师郭明錤最新产业调查显示, 英伟达已重新启动AI推理预填充加速GPU项目“Rubin CPX”,并对产品设计进行
- ▸此次项目重启释放出一个明确信号: 英伟达正在加码解决AI推理阶段的预填充性能与成本瓶颈。 随着大模型上下文长度持续增加,
英伟达悄然重启一项一度被市场认为已经放弃的芯片项目,目标直指AI推理成本较高的预填充(Prefill)环节。
知名分析师郭明錤最新产业调查显示,英伟达已重新启动AI推理预填充加速GPU项目“Rubin CPX”,并对产品设计进行大幅调整。按照目前规划,新版Rubin CPX预计于2027年第一季度开始生产。
此次项目重启释放出一个明确信号:英伟达正在加码解决AI推理阶段的预填充性能与成本瓶颈。随着大模型上下文长度持续增加,预填充阶段需要处理大量输入信息并生成KV Cache,其效率直接影响AI推理的整体成本和部署经济性。
郭明錤称,目前超过50%的AI推理工作负载来自输入上下文处理及KV Cache构建。
芯片规格大幅调整,算力接近标准Rubin
新版Rubin CPX的核心规格较此前方案出现明显变化。
在算力和功耗方面,新版CPX的性能已接近标准Rubin GPU,单卡最高功耗同样达到2300瓦。内存方面,新版CPX改用168GB HBM4显存,较此前方案的128GB GDDR7明显升级,但仍低于标准Rubin GPU的288GB HBM4。
按照郭明錤的说法,8卡CPX计算托盘的HBM4容量合计约1.34TB,能够覆盖大多数长上下文预填充工作负载及对应的KV Cache需求。这意味着,Rubin CPX并非单纯追求更高的通用算力,而是针对长上下文场景对显存容量和预填充效率进行了重新设计。
从共享机架转向独立部署,配置更加灵活
机架架构也是此次调整的重点。
此前方案中,CPX计划与Rubin GPU共享机架;新版则改为采用独立的MGX ETL机架,从而允许客户根据实际需求单独扩展CPX算力。
具体来看,客户可以选择64、128、192或256张CPX GPU的部署规模。每64张CPX GPU构成一个机架模块,包括8个计算托盘,每个托盘搭载8张CPX GPU,同时配备一个交换机托盘。
模块化设计意味着,客户无需按照固定的大规模Rubin机架进行采购,可以根据预填充负载的实际需求灵活增加CPX算力。
分层互联设计,降低预填充部署成本
在互联架构上,Rubin CPX采用分层设计,在性能与成本之间进行取舍。
在单个计算托盘内部,8张CPX GPU通过NVLink进行Scale-up扩展。每张CPX GPU的NVLink带宽为1至1.5TB/s,低于标准Rubin GPU的3.6TB/s。
在托盘之间以及机架模块内部的Scale-out层面,CPX采用Spectrum-6以太网全铜L1链路;跨机架模块连接时,则通过各模块的Spectrum-6交换机,经OSFP光纤链路完成互联。
相比完全依赖高带宽GPU互联的方案,这种分层架构更强调针对预填充场景进行成本优化。
与Rubin GPU协同,瞄准长上下文推理
Rubin CPX并不是独立运行的通用GPU,而是作为预填充加速器与Vera Rubin NVL72配套使用。
按照郭明錤的说法,英伟达推荐CPX与Rubin GPU按照1:1的比例部署:CPX负责预填充阶段的计算并生成KV Cache,随后通过以太网RDMA将KV Cache传输至Rubin GPU,由后者完成后续解码。
从产品定位来看,Rubin CPX的核心并不是取代标准Rubin GPU,而是将AI推理流程进一步拆分,让不同GPU分别承担预填充和解码任务。
郭明錤将其定位为“长上下文预填充的最佳性价比方案”。随着AI模型上下文窗口不断扩大,预填充阶段的计算量和KV Cache规模持续增长,英伟达此次重启CPX项目,或正是试图通过专用硬件和异构部署方式,进一步降低长上下文推理的成本。
风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。