返回深度
企业与商业2026-09-17 07:03:406 min readAione Editorial V4

英伟达Vera Rubin NVL72首秀MLPerf推理测试性能领先

英伟达Vera Rubin NVL72首次参加MLPerf Inference v6.1即取得领先性能,将直接影响大模型服务的部署成本与运行效率。

Aione AI 编辑部
Research · Writing · Review · Publishing
2026-09-17 07:03:40 6 分钟

MLPerf Inference v6.1测试结果公布,英伟达Vera Rubin NVL72首次提交成绩便在大模型推理负载中展现出显著优势。该芯片主打提升AI推理的经济性,其性能表现直接关系到大模型服务的部署成本与运行效率,也成为业界衡量新一代推理基础设施能力的重要参照[S1]。

核心性能表现 在本次MLPerf Inference v6.1测试中,Vera Rubin NVL72针对Qwen3-VL与DeepSeek-R1两项代表性负载提交了数据,且属于早期提交结果,后续还会通过持续的软件优化继续释放性能空间。其中在Qwen3-VL负载的离线、服务器和交互三种场景下,其吞吐量最高达到GB300 NVL72的3.7倍;在DeepSeek-R1负载下,使用TensorRT-LLM库时吞吐量最高为GB300 NVL72的2.5倍[S3][S4][S6][S12]。

Qwen3-VL测试使用vLLM与英伟达Dynamo开源推理框架完成,DeepSeek-R1则依托TensorRT-LLM库实现优化。英伟达方面表示,这些早期提交结果显示出其创新节奏正在加快,后续软件层面的迭代仍有进一步提升性能的可能[S6]。

软硬件全栈协同支撑 性能提升并非单一硬件升级的结果,而是来自芯片架构、精度优化、服务架构与互联基础设施的全栈协同设计。Vera Rubin强化了张量核心与Transformer引擎,专门加快推理的预填充与解码阶段;同时引入NVFP4精度优化,降低模型权重、注意力计算与KV缓存的内存占用,在几乎不损失输出质量的前提下提高系统吞吐量[S3][S4][S6][S12]。

本次MLPerf提交还大量采用分离式服务架构,将预填充与解码阶段拆开调度,并配合大规模专家并行技术,以提升DeepSeek-R1、Qwen3-VL这类混合专家模型的运行效率。对于参数规模庞大、专家数量众多的MoE模型而言,专家并行与阶段拆分能够更充分地利用计算与内存资源,避免单一环节成为瓶颈[S6]。

在机架级扩展层面,Vera Rubin NVL72的扩展域由第六代英伟达NVLink与NVLink Switch提供支撑。官方数据显示,其数据包速率比通用以太网高10倍,延迟低三分之二,从而保证多GPU协同处理大模型时的通信效率,避免互联成为系统短板[S3][S4][S6][S10][S12]。

产业价值与经济性 Vera Rubin NVL72是Vera Rubin平台的组成部分,该平台面向代理式AI和推理时代构建。一套Vera Rubin NVL72包含72个Rubin GPU、36个Vera CPU、ConnectX-9 SuperNIC和BlueField-4 DPU,可在统一基础设施上运行训练、推理、推荐、语言与视频等多种负载,从而保持较高的资源利用率[S9]。

对大模型服务提供商而言,更高的推理吞吐量意味着单个机架能够产出更多Token、服务更多用户,同时降低单Token成本。英伟达官方产品页基于Kimi-K2思考模型的预测数据显示,Vera Rubin NVL72每百万Token成本仅为GB200 NVL72的十分之一,每兆瓦Token数量最高达GB200 NVL72的十倍;训练MoE模型时所需GPU数量仅为GB200 NVL72的四分之一[S11]。

在第三方与合作伙伴测试中,CoreWeave针对DeepSeek-R1的基准测试显示,Vera Rubin每兆瓦吞吐量比Grace Blackwell NVL72提升10倍。英伟达韩国博客披露的SemiAnalysis AgentX代理式编码工作负载测试则显示,Vera Rubin NVL72相对GB300 NVL72每兆瓦吞吐量最高提升30倍,每百万Token成本最高降低35倍[S8][S10]。

目前Vera Rubin正全面迈向规模化量产,台湾地区服务器制造商与全球供应链正大规模制造基于Vera Rubin的系统,面向AI实验室、云服务商和超大规模数据中心供货[S9][S11]。

边界与待观察事项 需要注意的是,MLPerf推理测试成绩反映的是基准测试场景下的性能,实际生产环境中受模型类型、服务引擎、延迟目标、流量模式等因素影响,实际性能表现会存在差异。第三方分析也指出,Vera Rubin NVL72宣称的最高性能成本比优势依赖特定严苛运行条件,在更通用的服务速率下,优势会明显缩小[S7]。

此外,本次MLPerf测试仅覆盖Qwen3-VL和DeepSeek-R1两个模型,在其他主流大模型、尤其是传统单专家大模型上的性能提升幅度仍有待进一步验证。分离式服务架构和大规模专家并行等优化是否已全面对外开放、开发者可直接使用的时间节点,也值得持续关注。

参考资料 [S1] NVIDIA. Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut. https://blogs.nvidia.com/blog/vera-rubin-nvl72-mlperf-inference/ [S3] 热闻瞭望台. 英伟达Vera Rubin NVL72首秀MLPerf推理测试成绩显著. 搜狐. https://www.sohu.com/a/1077021128_122066679 [S4] 英伟达Vera Rubin NVL72推理测试显著提升性能. 搜狐. https://www.sohu.com/a/1077021328_122066678 [S6] IT时代网. 英伟达Vera Rubin NVL72首秀MLPerf推理测试. 网易. http://m.163.com/dy/article/L7023K8O05527PMU.html [S7] Aisha Washington. NVIDIA Vera Rubin NVL72 claims 67x better performance per dollar but the operating conditions matter. Remio. https://www.remio.ai/ja/post/nvidia-vera-rubin-nvl72-claims-67x-better-performance-per-dollar-but-the-oper-ja [S8] NVIDIA Korea. NVIDIA Vera Rubin NVL72 Sets New Standard for Efficiency in AI Agents. https://blogs.nvidia.co.kr/blog/vera-rubin-nvl72-efficiency-ai-agents-2/ [S9] NVIDIA. NVIDIA Vera Rubin 平台. https://www.nvidia.cn/data-center/technologies/rubin/ [S10] NVIDIA. NVIDIA Vera Rubin 提升每瓦性能,为全球合作伙伴实现最低 Token 成本. https://blogs.nvidia.cn/blog/vera-rubin/ [S11] NVIDIA. 机架级代理型 AI 超级电脑 | NVIDIA Vera Rubin NVL72. https://www.nvidia.com/zh-tw/data-center/vera-rubin-nvl72/ [S12] 财法观天下. 英伟达Vera Rubin NVL72首秀MLPerf推理测试,性能倍增. 搜狐. https://www.sohu.com/a/1077021326_122066678

Editorial dossier

制作记录

公开编辑轨迹,不含隐藏推理。

制作记录已完成审读
材料已核验公开资料经过整理
多方来源互证保留可追溯引用
文字完成审读编辑意见已被处理
制作记录文章已进入公开阅读

正在整理制作记录…

Reader Signal

这篇文章对你有帮助吗?

只收集预设选项,不开放评论,不公开展示个人反馈。

选择一个判断,也可以附加一个预设标签。

发布于 2026-09-17 07:03:40。本文由明确标注的 Aione AI 编辑 Agent 参与制作,未经授权不得转载,不构成投资建议。