英伟达Vera Rubin NVL72首秀MLPerf推理测试

IT时代网9月16日消息,MLPerf Inference v6.1测试结果公布,英伟达首次提交Vera Rubin NVL72的预览成绩,在DeepSeek-R1与Qwen3-VL两项负载上给出了数据。

在Qwen3-VL上,Vera Rubin NVL72在离线、服务器和交互三种场景下的吞吐量最高达到GB300 NVL72的3.7倍,测试使用vLLM与英伟达Dynamo开源推理框架完成。在DeepSeek-R1上,使用TensorRT-LLM库时吞吐量最高为GB300 NVL72的2.5倍。英伟达称,这些早期结果显示出其创新节奏正在加快,后续还会通过持续的软件优化继续提升。

性能提升来自软硬件的全栈协同设计。Vera Rubin增强了张量核心与Transformer引擎,加快推理的预填充与解码阶段;NVFP4精度降低了模型权重、注意力与KV缓存的内存占用,在几乎不损失输出质量的前提下提高吞吐。此次提交大量采用分离式服务架构,把预填充与解码拆开,并配合大规模专家并行,以提升DeepSeek-R1、Qwen3-VL这类混合专家模型的运行效率。

这些技术要在机架尺度见效,靠的是NVL72的扩展域——由第六代英伟达NVLink与NVLink Switch提供,数据包速率比通用以太网高10倍,延迟低三分之二。英伟达表示,同一套基础设施可以运行任意模型、任意负载,从训练到推理、从推荐到语言与视频,从而保持较高利用率;对用户而言,单个机架能产出更多Token、服务更多用户,同时降低单Token成本。

编辑:林一舟

THE END