英伟达路由库让智能体任务成本降67%
IT时代网8月12日消息,当地时间8月11日,英伟达针对DGX与RTX系统放出一批AI更新,涉及模型、路由工具和视频生成等多条线。
最直观的一项是推理速度。Meta开源的Muse Glimmer模型(300亿参数稠密架构)针对英伟达平台做了深度优化,在RTX 5090上的推理速度超过每秒200个token。
同期发布的NeMo Switchyard是一个开源路由库,作用是按任务复杂度、成本和延迟,为智能体工作流的每一步动态挑选最合适的模型。英伟达给出的数字是,智能体任务成本可降低67%;内部测试显示,在保持前沿水平准确性的前提下,任务成本能压到单独使用Opus 4.8的近三分之一。LangChain那边报告的结果是,跨145个多轮Deep Agent任务实现74%的成本下降。
模型阵容里还有一款主打效率的开源模型Nemotron 3.5 Lightning,300亿参数MoE架构,官方称其token生成速度是同类模型的4倍,智能体任务完成时间缩短30%。该模型采用开放权重,开发者可以用自有数据微调,也能直接跑在RTX PC、DGX Spark、DGX Station和Jetson平台上。
视频生成方向,LTX 2.5开源视频模型新增了多镜头生成与生成式编辑。跑在英伟达RTX GPU、DGX Spark和DGX Station上时,性能提升2倍,显存占用少了40%。另有一组对比数据:RTX 5090在Wan-Animate-2模型上相比苹果M3 Ultra,最高带来26倍性能优势。
硬件平台侧同步升级。Sync Cluster Assistant支持把多台DGX Spark组成高速集群,Sync Resource Monitor则提供单系统或整个集群的CPU与GPU实时及历史视图。目前英伟达RTX平台已全面支持Cosmos 3 Edge、MiniMax-H3、DeepSeek V4-Flash等多款开源模型。

注:本文中包含AI辅助创作的内容。