英伟达Vera Rubin NVL72树立AI智能体效率新标杆
2 小时前 2 阅读来源:blogs.nvidia.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
英伟达最新公布的实测数据显示,其新一代AI推理平台Vera Rubin NVL72在智能体(Agentic AI)工作负载下的能效表现惊人:每兆瓦吞吐量比上一代GB300 NVL72最高提升30倍,每百万token的处理成本则降低35倍。这一数据由英伟达使用SemiAnalysis的AgentX工作负载测得,该负载基于真实世界中的智能体编码会话记录,保留了上下文增长、工具调用和子智能体生成等完整流程。对于受电力约束的AI工厂而言,这意味着在相同能耗下可以完成30倍的智能体任务量。
为什么智能体工作负载如此消耗token?根据OpenRouter的数据,智能体AI的token消耗量是简单聊天请求的15倍。以AI智能体研究一家公司做投资决策为例:它需要查询财务数据库、搜索新闻和 filings、调用子智能体进行同行比较和估值建模,最后将所有信息综合成投资建议。智能体和子智能体会持续推理直到任务完成,每一步累积的token都成为下一步的输入,这使得长上下文处理成为智能体AI性能的核心。从软件开发到客户服务再到深度研究,这一模式在所有智能体用例中普遍存在。随着智能体AI在各行业进入生产环境,支撑它的基础设施必须高效满足这种token需求。
核心变化:智能体工作负载与传统的聊天或文档摘要截然不同,后者的输入输出序列通常在1K到8K token之间,而智能体会话中上下文会跨步骤累积,可达到数十万输入token,且每个请求的输入输出长度差异很大。因此,性能评估必须从单一推理请求扩展到完整的智能体工作流程。在SemiAnalysis AgentX测试中,英伟达Blackwell平台在Kimi K3、MiniMax M3、GLM5.3、Qwen3.5和DeepSeek V4 Pro等多个智能体模型上均展现出领先性能。例如,GB300 NVL72在DeepSeek V4 Pro模型上的每兆瓦吞吐量比Hopper架构高出15倍,这得益于更大的GPU扩展域和协同设计的软件带来的推理效率提升。
Vera Rubin进一步放大了这一优势,将整个帕累托曲线的性能都推高,在DeepSeek V4 Pro模型上实现比GB300 NVL72高30倍的每兆瓦吞吐量。这些早期结果尚未包含Vera CPU在工具调用方面的性能表现。英伟达的DSX MaxLPS技术可在GPU、机架和工作负载层面管理功耗,在相同兆瓦预算内多配置40%的GPU,进一步推动AI工厂规模的每兆瓦吞吐量提升。每兆瓦吞吐量直接影响每个token的生产成本,Vera Rubin NVL72每百万token成本比GB300 NVL72低35倍,这意味着客户可以在全工作负载范围内持续、大规模地运行智能体。对于受电力约束的AI工厂,每兆瓦吞吐量决定AI工厂的收入,每百万token成本则决定该收入的利润率。
现代推理优化涵盖一系列对智能体AI尤为关键的技术,英伟达Vera Rubin NVL72通过平台各层的极致协同设计实现了所有这些技术。随着软件持续优化,Vera Rubin NVL72和GB300 NVL72的性能都将继续提升,但Vera Rubin展现出的代际飞跃,标志着英伟达正在加速创新节奏,为智能体AI的大规模部署提供更高效的基础设施选择。对于中国跨境电商卖家和AI从业者而言,这意味着未来部署智能体客服、智能选品、竞品分析等应用时,算力成本有望大幅下降,智能体驱动的自动化运营将变得更加经济可行。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
