AI评分 一般 (65)AI 中文改写

NVIDIA NVLink 6如何为AI工厂提供多层弹性

9 小时前 2 阅读来源:developer.nvidia.com

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

英伟达本周在其开发者博客上详细披露了NVLink 6互连技术的多层容错架构,这套方案瞄准的是大规模AI工厂最头疼的问题:在数万张GPU协同训练和推理的场景下,任何一次瞬态信号错误、链路降级或节点中断都可能让整个集群的算力利用率大幅下滑。对于动辄投入数十亿美元建设AI数据中心的运营商来说,这直接关系到收入——推理服务一旦非计划停机,可服务的请求总量就会立刻缩水;训练任务中一个丢包,就可能拖慢每秒数千次的梯度同步操作。 NVLink 6的应对思路是把容错做成硬件、系统设计和软件三个层面的完整堆栈,而不是靠单点修补。在最底层的物理层和链路层,NVLink 6通过前向纠错(FEC)、物理层重传(PLR)和通用物理层(UPHY)恢复机制来快速修正错误、稳定链路,同时用基于信用的流控(CBFC)从数学上杜绝丢包,并主动隔离故障防止其扩散。在系统层面,架构设计做到零单点故障:冗余交换托盘、分布式NMX控制器和双带外管理路径确保即使个别组件失效,整个域仍能继续运行。在应用和软件层面,Dynamo Shadow Engine Recovery利用预热好的副本进程实现近乎瞬时的故障切换,应用级检查点和恢复机制则保证长时间运行的任务不会丢失。 这套方案对应的硬件平台是英伟达的Vera Rubin NVL72机架级计算引擎,它把72颗Rubin GPU通过NVLink 6连接成单一扩展域,让它们像一颗芯片一样协同工作。英伟达强调,在AI工厂这种规模下,反应式协议和单点修复根本不够用,只有这种深度集成的多层容错架构,才能把硬件异常无缝控制住,让训练和推理负载不中断地跑下去——这也是当前超大规模AI基础设施对网络提出的硬性要求。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · developer.nvidia.com

内容版权归原作者及 developer.nvidia.com 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容