AI评分 一般 (63)AI 中文改写

MetaRoCE:为AI级以太网打造的新型RDMA传输

9 小时前 1 阅读来源:engineering.fb.com

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

Meta发布全新RDMA协议MetaRoCE:专为AI级以太网打造,百万GPU集群不再“卡脖子” Meta日前通过开源计算项目(OCP)正式发布了MetaRoCE的完整技术规范、参考软件实现及合规性测试套件。这是一套从零设计的RDMA(远程直接内存访问)传输协议,目标非常明确:让普通商用以太网在百万GPU规模的AI训练和推理场景下,跑出媲美甚至超越专用InfiniBand网络的性能。Meta在官方博客中直言,这套协议的核心思路是“网络只看数据包,网卡读懂意图”,将传统依赖交换机保证无损传输和报文顺序的“网络智能”,彻底下沉到服务器端网卡上。 为什么Meta要另起炉灶做一套新协议?这背后是AI基础设施演进的一个关键矛盾。过去几年,Meta已经用RoCE(RDMA over Converged Ethernet,基于融合以太网的远程直接内存访问)技术支撑起了数十万GPU规模的分布式训练集群,横跨多个数据中心和区域。但在实际运营中,标准RoCE协议对网络提出了极其苛刻的要求:它假设网络必须无损、必须按序交付每一个数据帧,为此依赖PFC(优先级流控制)机制,并且排斥在多层网络中能显著提升性能的数据包喷洒(packet spraying)技术。问题在于,当集群规模冲向百万GPU时,网络中的任何一点拥塞或链路抖动都会被无限放大——集体通信操作(如all-reduce、all-to-all)需要同步数千个加速器,最慢的那条传输路径决定了整个训练任务的节奏;而在推理场景下,分布式模型分片之间的低延迟通信直接关系到数亿用户的响应体验。哪怕只有微小的网络摩擦,都意味着大量宝贵的算力被白白闲置。 MetaRoCE的设计正是为了破解这一困局。它不再要求以太网“假装无损”,而是坦然接受网络会丢包的事实,并通过三项核心技术重构传输逻辑。首先是原生支持乱序到达:MetaRoCE将数据包喷洒到多条细粒度的逻辑路径上,乱序到达被视为常态而非异常,每个数据包自带目的地信息,数据落地后直接写入最终内存位置,无需重排缓冲区,也不存在队头阻塞。其次是原生多路径能力:每条连接都拥有独立的一等路径,数据包按包粒度喷洒,每个路径使用不同的UDP源端口作为ECMP(等价多路径)熵值,网卡可以随时更换端口以避开故障路由;由于每条路径独立维护自己的窗口和往返时间估算,传输层能清晰区分拥塞与故障,并主动进行负载均衡,一条链路过热或损坏只会拖慢该路径,而不会让整个连接卡死。第三是设计上的丢包容忍:协议通过256位选择性确认位图来精确标记丢包位置,无需依赖PFC或暂停帧,彻底摆脱了传统无损网络在规模扩展时的运维噩梦。 对于中国跨境电商卖家和AI从业者而言,MetaRoCE的发布释放了一个明确信号:AI基础设施的“网络底座”正在经历一场范式转移。过去,想要搭建大规模GPU集群,要么斥巨资采购InfiniBand专用网络设备,要么在以太网上忍受RoCE协议带来的种种调优痛苦。Meta此次将协议规范、参考实现和测试套件全部开源,意味着任何有能力的云服务商、大型互联网公司甚至硬件厂商,都可以基于普通以太网设备构建高性能的AI算力网络。这有望显著降低AI训练和推理的底层成本,尤其对于依赖云GPU租赁或自建中小规模集群的团队来说,未来或许能以更低的价格获得更稳定的分布式训练性能。当然,协议的开源只是第一步,网卡硬件是否跟进支持、交换机生态能否适配,仍需时间检验,但方向已经清晰:以太网正在成为AI时代算力互联的主流选择,而MetaRoCE正是推动这一趋势的关键落子。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · engineering.fb.com

内容版权归原作者及 engineering.fb.com 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容