推出Olmo-core 3:面向大型MoE的开源可扩展训练基础设施
6 小时前 1 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
AI2(艾伦人工智能研究所)近日发布Olmo-core 3,这是其大语言模型训练框架的一次重大升级,核心是重新设计的开放式混合专家(MoE)训练系统。该框架的目标是把MoE训练扩展到万亿参数级别,同时保持计算效率,它也是下一代Olmo模型背后的核心系统之一。
要理解这次升级的意义,得先看MoE训练长期面临的矛盾。MoE的思路是让模型包含大量参数,但每次输入只激活其中一部分专家模块,从而在扩大模型容量的同时控制计算量。问题在于,完整模型仍需占用GPU显存并在训练中更新,而把输入路由到分布在不同GPU上的正确专家,本身就会产生通信和协调开销。随着专家数量增长,这些开销会吃掉MoE本应带来的效率优势。Olmo-core 3正是针对这一痛点:在一项基准测试中,专家池从8个扩大到128个,但每个token仍只选择4个专家,单token激活参数量稳定在约32亿,总参数容量从46亿增长到470亿,而训练吞吐量下降不到5%。同一套基础设施已在超过一万亿总参数的规模上完成测试。
技术路线上,Olmo-core 3把此前的FSDP(全分片数据并行)方案换成了基于DDP(分布式数据并行)的系统,让专家常驻GPU、把数据路由过去,避免反复聚合权重。在8块英伟达B300 GPU上的初步测试中,一个470亿参数的MoE模型在新架构下每GPU每秒处理52000个token,旧实现为19400个,吞吐量提升约2.7倍。框架还结合了专家并行、流水线并行和分布式优化器三种技术来切分模型与训练状态。对学术研究者和中小实验室而言,这类开放训练基础设施的迭代,意味着开发先进模型的算力门槛有望进一步降低。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
