GPU集群的高效调度
1 天前 1 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
AI2 用一套“预算制”调度系统,把 GPU 资源争夺从私下博弈变成了公开的行政分配流程。这家艾伦人工智能研究所的 AI 基础设施团队近日披露,他们管理着数千块英伟达 H100、B200 和 B300 GPU,集群规模从 88 块到 1024 块不等,服务约 150 名内部研究员,覆盖大语言模型和视觉语言模型训练、机器人强化学习仿真以及科学智能体后训练等多个方向。但需求远超供给——任意时刻,排队等待的 GPU 请求量是实际可用量的 2 到 3 倍,相当于每一块 GPU 的每一个小时,都有两三个研究任务在抢。
问题出在旧的优先级调度器上。团队允许任务选择“不可被抢占”,每个团队有并发 GPU 上限,但可抢占任务能在空闲 GPU 上超限运行。这套规则很快催生了典型的资源滥用:有人把空转的“占位”任务挂在集群里,需要时再连上去用,因为研究员发现正常启动调试任务的延迟太高,没法实时解决问题;优先级也出现通货膨胀,最终 100% 的调度任务都标成了“高优先级”,低优先级任务彻底拿不到 GPU 时间。更麻烦的是,由于抢占是可选项,值班工程师大部分工单响应时间都花在协调关闭那些跑在已知故障主机上的不可抢占任务。团队后来意识到,这本质上是一个“公地悲剧”的完美实验场——每个人都在争夺稀缺的共享资源,追求个体最优,结果却是全局次优,底层资源被滥用。
新方案的核心是把 GPU 时间变成一种可管理的预算。团队用 GPU 时间预算、分层公平份额分配和时间切片契约,替换了原来的优先级调度器。最直接的变化是:某个研究项目该分多少 GPU 时间,不再是一事一议的运营协调,而变成了透明的行政预算流程。对 AI 实验室和依赖大规模 GPU 集群的企业来说,这个案例的价值在于它揭示了一个常被忽视的事实——当算力稀缺到一定程度,调度问题就不只是技术问题,而是组织治理问题。靠优先级标签和抢占开关无法解决公平与效率的平衡,反而会催生占位、虚报优先级等博弈行为。把资源分配规则前置、透明化,让预算和份额说话,可能是比不断打补丁更可持续的做法。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
