AI评分 一般 (65)AI 中文改写
同集群利用率增33点:变化仅在顺序
6 小时前 2 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
同一集群,利用率提升33个百分点:变化的只是调度顺序
GPU利用率,正在成为企业AI落地过程中比模型智能更棘手的瓶颈。Dharma-AI团队在一篇新发布的技术博客中,给出了他们应对这一瓶颈的实战方案:一个感知约束条件的GPU分配器,在与FIFO(先来先服务)调度器的对比测试中,在完全相同的硬件上运行完全相同的工作负载,GPU利用率最高提升了33个百分点,优先级加权产出在全部七个测试场景中均有提升,最高增幅达105%。硬件没有任何变化,变化的只是分配决策的顺序。
这个问题的根源在于,企业AI集群中的工作负载并非单一类型,而是由四种截然不同的任务构成:训练、实时推理、批量推理和量化。它们对GPU资源的需求形态完全相反——训练、批量推理和量化属于批处理型任务,一旦启动就需要连续占用一组GPU直到完成,不能中断;而实时推理则是弹性需求,随着流量波动每时每刻都在变化。两种不兼容的资源占用形态在同一时刻竞争同一批硬件,这就是调度难题的核心。更复杂的是,即便是同一类型的训练任务,时长从几小时到几天不等,所需GPU数量也从一块到几十块不等,这种内部异构性进一步加剧了调度难度。
FIFO调度器在集群空闲时表现尚可,因为无论顺序如何,所有任务都能被容纳,利用率没有损失。但一旦出现资源争抢,FIFO的代价就变得明显,而且体现在两个层面。首先是预留问题:实时推理不能等待容量,GPU必须在流量到来时即刻可用。FIFO调度器无法在流量低谷释放GPU并在下一个高峰前收回,因此唯一保证可用性的方式就是按照每个实时应用一天中的最大需求预留GPU,并全天持有。一个中午需要六块GPU、凌晨四点只需要两块的应用,会全天占用六块GPU,其中四块空闲的GPU一整天都无法被任何批处理任务使用。它们既没有被使用,也没有被释放。这正是两个以预留为主的测试场景中基线利用率仅略高于一半的原因——混合控制场景为51.6%,训练密集型场景为53.6%。整个集群约有一半资源被闲置,其中大部分是预留而非空闲。
Dharma-AI团队将调度问题形式化为一个精确的决策:在每一个时间步,每一块GPU应该运行哪个任务、以什么优先级运行。这是一个GPU、任务和时间步的三维组合,每个组合都是一个二元选择,最终输出是一个网格——整个调度周期内每块GPU的占用情况。他们开发的约束感知分配器正是针对这个决策空间进行优化,在保证实时推理弹性的同时,最大化批处理任务的资源利用率。团队强调,这个问题的本质不是"让GPU保持忙碌"这种模糊目标,而是更具体也更困难的抉择:哪块GPU在哪个时间步运行哪个任务、以什么优先级运行。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
