AI工具AI评分 一般 (62)AI 中文改写

让知识蒸馏成本降至可规模化运行

1 小时前 2 阅读来源:HuggingFace Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

知识蒸馏(Knowledge Distillation)正成为大模型压缩与部署的关键手段,但其高昂的训练成本长期制约着规模化应用。HuggingFace 博客近日发布的一项研究提出两项系统性优化,将蒸馏过程的显存占用从约250GB降至128GB,使得原本需要数百块GPU才能完成的训练,如今在单张H200显卡上即可运行,为长上下文修复和大规模实验铺平了道路。 这项研究的背景在于,开源大模型如gpt-oss、Qwen、GLM或Kimi的规模持续膨胀,部署成本水涨船高。以Kimi-K3为例,其拥有2.8万亿参数,仅加载就需要约3TB显存。因此,业界普遍采用蒸馏技术,将大模型(教师模型)的能力压缩进小模型(学生模型),Nvidia的Nemotron 3 Puzzle 75B和Multiverse Computing的Hypernova 60B便是近期代表。然而,蒸馏环节本身是管线中最昂贵的一步:传统在线蒸馏需同时加载教师和学生模型,并为每个token生成全词表概率分布,这要求数百块GPU和精细的张量并行策略,显存峰值常突破单卡极限。 论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》直击痛点,提出两项核心改动。第一,离线蒸馏:教师模型只需运行一次,将其每个位置的前100个最可能token的logits缓存下来,训练时学生模型仅对照缓存学习,教师模型无需常驻显存,且缓存可复用于多次消融实验。第二,融合分块KL损失:传统KL散度计算需构建词表大小×序列长度的完整矩阵,例如gpt-oss-120b的词表达201,088个token,在序列长度32K、批大小4时,单个教师概率张量就占用约50GB显存,加上梯度、激活和优化器状态,单次迭代峰值可达250GB,远超H200的141GB容量。新方法通过分块处理数据,避免了全矩阵的物化,峰值显存降至约128GB,低于单卡上限。 这两项改动叠加,使蒸馏训练成本大幅下降。研究者指出,这不仅让长上下文“愈合”(healing)成为单GPU上的可行任务,也让大规模实验变得经济实惠。对于中国跨境电商卖家和AI从业者而言,这意味着模型压缩不再是大厂专属游戏——中小团队也能以更低硬件门槛微调和部署高性能小模型,从而在成本敏感的场景中快速迭代,例如优化推荐系统、客服机器人或本地化内容生成。不过,离线蒸馏的代价是牺牲了在线蒸馏的实时交互性,教师分布被截断至top-100,可能影响极端尾部的学习精度,但研究团队认为,在多数实际任务中,这一取舍带来的效率提升远大于精度损失。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · HuggingFace Blog

内容版权归原作者及 HuggingFace Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容