量化感知修复:4位压缩模型超越全精度原版
11 小时前 1 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
大模型压缩与量化,一直是部署成本优化的核心手段,但“压缩后性能下降”几乎是行业默认的代价。传统流程通常是先剪枝(去掉层、头或神经元)再量化(将权重降至4位),虽然能大幅降低显存和算力需求,但模型在推理、数学和代码生成等关键能力上会系统性退化。为此,业界普遍会在部署前加入一个“恢复”步骤,业内俗称“healing”,试图修复损伤。近期开源的gpt-oss、英伟达Nemotron系列等模型,都依赖这种“先压缩再修复”的路线。
然而,HuggingFace博客最新发布的一篇论文却提出了一个颠覆性结论:通过一种名为“量化感知修复”(Quantization-Aware Healing,简称QAH)的新方法,一个被压缩至60B参数并量化为4位的模型,竟能在9项基准测试中的7项上,击败其未压缩、全精度(bfloat16)的原始版本。这意味着,4位模型不仅体积更小、运行成本更低,准确率反而超越了它量化前的“母版”,彻底反转了以往“4位模型必然逊于16位模型”的固有认知。
为什么传统修复方法在此失效?关键在于现有恢复手段的局限。目前主流的修复方案是“量化感知训练”(QAT),它通过在模型前向传播中插入模拟量化算子,并继续在任务损失上微调,让权重适应低精度表示。但QAT成本极高,需要重跑昂贵的多阶段后训练流程(如监督微调、RLHF等),且训练时间过长容易不稳定。另一种方案是“量化感知蒸馏”(QAD),它用一个冻结的全精度教师模型,通过KL散度损失直接蒸馏量化后的学生模型。这在仅做量化时效果不错,因为存在同架构的全精度版本可作教师。但一旦模型经历了结构压缩(层、头、神经元减少),就不存在独立训练的全精度小模型了,唯一可用的教师是恢复后的bfloat16检查点,而它本身也是原始模型的蒸馏近似物。以此为目标,量化学生模型的天花板就被锁定在恢复检查点的性能上限,无法突破。
QAH的核心突破在于改变了蒸馏对象:它直接蒸馏自压缩前的原始模型,而非恢复后的中间版本。教师与学生甚至无需共享架构——教师是全尺寸、全精度的原始大模型,学生则是压缩量化后的小模型。这种“跨架构蒸馏”绕开了恢复检查点的性能瓶颈,让量化学生模型能直接学习原始模型的完整知识。实验证明,当QAH应用于GPT-OSS 120B模型(压缩至60B并量化为MXFP4)时,最终模型在多数基准上反超了全精度原版。这一发现为跨境电商卖家和大模型应用开发者提供了新思路:在追求极致推理成本的同时,不必再以牺牲核心能力为代价,未来部署高性价比模型或将有更优解。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
