LFM2.5 Q4_0量化蒸馏检查点
3 天前 2 阅读来源:HuggingFace Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
Liquid AI今日发布了一项针对其LFM2.5系列模型的重要更新:通过量化感知蒸馏(QAD)技术训练的全新Q4_0检查点。这批新模型覆盖LFM2.5-230M、350M、1.2B-Instruct和2.6B四个尺寸,核心卖点在于——开发者可以在保持Q4_0量化格式低内存占用和高吞吐速度的同时,几乎不损失模型精度。根据官方数据,这些QAD检查点能够恢复BF16精度模型因量化而损失的平均准确率的97%左右,这意味着边缘设备上的AI推理体验将迎来一次显著的体验升级。
为什么这次发布值得关注?关键在于它解决了量化技术长期以来的痛点。传统上,将大模型压缩到4-bit精度(Q4_0)通常采用训练后量化(PTQ)方法,虽然能大幅降低内存和计算需求,但模型能力会明显缩水。Liquid AI的做法是改用QAD路线:让一个高精度的BF16教师模型在训练阶段直接“指导”一个量化后的学生模型,让后者在低比特状态下学习并保留更多知识。从基准测试结果来看,效果相当显著——在GPQA Diamond、MMLU-Pro、IFEval、BFCLv4等涵盖推理、指令遵循、工具调用和智能体能力的测试集上,QAD版本的Q4_0检查点相比PTQ版本有大幅提升,四个模型分别保留了BF16基线性能的97.1%、96.5%、97.4%和96.6%。
对跨境电商卖家和AI应用开发者来说,这意味着什么?最直接的价值在于成本与性能的平衡点被重新定义了。以实际硬件测试数据为例,在MacBook Pro、NucBox EVO-X2、三星Galaxy S26 Ultra和树莓派5这四类设备上,230M和350M的QAD Q4_0检查点在解码吞吐量上比Q5_K_M格式快4%到33%,而质量却与之持平;1.2B和2.6B版本则在比Q4_K_M快3%到14%的同时,质量同样不落下风。换句话说,你现在可以用更小的内存占用和更快的响应速度,在本地设备上跑出接近更高精度模型的效果,无论是做端侧客服机器人、智能选品分析还是实时数据处理,都能获得更流畅的体验。
目前,这些QAD Q4_0 GGUF文件已全部上架Hugging Face,开发者可以直接通过llama.cpp或任何支持GGUF Q4_0格式的运行时加载使用。对于正在探索端侧AI部署的团队来说,这是一个值得立刻上手测试的选项——毕竟,在保证质量的前提下把模型跑得更快更省,永远是工程优化的终极追求。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
