AI工具AI评分 一般 (49)AI 中文改写

物理学家式修剪大模型:块移除视为伊辛优化问题

11 小时前 1 阅读来源:HuggingFace Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

用物理学方法给大模型做“减脂”,正在成为模型压缩领域一条值得关注的新路线。HuggingFace博客近日刊出的一篇论文提出,把大语言模型的“整块删除”问题重新表述为物理学中的伊辛模型(Ising model)优化问题,从而在深度压缩场景下取得明显优于现有方法的效果。研究团队来自Multiverse Computing,论文标题为《LLM Compression by Block Removal with Constrained Binary Optimization》(用约束二元优化做块删除的大模型压缩)。 所谓块删除,也叫深度剪枝,是让大模型跑得更快最便宜、也最粗暴的办法之一:直接删掉整个Transformer块,模型层数变少,推理速度的提升是可预期的,还能和量化、低秩压缩等技术叠加使用。难点在于删哪些块。删错了模型直接崩掉,而且删掉某一块的影响,取决于你同时还删了哪些块,各个选择之间是相互作用的。这让它本质上是一个组合优化问题,而不是简单的排序问题。而带有相互作用二元变量的组合问题,恰恰是自旋系统物理学最擅长描述的领域。 现有的大多数块删除方法都是给每个块单独打分,再删掉看起来最不重要的那些,用的是幅度、敏感度或“块影响力”这类启发式指标。用物理学的说法,这些属于平均场方法:把每个块当成独立贡献,就像平均场理论把一个自旋的邻居替换成一个平均场。另一种常见捷径是只删除一段连续的块,问题规模是小了,但搜索空间也被砍掉了大半。问题在于块与块之间并不独立,就像真实磁体里的自旋一样。删掉第20块会不会伤到模型,取决于你是否同时删了第19块或第24块,这就是两个决策之间的耦合。模型越深、越异质,忽略这些耦合就越会损失质量,尤其是在想一次性删掉很多块的时候。 研究团队的做法是给每个Transformer块配一个二元变量:0表示保留,1表示删除,就像自旋可以朝下或朝上。然后对模型损失做关于这些变量的二阶泰勒展开,得到一个近似的海森矩阵。海森矩阵的对角线是每个块单独的重要性,非对角线元素则正是块与块之间的两两耦合,也就是被平均场方法丢掉的多体物理信息。这样一来,“该删哪些块”就变成了一个干净的优化问题:找到一组M个块,使删除后的能量最小。这个自旋系统的能量,被证明是剪枝后模型在基准测试上实际得分的一个廉价而有效的代理指标,意味着可以在不做任何基准测试的情况下,对海量候选配置进行排序,再把最难的实例交给经典求解器或量子启发式求解器处理。 收益在深度压缩区间尤其明显。研究称,在Llama-3.3-70B-Instruct上做50%压缩时,该方法在MMLU上的成绩比最好的竞争性块删除方法高出近23个百分点。对需要在有限显存和推理成本下部署大模型的中国出海团队来说,这类“先算清楚再动刀”的压缩思路,可能比单纯堆硬件更值得跟进。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · HuggingFace Blog

内容版权归原作者及 HuggingFace Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容