2026年9月21日,Hugging Face Blog刊文介绍一项名为“LLM Compression by Block Removal with Constrained Binary Optimization”的研究,将大语言模型压缩中的块移除问题重新表述为约束二元优化(CBO),并映射为伊辛玻璃模型。作者称,在Llama-3.3-70B-Instruct达到50%压缩时,该方法在MMLU上比最佳竞争块移除方法提升近23个百分点。
文章指出,多数现有块移除方法先独立评估每个块的重要性,再移除看起来最不重要的块,依据包括幅度、敏感度或“块影响”等启发式指标。在物理语境中,这类做法类似平均场方法,把每个块的贡献视为与其他块无关;另一种捷径是只移除一段连续的块,问题规模虽小,却放弃了大部分搜索空间。
研究认为,块之间并不独立。移除第20块是否损害模型,取决于是否同时移除了第19块或第24块。模型越深、越异构,忽略这些耦合越会在压缩率提高时损失质量。需要在考虑块间相互作用的前提下搜索块组合,但组合数量随块数指数增长,穷举看似不可行。这正属于统计物理工具擅长的场景:指数级大的构型空间和两两耦合。
该研究为每个Transformer块设置二元变量,0表示保留,1表示移除。随后对模型损失关于这些变量做二阶泰勒展开,得到近似Hessian矩阵。对角线表示每个块单独的重要性,非对角元素表示块与块之间的两两耦合。由此,“应该移除哪些块”转化为优化问题:在N个块中恰好移除M个,使能量xᵀH⁰x最小。数学上这是约束二元优化,物理上则是全连接的伊辛玻璃,固定移除块数相当于固定磁化强度。作者称,低能量状态对应性能更好的剪枝模型,最小化能量与最大化基准得分成为同一个搜索。
文章强调,这一方法可行在于成本。Hessian即全部耦合只需从小型校准数据集上的前向和反向传播中计算一次。此后评估任意候选配置只需一次廉价的能量计算,无需运行实际模型,更无需跑基准测试。由于耦合不依赖压缩目标,同一个Hessian可复用于多个不同的M值。
对多数模型而言,构型空间虽大但仍可检查。由于单次能量计算足够便宜,作者在单块GPU上穷举,检查多达数百亿个自旋构型。数百万个构型只需数秒;文中称最困难的可行精确案例,是从Llama-3.3-70B的80个块中移除8个,约290亿种构型,耗时约两天。超出这一范围后,精确方法失效,而伊辛玻璃表述再次发挥作用。在等价QUBO形式中,约束被吸收进惩罚项,同一任务可交给为这类哈密顿量构建的经典、量子及量子启发求解器,包括量子退火、QAOA、禁忌搜索和专用分支定界。作者发现,开源禁忌求解器能在数秒内可靠达到最低能量状态,即便在可验证的最困难情形中也是如此。