像物理学家一样剪枝 LLM:把块删除当成 Ising 优化问题
整块删掉 transformer block 最省事,挑哪些块却是多体问题。Multiverse Computing 把它写成二元优化,用 Ising 的低能态对应高分模型,Llama-3.3-70B 砍半深度仍保住 MMLU 76.9。
中文
复制

让大语言模型变快,最便宜的办法之一也最粗暴:直接删掉整个 transformer 块。模型真的变短了,所以块移除(也叫深度剪枝)除了省内存,还能带来可预期的推理加速,而且能和量化、低秩压缩等手段干净地叠加。难的是决定该砍_哪些_块。砍错了模型直接崩掉;而且移除任意一块的效果,取决于你同时移除了哪些别的块,选择之间是相互作用的。这让它成了一个组合问题,而不是排序问题——而带有相互作用二元变量的组合问题,正是自旋系统的物理天生要描述的东西。
我们最新的论文 LLM Compression by Block Removal with Constrained Binary Optimization 把这个对应关系当真了。我们把块选择重新表述为一个约束二元优化(CBO)问题,它直接对应到一个 Ising glass:一种全连接相互作用、且“向上”自旋数量固定的无序自旋系统。这个自旋系统的能量,最终被证明是剪枝后模型在基准上实际得分的一个很强、很便宜的代理指标。这意味着我们无需跑任何基准,就能给海量候选配置排序,并把其中的困难实例交给我们 Multiverse 一直在用的那些经典和量子启发式求解器。在深度压缩区间,收益很大:对 Llama-3.3-70B-Instruct 做 50% 压缩时,我们在 MMLU 上比最好的同类块移除方法高出将近 23 个百分点。
为什么挑块是个多体问题
现有的大多数块移除方法都是单独给每个块打分,然后删掉看起来最不重要的那些,用的是幅度、敏感度或“块影响”这类启发式。用物理的话说,这些是_平均场_方法:它们把每个块的贡献当成与其他块无关,就像平均场理论把一个自旋的邻居替换成一个平均场。另一个相关的捷径是只移除一段连续的块,这样问题规模小了,但搜索空间的大部分也被丢掉了。
问题在于,block 之间并不独立,正如真实磁体中的自旋并不独立。移除 block 20 是否会损害模型,取决于你是否同时移除了 block 19 或 block 24——这是两个决策之间的相互作用,即耦合。模型越深、越异构,忽略这些耦合就越会白白损失质量,尤其是在你想一次性移除大量 block 的时候。你真正想要的是在 block 的组合空间上搜索,同时考虑它们之间如何相互作用,但组合数量呈指数增长,暴力枚举看起来毫无希望。而这恰恰是统计物理工具大显身手的领域:指数级巨大的构型空间,外加两两耦合。
思路:把 block 选择变成能量最小化问题
我们给每个 transformer block 附加一个二值变量:0 表示保留,1 表示移除,就像一枚可以朝下或朝上的自旋。然后我们对模型损失关于这些变量做二阶泰勒展开,得到一个(近似的)Hessian 矩阵。该 Hessian 的对角线是每个 block 各自的重要性;非对角项正是 block 之间的两两耦合,也就是平均场方法所丢弃的多体物理。
这一改写把“我该移除哪些 block?”变成了一个干净的优化问题:在恰好移除 N 个 block 中的 M 个的约束下,找到使能量 xᵀH⁰x 最小的那组 M 个 block。在数学上,这是一个带约束的二值优化问题;在物理上,它是一块 Ising 玻璃——一个全连接的耦合自旋系统,且磁化强度守恒(固定的移除数量扮演固定总自旋的角色)。我们确立的关键性质是:这个能量是下游质量的强代理指标——自旋系统的低能态对应高性能的剪枝模型。 最小化能量与最大化基准分数由此成为同一次搜索。
块选择由此变成一个带约束的二元优化问题,等价于寻找 Ising 玻璃的低能态;每一个解都对应从 N 个块中删除哪 M 个。右图:我们为每个块的残差路径插入耦合变量 α,用来构造 Hessian。来源:论文图 1。
这套方法之所以实用,原因在于成本。Hessian,也就是全部耦合,只需计算一次,来自在一个小型校准数据集上的前向与反向传播。此后评估任何候选配置都只是一次廉价的能量计算,不必运行真实模型,更不必做基准测试。而且耦合与压缩目标无关,同一个 Hessian 可以复用来求解许多不同的 M。
求解:能精确就精确,不能就用量子或量子启发式方法
对大多数模型来说,配置空间很大但仍可穷举。由于计算一次能量足够便宜,我们在单张 GPU 上暴力搜索,最多可检查数百亿种自旋配置。几百万种只需几秒;这里最难处理的可行情形——从 Llama-3.3-70B 的 80 个块中删除 8 个(约 290 亿种配置)——花了大约两天。
再往上,精确方法就失效了,而这正是把问题写成 Ising 玻璃第二次带来回报的地方。在等价的 QUBO 形式下(约束被吸收进惩罚项),完全相同的任务可以交给为这类 Hamiltonian 打造的高度优化的经典、量子与量子启发式求解器:量子退火、QAOA、tabu search,以及专门的 branch-and-bound。我们发现,一个开源 tabu 求解器能在_几秒_内可靠地到达最低能量态,即使是在我们能用暴力搜索验证的最难情形上也是如此。因此,对于枚举配置根本不可行的模型,这套方法依然能扩展,用的正是 Multiverse 主场的求解器。
这里有一个微妙但重要的点,它与优化的惯常思路相反。通常评判一个 CBO 或退火求解器,看的是它能否找到真正的基态。我们其实不需要基态。我们需要的是快速生成少量优质低能态,这个门槛低得多,也正因如此,轻量级求解器对我们效果很好,我们也有余力同时跑好几个。
为什么整个低能谱都很重要
能量是质量的强代理指标,但并不完美,所以能量最低的单一状态并不总是最佳模型。事实证明这是一个特性,而非缺陷:一旦哈密顿量建立起来,读出基态以及低激发态几乎是免费的,从而给出一系列高质量候选剪枝供你尝试,而不是一个脆弱的答案。探索激发态而不只是基态,本身就是物理学中一个活跃的研究领域,而且它恰好对应了从业者在这里的实际需求。
一个具体的例子:对于 Llama-3.1-8B-Instruct,在移除 16/32 个块时,大多数排名靠前的状态都倾向于剪掉模型末尾的块,这与先前工作的预期一致。但第 17 个激发态是第一个提议移除模型开头附近某个块的,经过轻度重训练后,该配置在多个基准测试上超过了基态。这直接推翻了「最佳剪枝是一段连续的中后部块」这一常见假设,也说明了为什么尊重问题的完整多体结构是有回报的。
左:能量最低的 20 个状态各自移除了哪些块(红色 = 已移除)。右:第 17 个激发态移除了一个靠前的块,重训练后在多个基准测试上击败基态。最佳模型是一个激发态,而非基态。来源:论文图 2。
结果
在 Llama-3.1-8B-Instruct、Qwen3-14B 和 Llama-3.3-70B-Instruct 上,我们的方法(CBO)与最先进的块移除基线持平或更优,而且压缩越激进,差距越大。
最明显的优势来自 Llama-3.3-70B-Instruct 的深度压缩,且未经过重训练。在移除 80 个块中的最多 24 个时,CBO 与 block influence 大致持平。但在 32/80 和 40/80 时,它决定性地领先,在最深设置下 MMLU 优势接近 23 分,并在我们测试的每个基准上都击败了基线。对于 Qwen3-14B,在移除 12/40 个块时,CBO 在 MMLU 上领先约 10 分。在较轻的压缩下,各方法表现相当,这在意料之中:耦合关系在你切得越深时才越重要。
| Llama-3.3-70B-Instruct,未经重新训练 | 移除的块数 | MMLU |
|---|---|---|
| 原始模型 | 0 | 82.2 |
| CBO(我们的方法) | 32 / 80 | 76.6 |
| Block influence | 32 / 80 | 59.3 |
| CBO(我们的方法) | 40 / 80 | 76.9 |
| Block influence | 40 / 80 | 54.0 |
在 40/80(50% 深度)时,CBO 将 MMLU 维持在 77 附近,而最强的基线已跌至 50 多。来源:论文表 2。
它不只适用于稠密 Transformer
在现代异构架构上,移除块要困难得多,因为不同类型的块交错排列,而 Ising 形式化并不在意这些:无论每个位置上坐的是哪种块,耦合就是耦合。为了对这一点进行压力测试,我们将该方法用于 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8——这是一个混合模型,以非均匀的模式交错堆叠 Mamba2、注意力和混合专家(MoE)层——全程未做任何重新训练。
我们的形式化没有任何地方假设堆栈是同质的,因此它能直接迁移过去。移除 2–3 个 MoE 层或 2 个注意力层时,CBO 找到的配置在 AIME25 和 GPQA 上均优于 block influence。结果也证实,这些混合模型中的冗余确实存在,但分布并不均匀:有些专家层远比其他的更容易舍弃,而该方法之所以能找到好的切割点,靠的正是搜索耦合配置空间的能力。即便在这里,稠密模型上的规律依然成立:最优配置往往是激发态,而非基态。
为什么这适合 Multiverse Computing
把一个杂乱无章的机器学习问题重新表述为 Ising 哈密顿量,再用为物理学打造的经典与量子启发式优化工具去求解,这正是 Multiverse 的拿手好戏,也是贯穿我们整个压缩技术栈的同一套思路。而块移除能与技术栈中的其他部分组合使用——量化、低秩/SVD 压缩、宽度剪枝,以及基于知识蒸馏的修复——因此它是嵌入一条更大的流水线,而非与之竞争。
想要完整的技术细节,包括泰勒展开推导、QUBO 映射、求解器基准测试、校准数据集消融实验,以及完整的结果表格?请在 Hugging Face 上阅读全文,或联系我们的团队,聊聊如何把它用到你自己的模型上。代码已开源在 github.com/CompactifAI/Block_removal_through_constrained_binary_optimization。

