記事のサマリー(TL;DR)
- Multiverse Computingがイジングガラス(Ising glass)へのマッピングによりLLMのブロック除去を定式化。Llama-3.3-70Bの50%圧縮でMMLUが約23ポイント向上
- 各トランスフォーマーブロックを「スピン変数」として扱い、ブロック間の相互作用(カップリング)をヘッセ行列で捉えることで組合せ最適化問題に変換
- タブーサーチなどの古典・量子インスパイア型ソルバーが秒単位で良質な解を生成。コードはOSSとしてGitHubで公開済み
生成AI導入・モデル圧縮を検討する国内エンジニア・情シスへの示唆
LLMをオンプレ・エッジで推論させたい日本企業にとって、モデルを「小さくしながら賢さを保つ」技術の選択肢は今後ますます重要になります。本手法は量子化・低ランク圧縮(SVD)・幅プルーニングと組み合わせられるパイプライン設計になっており、既存の圧縮スタックへの追加が容易です。Llama系やQwen系といった商用・OSSモデルで検証済みであるため、国内でこれらのモデルを業務利用している場合は直接参考になります。また、NVIDIA-Nemotron-3-Nano-30B-A3BのようなMamba2・MoE混在のヘテロジニアスアーキテクチャにも適用できる点は、最新のハイブリッドモデルを評価している開発チームに刺さるポイントです。コードが公開されているため、自社モデルへの実験的な適用も現実的な選択肢に入ります。
詳細
「どのブロックを削るか」は多体問題である
大規模言語モデル(LLM)を高速化する最も安価な方法の一つが、トランスフォーマーブロックごと削除する「ブロック除去(深さ方向プルーニング)」です。モデルが物理的に短くなるため、推論高速化とメモリ削減が同時に見込め、量子化や低ランク圧縮とも組み合わせやすい特徴があります。
問題は「どのブロックを削るか」の決定です。間違えるとモデルが崩壊しますが、あるブロックを削る影響は他のブロックを同時に削るかどうかに依存します。つまりこれは「ランキング問題」ではなく「組合せ最適化問題」です。
既存手法の多くはブロックを個別にスコアリングし、重要度が低そうなものから削除するアプローチを取ります。物理学の言葉を借りれば「平均場法(mean-field)」であり、各ブロックの寄与が他から独立していると仮定します。また「連続したひとかたまりのブロック列を削除する」という単純化で探索空間を狭める手法もあります。
しかし実際のブロック間には相互作用(カップリング)が存在します。ブロック20を削る影響は、ブロック19や24を同時に削るかどうかで変わります。モデルが深くなるほど、こうしたカップリングを無視することで品質が犠牲になります——特に多数のブロックを一度に削除する「深層圧縮」領域では顕著です。
イジングガラスへのマッピング:エネルギー最小化としてのブロック選択
Multiverse Computingの論文「LLM Compression by Block Removal with Constrained Binary Optimization」は、この問題を物理学の枠組みで正確に再定式化します。
各トランスフォーマーブロックに2値変数を割り当てます(0=保持、1=削除)。これはスピンが上下を向く「イジングスピン」と同じ構造です。次に、これらの変数に対してモデルの損失関数の2次テイラー展開を行うと、ヘッセ行列(Hessian matrix)が得られます。
- 対角成分:各ブロック単独の重要度
- 非対角成分:ブロック間のペアワイズカップリング(平均場法が捨てていた多体の物理)
この定式化により「削除するM個のブロックをどう選ぶか」は「エネルギー xᵀH⁰x を最小化するスピン配置を探す」問題に変換されます。数学的には制約付き2値最適化(CBO)問題であり、物理的には「固定磁化(削除数固定)を持つ全結合イジングガラス」に対応します。
重要な性質として、このエネルギーは「実際に圧縮したモデルのベンチマーク性能」の強力なプロキシとして機能します。つまり、スピン系の低エネルギー状態=高品質な圧縮モデル、という対応が成立します。
コストと実用性
ヘッセ行列(全カップリング)の計算は、小規模なキャリブレーションデータセット上での順伝播・逆伝播1回分で済みます。いったん計算すれば、候補配置の評価は安価なエネルギー計算1回のみ——実際にモデルを動かす必要はありません。またカップリングは圧縮率に依存しないため、同じヘッセ行列をさまざまなMの値に再利用できます。
探索戦略は2段構成です。
- ブルートフォース:GPUで数百億の配置を列挙。Llama-3.3-70Bの80ブロック中8ブロック削除(約290億通り)でも約2日で完走。
- 古典・量子インスパイア型ソルバー:QUBO形式(制約をペナルティ項に吸収)に変換し、量子アニーリング・QAOA・タブーサーチ・分枝限定法などの既存ソルバーに渡す。オープンソースのタブーソルバーが最も困難なケースでも秒単位で低エネルギー状態に収束。
重要な設計哲学として、著者らは「真の基底状態(ground state)を見つける必要はない」と述べています。いくつかの良質な低エネルギー状態が素早く得られれば十分であり、これは従来の最適化ソルバーが求める要件より大幅に緩いため、軽量なソルバーが実用的に機能します。
励起状態の重要性:「17番目の興奮状態」の逆転劇
エネルギーはあくまでプロキシであり完全ではないため、最低エネルギー状態が最高性能の圧縮モデルとは限りません。これは「バグ」ではなく「フィーチャー」です。ハミルトニアンが確立したあとは、基底状態だけでなく低励起状態のスペクトル全体を読み出すコストはほぼゼロです。複数の候補圧縮構成が得られるため、実運用での堅牢性が増します。
具体例:Llama-3.1-8B-Instructで16/32ブロック削除の場合、上位20の低エネルギー状態のほとんどは後半ブロックを削除しており、従来の直感と一致します。しかし17番目の励起状態だけは「モデル前半のブロック」を1つ削除することを提案しており、軽い再学習(ライトリトレーニング)後に複数のベンチマークで基底状態を上回ります。「最良の圧縮は中盤〜後半の連続したブロックを削ることだ」という通説を直接反証する結果です。
ベンチマーク結果
Llama-3.1-8B-Instruct、Qwen3-14B、Llama-3.3-70B-Instructの3モデルで検証しています。
| モデル | 削除ブロック数 | 手法 | MMLU |
|---|---|---|---|
| Llama-3.3-70B-Instruct(元モデル) | 0/80 | ─ | 82.2 |
| Llama-3.3-70B-Instruct | 32/80 | CBO(本手法) | 76.6 |
| Llama-3.3-70B-Instruct | 32/80 | Block Influence | 59.3 |
| Llama-3.3-70B-Instruct | 40/80 | CBO(本手法) | 76.9 |
| Llama-3.3-70B-Instruct | 40/80 | Block Influence | 54.0 |
再学習なしで40/80(50%圧縮)を達成した際、CBOはMMLUを約77に維持する一方、最強のベースラインは54まで低下。差は約23ポイントに達します。Qwen3-14Bでは12/40削除時にMMLUで約10ポイントのリード。軽度の圧縮では各手法は同等ですが、深層圧縮になるほどカップリングの考慮が効いてきます。
ヘテロジニアスアーキテクチャへの汎用性
NVIDIA-Nemotron-3-Nano-30B-A3B-FP8(Mamba2・アテンション・混合専門家層(MoE)をインターリーブしたハイブリッドモデル)にも再学習なしで適用。MoE層2〜3個またはアテンション層2個の削除において、AIME25・GPQAベンチマークでBlock Influenceを上回る構成を発見しています。イジング定式化はカップリングを扱うだけで、ブロックの種類は問わないため、均質でないアーキテクチャにも自然に転用できます。
オープンソース公開
コードはGitHubの CompactifAI/Block_removal_through_constrained_binary_optimization リポジトリで公開されており、Taylor展開の導出・QUBOマッピング・ソルバーベンチマーク・キャリブレーションデータセットのアブレーション・完全な結果テーブルは論文全文(Hugging Face)で参照できます。