記事のサマリー(TL;DR)
- Liquid AI が LFM2.5-230M/350M/1.2B/2.6B の QAD Q4_0 GGUF を Hugging Face にて公開
- Quantization-Aware Distillation(QAD)により、4ビット量子化による BF16 精度損失の平均97%以上を回復
- MacBook Pro・NucBox・Samsung Galaxy S26 Ultra・Raspberry Pi 5 での実機ベンチマークで、Q5_K_M / Q4_K_M 相当の品質を最大33%高いスループットで実現
国内エッジ AI 開発者・オンデバイス推論を検討する事業者が注目すべき点
エッジ推論のコスト削減において、量子化は不可欠な手段ですが、従来の PTQ(Post-Training Quantization)では精度劣化が課題でした。今回の QAD Q4_0 GGUFs は llama.cpp などの標準ランタイムでそのまま動作するため、既存の推論パイプラインへの組み込みに追加コストがほとんどかかりません。
国内では、製造業や医療・小売など、クラウド送信が難しいデータを扱うオンプレミス・エッジ環境での LLM 活用ニーズが高まっています。LFM2.5-1.2B クラスのモデルが Raspberry Pi 5 や Arm CPU 上で BF16 に近い品質で動くという事実は、IoT デバイスや組み込みシステムへの生成 AI 統合を検討する開発チームにとって具体的な選択肢となります。また、EC・SaaS のバックオフィス自動化においても、クラウド API コストを抑えたいケースでの自社ホスト型推論サーバー構成の候補として評価する価値があります。
詳細
QAD(Quantization-Aware Distillation)とは
QAD は、高精度な「教師モデル(teacher model)」から量子化済みの「生徒モデル(student model)」へ蒸留(distillation)を行う手法です。通常の PTQ が学習後にモデルを圧縮するのに対し、QAD は量子化誤差を考慮した状態でモデルを訓練するため、精度劣化を大幅に抑えられます。
今回リリースされた 4 つのモデルのいずれも、Q4_0 フォーマットのメモリフットプリントとスループットを維持しながら、BF16 ベースラインとの精度差を次の割合で回復しています:
| モデル | BF16 精度回復率 |
|---|---|
| LFM2.5-230M | 97.1% |
| LFM2.5-350M | 96.5% |
| LFM2.5-1.2B-Instruct | 97.4% |
| LFM2.5-2.6B | 96.6% |
ベンチマーク結果
評価には PTQ で生成した既存 GGUF と QAD Q4_0 チェックポイントを比較し、BF16 GGUF を上限値(ceiling)として設定しました。使用したベンチマークは以下の通りです:
- 推論(Reasoning): GPQA Diamond、MMLU-Pro
- 指示追従(Instruction-following): IFEval、IFBench、Multi-IF
- ツール利用・エージェント: BFCLv4
- 数学評価: GSM8K(230M・350M 向け)、AIME25(1.2B・2.6B 向け)
各ベンチマークは5回繰り返しの平均値を報告しており、QAD チェックポイントはすべてのモデルで PTQ を大きく上回る結果を示しました。
また、外部の強力な PTQ チェックポイントである Unsloth の UD-Q4_K_XL(230M・1.2B で対象)と比較しても同等の品質を達成しています。
エッジ実機でのスループット
以下の 4 デバイスで推論速度を計測しています:
- MacBook Pro(GPU 推論)
- NucBox EVO-X2(GPU 推論)
- Samsung Galaxy S26 Ultra(Arm CPU 推論)
- Raspberry Pi 5(Arm CPU 推論)
主な結果:
- LFM2.5-230M・350M の QAD Q4_0 は Q5_K_M と同等品質を維持しつつ、デコードスループットが 4〜33% 向上
- LFM2.5-1.2B・2.6B の QAD Q4_0 は Q4_K_M 相当の品質で 3〜14% 高いスループット を達成
つまり「より小さいモデルファイルサイズ+より高い処理速度+BF16 に近い精度」という三拍子を同時に実現しています。
使い方:llama.cpp での実行例
QAD GGUF は llama.cpp をはじめ Q4_0 アーティファクトに対応したあらゆる推論ランタイムで利用可能です。以下はコマンド例です:
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
入手方法
4 モデルすべての QAD GGUF は本日より Hugging Face 上で公開されています:
引用情報
本モデルを研究・論文で利用する際の推奨引用形式:
Liquid AI, “LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment”, Liquid AI Blog, Aug 2026.
@article{liquidAI2026Q40,
author = {Liquid AI},
title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/qad},
}