記事のサマリー(TL;DR)
- Alibaba の Qwen3.8 27B をターナリー重み技術で 5.9GB(元比 1/9〜1/10)に圧縮、ベンチマーク保持率 98%
- 初代 Bonsai は公開後わずか数か月でダウンロード 1,100 万回超、さらに小型モデルが 260 万回追加
- 次のリリースは数百億パラメータ級モデルの圧縮版を数か月以内に予定
国内オンデバイスAI・エッジ推論の実用化に関心を持つ開発者・情シスへの影響
PrismML のアプローチが示す最大のポイントは「クラウドを使わない推論」の現実味です。Ion Stoica(Databricks 共同創業者・Berkeley Sky Computing Lab 所長)が強調するように、デバイス上で動作する LLM はデータを外部送信しないため、個人情報保護やデータ越境規制への対応コストを大幅に下げられます。日本では個人情報保護法や金融・医療分野の業界ガイドラインにより、SaaS 側のクラウド AI 利用に慎重な企業が多く、「端末内で完結する推論」への需要はとくに大きい状況です。Bonsai 2 が 5.9GB でハイエンドスマートフォンに乗るなら、kintone や Salesforce などの業務 SaaS に対して専用 UI をかぶせる構成においても、サーバーレスな AI 推論層として組み込める可能性があります。また Hugging Face 経由で公開されているため、国内の AI 開発チームが評価・統合するハードルは低い状態です。
詳細
PrismML とは何者か
AI スタートアップ PrismML は、カリフォルニア工科大学(Caltech)の研究者グループが創業し、同大学教授でありデータ圧縮技術の専門家である Babak Hassibi が CEO を務めます。アドバイザーには Databricks 共同創業者で Berkeley の Sky Computing Lab ディレクターである Ion Stoica が名を連ねます。同ラボは Letta や SGLang など多数のプロジェクトを生み出した実績があります。
投資家は Khosla Ventures、Cerberus Capital、Caltech。2025年9月時点での調達額はシードラウンドの 2,225 万ドルにとどまりますが、技術陣の顔ぶれと開発内容は注目に値します。
Bonsai 2 27B の技術的詳細
2025年9月17日(木)にリリースされた Bonsai 2 27B は、Alibaba のオープンソースモデル Qwen3.8 27B を圧縮したモデルです。圧縮後のサイズは 5.9GB。オリジナルと比べてメモリ使用量を 9〜10 倍削減 しており、一般的な PC およびハイエンドスマートフォン上での動作が可能になります。
圧縮の核となる手法は「ターナリー(ternary)重み」です。通常の LLM は各重み(weight)を 16 ビットで表現しますが、PrismML はこれを +1・−1・0 の3値に簡略化します。保存すべき情報量が劇的に減るため、モデル全体のサイズも大幅に縮小されます。技術的な詳細は同社の Hugging Face ページで公開されています。
ベンチマーク性能:98% の保持率
Bonsai 2 は Qwen3.8 27B の集計ベンチマークスコアの 98% を達成しています。数か月前の 2025年3月にリリースした初代 Bonsai が 95% だったのと比べ、着実に改善が進んでいます。
Hassibi は「LLM 自体が非圧縮状態でも完全な精度を持つわけではなく、ベンチマークも実業務タスクを完全には反映していない。2% の劣化が実用上の差になる可能性は低い」と述べています。また推論の精度にはモデルを動かすソフトウェアスタック(ハーネス)も大きく影響するとも付け加えています。
ダウンロード実績と市場の反応
PrismML によれば、初代 Bonsai はリリースから数か月で 1,100 万回以上ダウンロードされています。さらに同社のより小型なモデル群も追加で 260 万回ダウンロードされており、マーケットの関心の高さを示しています。
競合との差別化
LLM 圧縮技術は PrismML だけが手がける分野ではありません。スペインの Donostia International Physics Center 出身の著名教授が創業した Multiverse Computing も同分野に取り組んでおり、同社は潤沢な資金調達を実現しています。Hassibi は「PrismML の圧縮技術はオリジナルとの性能差がほぼゼロである点が差別化ポイント」と主張します。
次のロードマップ:数百億パラメータ級モデルへ
Hassibi は TechCrunch に対し、次のリリースについてこう語っています。「次に出すモデルは数百億パラメータ規模になる見込みで、数か月以内にリリースしたい。大きなモデルほど圧縮しても知性を保ちやすいため、パラメータ数が増えるほど 100% の性能保持に近づきやすくなる」。
Apple との交渉報道
CEO の Hassibi は Apple との協議に関する報道についてコメントを控えましたが、もし実現すれば iPhone や Mac 上でのネイティブ推論という大きな市場インパクトが生まれます。
Ion Stoica のコメント:「知性が無料になる」
アドバイザーの Stoica は自身の期待をこう表現しています。「指先に知性が宿り、しかも無料になる。すでに持っているデバイスで動くからだ。クラウドに送信しないから、プライバシーも守られる」。デバイス上の推論がもたらすコスト・プライバシー両面の優位性を、端的に言い表した言葉です。