記事のサマリー(TL;DR)
- Baseten の研究部門 Base Labs が、Hugging Face・Goodfire AI との提携でオープンウェイトモデルの安全基盤標準を策定へ
- Hugging Face 上のアブリタレーテッドモデル(安全制約を除去されたモデル)は既に6,000件超に達し、問題の規模は深刻
- Baseten は2025年6月に Series F で評価額130億ドルに到達、Goodfire も Series B で1億5,000万ドルを調達済み
国内 Hugging Face 活用企業・生成AI開発者が注目すべき安全インフラの動向
日本でも Hugging Face 上のオープンウェイトモデルを自社サービスや業務システムに組み込む事例が急増しています。しかし「アブリタレーション(abliteration)」と呼ばれる手法でモデルの安全フィルターを意図的に除去する行為が横行しており、同プラットフォームには現時点で6,000件を超えるアブリタレーテッドモデルが公開されている状況です。
今回 Base Labs が目指す「学習・デプロイ段階から組み込む安全標準」は、後付けガードレールに依存してきた従来の構成と大きく異なります。特に Goodfire のモデル解釈可能性(interpretability)技術を組み合わせることで、モデルの意思決定プロセスを可視化しながら安全性を確保するアプローチが実現する見込みです。kintone や Salesforce などの業務 SaaS に接続する形で社内向け AI エージェントを構築している企業にとって、使用するベースモデルの安全性検証プロセスを標準化する手がかりになり得ます。また生成 AI 活用で Llama や Gemma などのオープンウェイトモデルを選定・運用している開発チームは、本フレームワークの公開を追跡しておく価値があります。
詳細
Base Labs・Hugging Face・Goodfire AI が安全基盤の共同構築を発表
Baseten は水曜日、研究部門 Base Labs とともに新たな安全インフラ標準の構築を発表しました。Hugging Face および Goodfire AI との提携により、オープンウェイトモデル向けの安全評価・監視インフラを整備していく方針です。
この発表は、オープンウェイトモデルの安全性をめぐる議論が高まるなかで行われました。「アブリタレーション(abliteration)」と呼ばれる手法が急速に普及しており、モデルのガードレールを取り除いて危険な状態にすることが可能になっています。Hugging Face 上に公開されているアブリタレーテッドモデルはすでに6,000件を超えており、問題の規模は無視できない水準に達しています。
「後付けではなく、学習段階から組み込む安全性」
Base Labs は、オープンモデルの学習・デプロイ手法に関するメソッドを開発し、広く公開していく予定です。同社はこの取り組みを「透明性があり、後付けではなくモデルの学習・デプロイ方法に組み込まれた標準」として位置づけています。
Baseten は X(旧 Twitter)でこう述べています。「私たちはオープン性が AI 安全にとって優位性をもたらすと考えます。オープン性はモデルの挙動に対するより大きな可視性を提供し、最も重要な点として、安全性に関する研究を実用的かつ透明性のあるコントロールへと変換するための手段をクローズドソースよりも豊富に備えています。」
各社の役割と技術的方向性
技術的な連携の詳細はまだ開示されていませんが、Goodfire はBaseten の投稿への返信でゴールをこう表現しています。「安全性はオープンモデルに組み込まれ、それを提供するプロバイダーによって担保されなければならない。」
AIの「ブラックボックス」を解明してモデルの意思決定を説明することを専門とする Goodfire は、「組み込む」部分を担う有力候補です。一方、AI 推論プロバイダーの Baseten はインフラ側を担うと見られます。
各社の資金調達状況
Baseten は2025年6月に Series F で15億ドルを調達し、評価額は130億ドルに到達しました。パートナーの Goodfire AI も同年、B Capital がリードした Series B で1億5,000万ドルを調達しており、モデル解釈可能性プラットフォームの開発を加速させています。
開発者コミュニティへのオープンコール
Baseten は今後、より広い開発者エコシステムに対してフレームワークへの貢献を公募する予定です。同社は「安全でありながらすべての人がアクセスできるオープンモデルのエコシステムを、ともに構築していく」と声明の中で述べています。