記事のサマリー(TL;DR)
- Baseten が Hugging Face Hub の Inference Provider に追加され、DeepSeek V4 Flash・Kimi K3・GLM-5.2 など複数の主要オープンウェイト LLM をサーバーレスで利用可能に
- Python SDK(huggingface_hub >= 1.26.1)・JavaScript SDK(@huggingface/inference)の両方で対応済み。HF トークン 1 本で Baseten へ自動ルーティングされる
- 課金は「プロバイダー直接キー」か「HF 経由ルーティング」の 2 択。HF 側のマークアップなし、PRO ユーザーは月 2 ドル分のクレジットを充当可能
国内の生成 AI 開発・API 選定に関わるエンジニア・情シスが押さえるべきポイント
Baseten の Inference Provider 追加により、Hugging Face Hub を起点にしたモデル選定・切り替えがさらに柔軟になります。日本国内でも DeepSeek V4 Flash や GLM シリーズは多言語対応の観点から試用されるケースが増えており、今回の統合によって「Hub のモデルページを見てそのまま API を叩く」というフローが現実的になりました。
Pi・OpenCode・Hermes Agents など主要なエージェントフレームワークにも統合済みのため、Claude や GPT といったクローズドモデルと並列でオープンウェイト LLM を比較検証する際の調達コストが下がります。kintone や Salesforce などの業務 SaaS に生成 AI を接続する構成において、モデルごとの推論コスト・品質・ライセンス条件を比較しやすくなる点は実務上のメリットです。
HF PRO プランへの加入(月 2 ドルのクレジット付与)は、複数プロバイダーを横断して少量テストを行うプロトタイピング段階では費用対効果が高く、本番移行前の評価フローとして活用しやすい構成です。
詳細
Baseten が Hugging Face Inference Providers に正式追加
Hugging Face は、AI インフラプラットフォームの Baseten を Inference Providers のエコシステムに正式追加したと発表しました。これにより、Hub のモデルページ上から Baseten 経由のサーバーレス推論を直接実行できるようになります。
Baseten はサーバーレス AI 推論・学習その他をカバーするプラットフォームで、LLM からテキスト音声変換まで幅広いモデルタイプに対応しています。今回の初期統合では、会話(conversational)とテキスト生成(text-generation)タスクが Hub 上でサポートされ、以下のモデルが利用可能です。
- Kimi K3
- DeepSeek V4 Flash(最新版)
- GLM-5.2
- その他多数のオープンウェイト LLM
追加タスクのサポートは順次展開予定です。
Web UI での使い方
Hugging Face のユーザーアカウント設定では次の操作が可能です。
- カスタム API キーの登録:登録済みプロバイダーの API キーを設定できます。キーが未設定の場合、リクエストは HF 経由でルーティングされます。
- プロバイダーの優先順位設定:モデルページのウィジェットやコードスニペットに反映されます。
呼び出しモードは 2 種類あります。
| モード | 認証 | 課金先 |
|---|---|---|
| カスタムキー(直接) | プロバイダーの API キー | プロバイダーのアカウント |
| HF 経由ルーティング | HF トークン | HF アカウント |
クライアント SDK での使い方
Baseten は以下の SDK で利用可能です。
- Python:
huggingface_hub >= 1.26.1 - JavaScript:
@huggingface/inference
以下は DeepSeek V4 Flash を Baseten 経由で呼び出す実装例です(OpenAI 互換インターフェース)。
Python の例
import os
from openai import OpenAI
client = OpenAI(
base_url="https://router.huggingface.co/v1",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
messages=[
{
"role": "user",
"content": "Write a Python function that returns the nth Fibonacci number using memoization."
}
],
)
print(completion.choices[0].message)
JavaScript の例
import { OpenAI } from "openai";
const client = new OpenAI({
baseURL: "https://router.huggingface.co/v1",
apiKey: process.env.HF_TOKEN,
});
const chatCompletion = await client.chat.completions.create({
model: "deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
messages: [
{
role: "user",
content: "Write a Python function that returns the nth Fibonacci number using memoization.",
},
],
});
console.log(chatCompletion.choices[0].message);
HF トークン 1 本で認証が完結し、リクエストは自動的に Baseten へルーティングされます。
エージェントフレームワークとの統合
Hugging Face Inference Providers は主要なエージェントフレームワーク(Pi、OpenCode、Hermes Agents、OpenClaw など)に統合済みです。追加のグルーコードなしで Baseten ホストのモデルをそのまま利用できます。
課金の仕組み
- 直接リクエスト(プロバイダーの API キー使用時):対応するプロバイダーのアカウントに課金されます。例として Baseten の API キーを使った場合は Baseten アカウントへの請求になります。
- HF 経由ルーティング(HF トークン使用時):プロバイダーの標準 API レートのみが適用されます。HF 側のマークアップは発生しません(将来的にはプロバイダーとのレベニューシェアも検討中)。
- HF PRO ユーザー:毎月 2 ドル分の推論クレジットが付与され、複数プロバイダーをまたいで利用可能です。PRO プランには ZeroGPU・Spaces Dev Mode・20 倍の利用上限引き上げなども含まれます。
フィードバックと今後の展開
Hugging Face は HuggingDiscussions のスレッド(https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49)でフィードバックを受け付けています。追加タスクのサポートは近日中に順次公開される予定です。