事業紹介 事業紹介トップ 経営データ分析基盤 Claude / MCP 導入 育つ業務アプリ 複雑な SaaS を専用 UI に Shopify Plus 移行・拡張 生成AI 活用(Multi AI) SEO / AIO / 広告運用 顧問・アドバイザリ インフラ構築 自社メディア投資・開発
Claude Claude / MCP 総合 Claude Cowork Claude Code 導入支援 Claude Code 使いこなし支援 Claude Design MCP 開発・サーバー構築
Shopify Plus Shopify Plus トップ EC-CUBE からの移行 大手カートからの移行 Shopify 通常プラン EC サイト構築
実績
業界ニュース 業界ニュース トップ AI ニュース └ Claude └ ChatGPT・Codex └ Gemini └ その他 Shopify ニュース SaaS ニュース お知らせ(自社発信)
会社情報 お問い合わせ
2026.08.07

Baseten が Hugging Face Inference Providers に対応——DeepSeek V4 Flash など主要 LLM をHub から直接呼び出し可能に

記事のサマリー(TL;DR)

  • Baseten が Hugging Face Hub の Inference Provider に追加され、DeepSeek V4 Flash・Kimi K3・GLM-5.2 など複数の主要オープンウェイト LLM をサーバーレスで利用可能に
  • Python SDK(huggingface_hub >= 1.26.1)・JavaScript SDK(@huggingface/inference)の両方で対応済み。HF トークン 1 本で Baseten へ自動ルーティングされる
  • 課金は「プロバイダー直接キー」か「HF 経由ルーティング」の 2 択。HF 側のマークアップなし、PRO ユーザーは月 2 ドル分のクレジットを充当可能

国内の生成 AI 開発・API 選定に関わるエンジニア・情シスが押さえるべきポイント

Baseten の Inference Provider 追加により、Hugging Face Hub を起点にしたモデル選定・切り替えがさらに柔軟になります。日本国内でも DeepSeek V4 Flash や GLM シリーズは多言語対応の観点から試用されるケースが増えており、今回の統合によって「Hub のモデルページを見てそのまま API を叩く」というフローが現実的になりました。

Pi・OpenCode・Hermes Agents など主要なエージェントフレームワークにも統合済みのため、Claude や GPT といったクローズドモデルと並列でオープンウェイト LLM を比較検証する際の調達コストが下がります。kintone や Salesforce などの業務 SaaS に生成 AI を接続する構成において、モデルごとの推論コスト・品質・ライセンス条件を比較しやすくなる点は実務上のメリットです。

HF PRO プランへの加入(月 2 ドルのクレジット付与)は、複数プロバイダーを横断して少量テストを行うプロトタイピング段階では費用対効果が高く、本番移行前の評価フローとして活用しやすい構成です。

詳細

Baseten が Hugging Face Inference Providers に正式追加

Hugging Face は、AI インフラプラットフォームの Baseten を Inference Providers のエコシステムに正式追加したと発表しました。これにより、Hub のモデルページ上から Baseten 経由のサーバーレス推論を直接実行できるようになります。

Baseten はサーバーレス AI 推論・学習その他をカバーするプラットフォームで、LLM からテキスト音声変換まで幅広いモデルタイプに対応しています。今回の初期統合では、会話(conversational)とテキスト生成(text-generation)タスクが Hub 上でサポートされ、以下のモデルが利用可能です。

  • Kimi K3
  • DeepSeek V4 Flash(最新版)
  • GLM-5.2
  • その他多数のオープンウェイト LLM

追加タスクのサポートは順次展開予定です。

Web UI での使い方

Hugging Face のユーザーアカウント設定では次の操作が可能です。

  • カスタム API キーの登録:登録済みプロバイダーの API キーを設定できます。キーが未設定の場合、リクエストは HF 経由でルーティングされます。
  • プロバイダーの優先順位設定:モデルページのウィジェットやコードスニペットに反映されます。

呼び出しモードは 2 種類あります。

モード 認証 課金先
カスタムキー(直接) プロバイダーの API キー プロバイダーのアカウント
HF 経由ルーティング HF トークン HF アカウント

クライアント SDK での使い方

Baseten は以下の SDK で利用可能です。

  • Pythonhuggingface_hub >= 1.26.1
  • JavaScript@huggingface/inference

以下は DeepSeek V4 Flash を Baseten 経由で呼び出す実装例です(OpenAI 互換インターフェース)。

Python の例

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://router.huggingface.co/v1",
    api_key=os.environ["HF_TOKEN"],
)

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
    messages=[
        {
            "role": "user",
            "content": "Write a Python function that returns the nth Fibonacci number using memoization."
        }
    ],
)
print(completion.choices[0].message)

JavaScript の例

import { OpenAI } from "openai";

const client = new OpenAI({
    baseURL: "https://router.huggingface.co/v1",
    apiKey: process.env.HF_TOKEN,
});

const chatCompletion = await client.chat.completions.create({
    model: "deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
    messages: [
        {
            role: "user",
            content: "Write a Python function that returns the nth Fibonacci number using memoization.",
        },
    ],
});
console.log(chatCompletion.choices[0].message);

HF トークン 1 本で認証が完結し、リクエストは自動的に Baseten へルーティングされます。

エージェントフレームワークとの統合

Hugging Face Inference Providers は主要なエージェントフレームワーク(Pi、OpenCode、Hermes Agents、OpenClaw など)に統合済みです。追加のグルーコードなしで Baseten ホストのモデルをそのまま利用できます。

課金の仕組み

  • 直接リクエスト(プロバイダーの API キー使用時):対応するプロバイダーのアカウントに課金されます。例として Baseten の API キーを使った場合は Baseten アカウントへの請求になります。
  • HF 経由ルーティング(HF トークン使用時):プロバイダーの標準 API レートのみが適用されます。HF 側のマークアップは発生しません(将来的にはプロバイダーとのレベニューシェアも検討中)。
  • HF PRO ユーザー:毎月 2 ドル分の推論クレジットが付与され、複数プロバイダーをまたいで利用可能です。PRO プランには ZeroGPU・Spaces Dev Mode・20 倍の利用上限引き上げなども含まれます。

フィードバックと今後の展開

Hugging Face は HuggingDiscussions のスレッド(https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49)でフィードバックを受け付けています。追加タスクのサポートは近日中に順次公開される予定です。