記事のサマリー(TL;DR)
- Gemini 3.8 Live Extended ThinkingがSpeech to Speech Quality Indexで総合1位(82.6点)、τ-Voiceで68.6%を達成
- 97言語の会話中自動切替、ツール・API呼び出しをバックグラウンド実行しながら会話継続が可能
- 開発者向けはGemini API・Google AI Studioで即日提供、エンタープライズ向けはGemini Enterpriseでプレビュー開始
Salesforce連携や音声エージェント開発を検討する国内企業が押さえるべき変化
Salesforceは今回の発表パートナー企業として名指しされており、Gemini 3.8 Live / 3.8 Live Extended ThinkingをCRM領域の音声エージェントとして活用する検討が進んでいます。国内でSalesforceを基幹CRMとして運用している企業にとって、Agentforce等との連携に新たな音声モデル選択肢が加わった形です。
また、LangChainやVercel、Pipecat、LiveKitといった国内でも採用実績のある開発プラットフォームが既にGemini Live APIへの対応を表明しており、これらを使って音声UIを構築しているシステムは比較的低コストで最新モデルへの切り替えが行えます。kintoneやfreeeなど業務SaaSの音声操作UIを検討しているプロジェクトでは、Live APIをベースにしたアーキテクチャが現実的な選択肢になりつつあります。
SynthIDによる自動透かし処理は、金融・医療など規制業種でAI音声を導入する際の透明性確保要件に対応しており、コンプライアンス面での懸念を一定程度緩和します。
詳細
Gemini 3.8 Live・3.8 Live Extended Thinkingとは
GoogleはGemini Audioチームによる2つの新モデルを2026年9月15日に発表しました。いずれもリアルタイムに近い音声対話(Live Dialogue)に特化したモデルです。
- Gemini 3.8 Live:スケールとコスト効率を重視した設計。会話知性(Conversational Intelligence)、流暢な対話、ビジュアルグラウンディングを組み合わせています。Speech Agent Arenaでユーザー選好率2位を記録しており、高機能でありながらコスト効率の高い選択肢として位置付けられています。
- Gemini 3.8 Live Extended Thinking:高複雑タスク向けに設計され、多段推論(Multi-step Reasoning)を備えます。Artificial AnalysisのSpeech to Speech Quality Index(音声対音声品質指標)で総合1位(スコア82.6)を獲得。エージェントタスク完了率はτ-Voiceで68.6%、Sierraのτ-Voice-bankingベンチマークで35.1%を達成しています。さらにBig Bench Audioでは97.7%のスコアを記録しています。
主要機能
リアルタイムビジュアル処理:Gemini 3.8 Liveは視覚入力をほぼリアルタイムで処理し、会話に文脈を付加することでより的確な回答を生成します。
97言語の自動検出・切替:会話の途中でも対応97言語を自動検出し、シームレスに切り替えます。国境をまたぐカスタマーサポートや多言語ドキュメント処理への応用が想定されます。
バックグラウンドツール呼び出し:ツールやAPI呼び出しを会話と並行してバックグラウンドで実行します。モデルはリクエストを受け付けながら会話を継続できるため、処理待ちによる会話断絶が発生しません。
推論しながら同時発話(Extended Thinking専用):Gemini 3.8 Live Extended Thinkingは推論と発話を並列実行します。「確認させてください(Let me check that…)」のような自然な言語的手がかりを使ってプロンプトを受け付け、バックグラウンドで進行する多段タスクをリアルタイムで実況することで、会話の流れを途切れさせません。
ServiceNow EVA-Benchでの評価:ServiceNowの音声エージェント評価ベンチマーク「EVA-Bench」において、複雑なワークフローでの精度と会話品質のバランスを両立し、パレートフロンティア(Pareto Frontier)を前進させたと報告されています。なお本評価はGemini Enterprise Agent Platform上のLive APIを使用して実施されています。
Google Workspaceおよびサービスへの統合
Gemini 3.8 LiveはGoogleのコンシューマー・エンタープライズサービスにも段階的に統合されます。
- Search Live:Gemini 3.8 Live搭載のリアルタイムトラブルシューティングをSearch内で提供
- Gemini Live:Extended Thinkingモデルをアプリで利用可能
- Google Workspace:Docs(Google AI ProおよびUltraサブスクライバー向け)、Gmail・Keep(全Google AIサブスクライバー向け)に展開
開発者・エコシステムパートナーの対応
Gemini Live APIを活用する開発プラットフォームとして、以下が対応を表明しています。
- Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents
これらのプラットフォームはリアルタイムメディアストリーミングのインフラを担うため、開発者はユーザー体験の設計に集中できる構成になっています。
エンタープライズパートナーとしてはSalesforce、Genspark、Lumerisが3.8 Liveシリーズの低レイテンシ・流暢さ・ツール呼び出し機能への期待を表明しています。
SynthIDによる透かし処理
GoogleのAI製品が生成する全音声出力には、人間には知覚できない透かし「SynthID」が埋め込まれます。この透かしは音声データに直接組み込まれ、AI生成コンテンツを識別可能な状態に保つことで、誤情報拡散の防止に役立てられます。
提供スケジュール
Gemini 3.8 Live(2026年9月15日より順次提供開始):
- 開発者向け:Gemini APIおよびGoogle AI Studioで即日利用可能
- エンタープライズ向け:Gemini Enterpriseにてプライベートプレビュー開始、Gemini Enterprise for Customer Experienceにも近日提供予定
- 一般ユーザー向け:Search Liveで利用可能
Gemini 3.8 Live Extended Thinking(2026年9月15日より順次提供開始):
- 開発者向け:Gemini APIおよびGoogle AI Studioで即日利用可能
- エンタープライズ向け:Gemini Enterpriseにてプライベートプレビュー開始、Gemini Enterprise for Customer ExperienceおよびGoogle WorkspaceビジネスカスタマーへもまもなくGA予定
- 一般ユーザー向け:Gemini Liveで利用可能。Google AI Pro・UltraサブスクライバーはワークスペースのDocsでも使用可能。全Google AIサブスクライバーはGmailおよびKeepで利用可能