AI・自動化

Gemini 3.8 Liveは会話中も推論、実装では「終了」の判定が変わる

|著者: QUASA編集チーム|2 分で読めます
Gemini 3.8 Liveは会話中も推論、実装では「終了」の判定が変わる

Googleは2026年9月15日、リアルタイム音声対話向けの「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表して提供を開始し、17日に公式発表を更新した。ITmedia NEWSの報道 も、両モデルが15日に発表され、同日から提供されたことを伝えている。

今回の実装上の変化が最も大きいのはExtended Thinkingだ。音声で応答しながらバックグラウンド推論と非同期ツール呼び出しを続けるため、発話の区切りを示すturnCompleteだけではタスク全体の終了を判定できない。既存のLive APIから移行するクライアントは、interaction_statusがIDLEになるまで受信と状態管理を続ける必要がある。

標準モデルとExtended Thinkingの役割

Gemini 3.8 Liveは、応答速度、規模、コスト効率を重視した標準モデルで、短い指示や素早いターン交代を伴う音声対話を主な対象とする。Extended Thinkingは、複数の情報を照合する予約や診断、コード支援など、何段階もの判断や外部処理が必要なタスクに向けて推論を強化したモデルだ。

Extended Thinkingは、推論が終わるまで沈黙するのではなく、依頼を受け付けたことや作業の進行状況を音声で返しながら処理を進める。Googleの更新済み発表 では、同モデルが推論と発話を並行させ、複数段階の予約と非同期関数呼び出しを会話の裏で処理する例が示された。

同じ発表で示された公表値は、Speech to Speech Quality Indexが82.6、エージェント型タスクを測るτ-Voiceが68.6%、音声推論のBig Bench Audioが97.7%だった。ただし、評価対象と方法が異なる指標であり、実際のアプリにおける遅延やツール成功率をそのまま表す数字ではない。

対応する入出力と提供範囲

Extended ThinkingのモデルIDはgemini-3.8-live-extended-thinking。テキスト、画像、音声、動画を入力し、テキストと音声を出力できる。入力上限は131,072トークン、出力上限は65,536トークンで、Live API、検索グラウンディング、Thinking、音声生成に対応する。

公式モデル仕様 によると、関数呼び出しは非同期方式だけをサポートする。一方、構造化出力、コード実行、File Search、キャッシュ、URL Context、Google Mapsグラウンディング、画像生成、Batch APIには対応していない。通常のGemini APIで利用できる機能を、そのままLiveセッションへ持ち込めるわけではない。

開発者向けにはGemini APIとGoogle AI Studioで提供が始まった。一般利用者向けではGemini Liveに展開され、WorkspaceではDocsがGoogle AI ProおよびUltra加入者、GmailとKeepがGoogle AI加入者の対象となる。企業向けのGemini Enterpriseはプライベートプレビューで、Gemini Enterprise for Customer ExperienceとWorkspace法人顧客への提供は今後とされており、すべての製品で同じ提供段階にあるわけではない。

turnComplete後も処理は終わらない

従来の標準的なLive音声セッションでは、turnComplete: trueを受け取るとモデルの発話が終わり、セッションが次の入力を待つ状態へ戻ったと扱えた。Extended Thinkingでは、この通知は一つの発話が終わったことを示すだけで、その後もバックグラウンド推論、ツール呼び出し、追加の音声が続く場合がある。

新たな終了条件はinteraction_statusだ。IN_PROGRESSは、入力の処理、推論、または非同期ツールの応答待ちが続いている状態を表す。推論とツール処理を含むタスク全体が終わり、次の入力を待てる段階になるとIDLEが返る。発話の終了と処理全体の終了を別の状態として管理することが、移行の中心になる。

この違いは画面表示だけにとどまらない。turnCompleteで受信ループを閉じる実装では、後から届くツール呼び出しや音声フレームを失う可能性がある。タイムアウト、セッション切断、マイクの待受状態、次の要求を受け付ける条件も、interaction_statusを基準に組み直す必要がある。

関数呼び出しはNON_BLOCKINGが必須

Extended Thinkingでは、すべての関数宣言にbehavior: NON_BLOCKINGを指定する必要がある。同期的なBLOCKING方式はサポートされず、指定するとエラーになるため、既存クライアントはモデルIDを差し替えるだけでは移行できない。

クライアントはツール呼び出しを受け取った後もサーバーメッセージの受信を続け、呼び出しIDを対応付けて結果を返す。複数の関数が並行する場合は、個々の呼び出しの完了と、セッション全体のinteraction_statusを別々に追跡しなければならない。

推論の深さはthinking_levelのlow、medium、highで設定できるが、MINIMALは利用できない。Proactive Audioは常時有効で、proactive_audio: falseを送るとエラーになる。モデル間で互換性のない設定値を共通化しているクライアントでは、接続設定も分ける必要がある。

移行で変更が必要な箇所

既存のLive APIクライアントをExtended Thinkingへ移す際は、次の状態遷移とエラー処理を確認する必要がある。

  • turnCompleteを受け取っても受信ループを閉じず、後続メッセージを待つ。
  • interaction_statusがIDLEになるまで、タスク全体を完了扱いにしない。
  • すべての関数宣言をNON_BLOCKINGに変更し、同期呼び出しへの依存を取り除く。
  • 中間発話、ツール呼び出し、ツール応答、最終音声を別々のイベントとして管理する。
  • 無音時間だけでタイムアウトを判定せず、IN_PROGRESSの状態を考慮する。
  • 未対応のthinking_levelやProactive Audio設定を送信していないか確認する。

割り込みの意味も明示する必要がある。セッション中は役割を指定したsend_client_contentを送信できるが、turn_complete=trueを送ると進行中の生成が直ちに中断される。利用者の新しい発話を追加情報として渡すのか、現在の応答を止める操作とするのかは、クライアント側で区別しなければならない。

Gemini 3.8 Liveシリーズの提供は始まったが、Extended Thinkingへの移行条件は音声品質の向上だけでは判断できない。現時点で確定している境界は、turnCompleteが発話の終わり、interaction_statusのIDLEが処理全体の終わりを示すことだ。今後は、実環境での遅延や非同期関数の失敗時の挙動、企業向けサービスの提供時期が導入判断の焦点となる。

関連記事:

共有:

ニュースレターを購読

Web3、AI、暗号資産の最新ニュースを受信箱にお届けします。

0