Gemini 3.8 Live と 3.8 Live Extended Thinking をリリース

日本語
コピー
蓝白渐变背景的题图:右上角有两个模糊的对话气泡轮廓,中央是深色的文章标题文字,下方是 Gemini 的四色星形标志

Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking は、現時点で最も先進的なリアルタイム対話モデルです。知能と並列推論能力を大幅に強化したことで、両モデルの連携がより直感的になり、音声で複雑なタスクを実行しやすくなりました。

Tom Ouyang

Principal Engineer

Malini Jaganathan

Member of Technical Staff, on behalf of the Gemini Audio Team

共有

「Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking」というテキストと Gemini Spark、背景は淡いブルー

お使いのブラウザは audio 要素に対応していません。

記事を聴く

[[duration]] 分

このコンテンツは Google AI が生成しました。生成 AI はまだ実験段階です

Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking を発表します。音声でのやり取りがより自然に、より滑らかに、より賢くなります。これらのモデルは複雑な推論、リアルタイムの視覚コンテキスト、バックグラウンドでのタスク実行を、会話を中断せずに処理できます。本日から Gemini API、Google Workspace、Gemini アプリで利用を開始できます。

要約は Google AI が生成しました。生成 AI はまだ実験段階です。

  • 「Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking」で、より賢い音声 AI を確認しましょう。
  • Gemini 3.8 Live は高速で滑らかな対話を提供し、リアルタイムの視覚と言語に対応します。
  • 3.8 Live Extended Thinking で複雑なタスクを処理しながら、会話をスムーズに続けられます。
  • これらのモデルはバックグラウンドでツールを管理するので、チャットを続けられます。
  • これらの新機能は Google Workspace、Search、Gemini アプリで試せます。

要約は Google AI が生成しました。生成 AI はまだ実験段階です。

Google は先ほど 2 つの新しい AI モデルを発表しました。デバイスとの会話が格段に自然に感じられるようになります。割り込みに対応し、言語を切り替え、作業中には自分の考えまで説明します。複雑な問題を解くときでも、ただ雑談するときでも、AI は本当に耳を傾け、一緒に考えているように感じられます。AI を真の対話相手にするための大きな一歩です。

要約は Google AI が生成しました。生成 AI はまだ実験段階です。

他のスタイルを見る:

_2026年9月17日更新_本日、ほぼリアルタイムの推論能力を新たな高みへと引き上げる 2 つのモデルを発表します。音声エージェントの効率が上がり、AI との会話がより自然で賢くなります。

  • Gemini 3.8 Live:規模とコスト効率のために設計され、対話知能、滑らかなやり取り、視覚の grounding を兼ね備えています。
  • Gemini 3.8 Live Extended Thinking:高度に複雑なタスクのために設計され、より高い知能と多段階推論を備えています。

開発者や企業にとって、この 2 つのモデルは信頼性が高く本番環境で使える音声エージェントを構築するための基盤コンポーネントです。Gemini アプリ、Google Workspace、Search での音声操作もより滑らかで協調的になり、音声だけで複雑なタスクを処理できます。

より滑らかで賢い会話を体験

Gemini 3.8 Live Extended Thinking はエンタープライズ級のタスク遂行能力と知能を備え、Artificial Analysis の Speech to Speech Quality Index で 82.6 点を獲得して総合 1 位となり、エージェントのタスク遂行でも先行しています。τ-Voice で 68.6%、Sierra の τ-Voice-banking ベンチマークで 35.1% です。推論能力も高く、Big Bench Audio で 97.7% を記録しながら、他の中核モデルと比べて価格も十分に競争力があります。Gemini 3.8 Live はユーザーの選好度が高く、Speech Agent Arena で 2 位に入りました。性能だけでなくコスト効率にも優れ、開発者や企業に高能力・高効率で規模を前提に設計されたモデルを提供します。

Artificial Analysis Speech to Speech Index を示すグラフ

Artificial Analysis のエージェント性能を示すグラフ

Sierra を示すグラフ

Artificial Analysis の時間あたり入力音声コストを示すグラフ

ServiceNow の EVA-Bench——音声エージェントを評価するベンチマーク——では、私たちのモデルが複雑なワークフローにおいてパレートフロンティアを押し進め、精度と対話品質のバランスを取っています。

注:このテストは Gemini Enterprise Agent Platform 上の Live API で実行される。

EVA Bench の体験とタスク完了度を示すグラフ

Gemini 3.8 Live は視覚入力をほぼリアルタイムで処理し、文脈を踏まえて会話を豊かにすることで、より役立つ応答を返す。会話の途中で言語を自動的に検出し、対応する 97 言語の間で切り替える。ツール呼び出しと API 呼び出しはバックグラウンドで実行しながら会話を続けるため、モデルはまずリクエストを確認してから雑談を続け、タスクは裏で完了する。

Gemini 3.8 Live が従業員のオンボーディングをリアルタイムで導き、視覚的な文脈を使って現場の質問に答える。

Gemini 3.8 Live が視覚的な文脈、推論、自然な会話の流れを活かしてほぼリアルタイムでチェスを指す。

より深い推論が必要なタスクでは、3.8 Live Extended Thinking が考えながら話す。複雑なワークフローにより高い知能をもたらしつつ、会話は途切れさせない。初期段階で「ちょっと調べますね……」といった口頭のキューで自然にリクエストを確認し、リアルタイムの進捗を語ることで、多段階のバックグラウンドタスクがどこまで進んだかをユーザーに伝える。

Gemini 3.8 Live Extended Thinking がラフスケッチとほぼリアルタイムの音声フィードバックから、使える React コンポーネントを生み出す。

Gemini 3.8 Live Extended Thinking が多段階の予約と非同期の関数呼び出しを、自然なリアルタイム会話を一切妨げずに捌く。

Gemini 3.8 Live が自然な音声だけで、その場で完全な事業計画とカスタムのマーケティングツールキットを生成する。

Google Workspace、Search、Gemini アプリでは、私たちの Live モデルがより直感的で協働的な体験をもたらす。とりわけ、あなたの最も複雑なタスクに取り組むときにその真価が発揮される。

Google Workspace で Gemini 3.8 Live Extended Thinking を試し、Docs Live、Gmail Live、Keep Live を体験する。

Search Live で、Gemini 3.8 Live が支えるリアルタイムの手順別トラブルシューティング支援を受ける。

Gemini アプリで Gemini 3.8 Live Extended Thinking を使って一日を管理する。Daily Brief を生成させ、会話しながら受信トレイを空にし、あるいは ToDo を任せる。

開発者と企業の音声エコシステムを後押しする

Gemini Live API により、AgoraFishjamLangChainLiveKitPipecatVercelVision Agents といった開発者プラットフォーム上で、高性能な音声駆動インターフェースを手軽に構築・デプロイできる。こうしたプラットフォームが複雑なリアルタイムメディアストリーミングの基盤を裏側で処理するため、開発者はユーザー体験の作り込みだけに集中できる。また Salesforce、Genspark、Lumeris などの企業とも協業している。彼らは 3.8 Live と 3.8 Live Extended Thinking に大きな期待を寄せており、とくに優れたレイテンシ、滑らかさ、ツール呼び出し能力を評価している。

Salesforce quote

11Sight Quote

Equal AI Quote

ServiceNow quote

Genspark の評価

Lenskart の評価

Lumeris の評価

Agora の評価

Ambr AI の評価

LiveKit の評価

Casuu の評価

SynthID ウォーターマークによる透明性の確保

当社の AI 製品が生成する音声には、すべて SynthID ウォーターマークが埋め込まれています。このウォーターマークは人間の耳には知覚できず、音声出力に直接埋め込まれるため、AI 生成コンテンツを常に検出可能にし、虚偽情報の拡散防止に役立ちます。安全性と責任に関する当社の取り組みについては、モデルカードをご覧ください。

最新の Gemini Audio モデルを使い始める

3.8 Live は本日より順次提供を開始します:

3.8 Live Extended Thinking は本日より順次提供を開始します:

  • 開発者向けGemini API および Google AI Studio にて
  • 企業向けGemini Enterprise にてプライベートプレビューを開始、まもなく Gemini Enterprise for Customer Experience および Google Workspace のビジネス顧客でも提供予定
  • すべての方向け:Gemini Live にて、また Workspace では Docs の Google AI Pro および Ultra サブスクライバー、さらに Gmail と Keep のすべての Google AI サブスクライバー

登録して、Google の最新情報をメールで受け取る

出典: Google Blog← ホームへ戻る