推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking

Gemini 3.8 Live 与 Extended Thinking 发布,语音交互支持复杂推理、实时视觉与后台任务而不打断对话。

中文
复制
蓝白渐变背景的题图:右上角有两个模糊的对话气泡轮廓,中央是深色的文章标题文字,下方是 Gemini 的四色星形标志

Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是我们目前最先进的实时对话模型。智能与并行推理能力的大幅升级,让它们协作起来更直觉,也更容易用语音执行复杂任务。

Tom Ouyang

Principal Engineer

Malini Jaganathan

Member of Technical Staff, on behalf of the Gemini Audio Team

分享

文字“Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking”与 Gemini Spark,背景为浅蓝色

你的浏览器不支持 audio 元素。

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 仍处于实验阶段

我们推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,让语音交互更自然、更流畅、更智能。这些模型能处理复杂推理、实时视觉上下文和后台任务执行,而不会打断你的对话。从今天起,你可以通过 Gemini API、Google Workspace 和 Gemini 应用开始使用这些功能。

摘要由 Google AI 生成。生成式 AI 仍处于实验阶段。

  • 查看“Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking”,了解更智能的语音 AI。
  • Gemini 3.8 Live 提供快速流畅的对话,支持实时视觉与语言。
  • 用 3.8 Live Extended Thinking 处理复杂任务,同时保持对话顺畅进行。
  • 这些模型在后台管理工具,你可以继续聊天。
  • 你可以在 Google Workspace、Search 和 Gemini 应用中试用这些新功能。

摘要由 Google AI 生成。生成式 AI 仍处于实验阶段。

Google 刚刚发布了两款新 AI 模型,让你与设备对话的感觉自然得多。它们能应对打断、在语言之间切换,甚至在工作时解释自己的思路。无论你是在解决复杂问题,还是只是闲聊,AI 现在都像是真的在倾听,并和你一起思考。这是让 AI 成为真正对话伙伴的重要一步。

摘要由 Google AI 生成。生成式 AI 仍处于实验阶段。

探索其他风格:

_2026年9月17日更新_今天,我们推出两款新模型,将接近实时的推理能力推向新高度,让语音智能体更高效,也让与 AI 对话更自然、更聪明。

  • Gemini 3.8 Live:为规模和成本效率而打造,兼具对话智能、流畅交流和视觉 grounding。
  • Gemini 3.8 Live Extended Thinking:为高复杂度任务而打造,智能更强,支持多步推理。

对开发者和企业而言,这两款模型提供了构建可靠、可上生产的语音智能体的基础组件。它们也让 Gemini app、Google Workspace 和 Search 中的语音交互更流畅、更具协作性——只用语音就能处理复杂任务。

体验更流畅、更智能的对话

Gemini 3.8 Live Extended Thinking 具备企业级任务完成能力和智能水平,在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分拿下总榜第一,并在智能体任务完成方面领先:τ-Voice 上为 68.6%,Sierra 的 τ-Voice-banking 基准上为 35.1%。它还具备强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时相较其他前沿模型保持了极具竞争力的价格。Gemini 3.8 Live 在用户中偏好度很高,在 Speech Agent Arena 中位列第二。除了性能之外,它还极具成本效益——为开发者和企业提供了一个能力强、效率高、为规模而生的模型。

展示 Artificial Analysis Speech to Speech Index 的图表

展示 Artificial Analysis 智能体性能的图表

展示 Sierra 的图表

展示 Artificial Analysis 每小时输入音频成本的图表

在 ServiceNow 的 EVA-Bench 上——一个用于评估语音 agent 的基准——我们的模型在复杂工作流中推进了帕累托前沿,在准确率与对话质量之间取得了平衡。

注意:该测试在 Gemini Enterprise Agent Platform 上的 Live API 中运行。

展示 EVA Bench 体验与任务完成度的图表

Gemini 3.8 Live 近乎实时地处理视觉输入,用上下文丰富对话内容,从而给出更有帮助的回应。它能在对话过程中自动检测并在 97 种支持的语言之间切换。它在后台执行工具调用和 API 调用,同时继续对话,因此模型可以先确认请求、继续聊天,任务则在后台完成。

Gemini 3.8 Live 实时指导员工入职,利用视觉上下文回答现场提问。

观看 Gemini 3.8 Live 借助视觉上下文、推理和自然的对话流,近乎实时地下棋。

对于需要更深层推理的任务,3.8 Live Extended Thinking 可以边推理边说话。它为复杂工作流带来更强的智能,同时保持对话不中断——用「让我查一下……」这样的早期口头提示自然地确认请求,并通过实时进度叙述,让用户了解多步骤后台任务的推进情况。

观看 Gemini 3.8 Live Extended Thinking 将原始草图和近乎实时的语音反馈转化为可用的 React 组件。

看 Gemini 3.8 Live Extended Thinking 协调多步骤预订和异步函数调用——全程不打断自然的实时对话。

看 Gemini 3.8 Live 现场通过自然语音即时生成完整商业方案和定制营销工具包。

在 Google Workspace、Search 和 Gemini 应用中,我们的 Live 模型带来更直观、更具协作性的体验——尤其是在处理你最复杂的任务时。

在 Google Workspace 中试用 Gemini 3.8 Live Extended Thinking,体验 Docs Live、Gmail Live 和 Keep Live。

在 Search Live 中获取由 Gemini 3.8 Live 驱动的实时分步故障排查帮助。

在 Gemini 应用中使用 Gemini 3.8 Live Extended Thinking 管理你的一天——让它生成 Daily Brief、用对话把收件箱清空,或者把待办事项交出去。

赋能开发者与企业语音生态

借助 Gemini Live APIAgoraFishjamLangChainLiveKitPipecatVercelVision Agents 等开发者平台,开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台处理复杂的实时媒体流基础设施,让开发者可以完全专注于打磨用户体验。我们还在与 Salesforce、Genspark 和 Lumeris 等公司合作,它们对 3.8 Live 和 3.8 Live Extended Thinking 充满期待,尤其看重其出色的延迟表现、流畅度和工具调用能力。

Salesforce quote

11Sight Quote

Equal AI Quote

ServiceNow quote

Genspark 评价

Lenskart 评价

Lumeris 评价

Agora 评价

Ambr AI 评价

LiveKit 评价

Casuu 评价

通过 SynthID 水印确保透明度

我们的 AI 产品生成的所有音频都带有 SynthID 水印。这种水印人耳无法察觉,直接嵌入音频输出之中,让 AI 生成的内容始终可被检测,从而帮助防止虚假信息传播。关于我们在安全与责任方面的做法,详见模型卡

开始使用我们最新的 Gemini Audio 模型:

3.8 Live 从今天起逐步开放:

3.8 Live Extended Thinking 从今天起逐步开放:

订阅,在收件箱中获取 Google 最新资讯

来源: Google Blog← 返回首页