快速了解本文
Google 发布 Gemini 3.8 Live 与 Extended Thinking 两款实时语音模型。
Extended Thinking 版本在语音质量指数中得分 82.6,位列第一。
两款模型均可通过 Gemini API、Google Workspace 与 Gemini 应用使用。
本摘要由 AI 辅助整理,请以正文内容为准。
数智朋克讯 2026 年 9 月 15 日,Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,将其定位为目前最先进的实时对话模型。这也是 Google 首次在实时语音模型线上,明确拆出面向通用对话与面向复杂推理的两个版本。
01标准版 Live:规模化与连续对话
Gemini 3.8 Live 面向规模化与成本效率设计,强调对话智能、流畅度与视觉 grounding 的结合。它可以近实时处理视觉输入,并在对话中自动切换 97 种语言;在语音智能体工作流中,它可以在后台执行工具与 API 调用,同时保持对话继续,从而维持连续交互体验。在 Speech Agent Arena 中,Gemini 3.8 Live 排名第二。
02Extended Thinking:为复杂任务加推理
Gemini 3.8 Live Extended Thinking 则面向高复杂度任务,强调更高智能与多步推理。与标准版不同,它可以在推理的同时说话,通过“Let me check that…”等早期口头提示并保持进度叙述,让复杂推理过程仍然嵌入在连续对话之中。
从 Google 披露的基准成绩看,Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Quality Index 中得分 82.6,位列第一;在 τ-Voice 上取得 68.6%,在 Sierra 的 τ-Voice-banking 上取得 35.1%,在 Big Bench Audio 上得分 97.7%。这些成绩目前均来自 Google 官方披露,资料中未见独立第三方复现。
03可用入口
两款模型均可通过 Gemini API、Google Workspace 与 Gemini 应用使用。第三方追踪账号在 X 上披露,Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 的模型名已出现在 GCP Console quotas 页面,显示其已进入 Google Cloud 的计费与配额体系。

