全球动态2026.09.16

Google 发布 Gemini 3.8 Live 与 Extended Thinking 两款实时语音模型

Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,首次将实时语音模型拆分为面向规模化对话与复杂推理两个版本,并同步开放 API 与 Workspace 入口。

朋克君
发布者朋克君
预计阅读 2 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

Google 发布 Gemini 3.8 Live 与 Extended Thinking 两款实时语音模型。

02

Extended Thinking 版本在语音质量指数中得分 82.6,位列第一。

03

两款模型均可通过 Gemini API、Google Workspace 与 Gemini 应用使用。

本摘要由 AI 辅助整理,请以正文内容为准。

数智朋克讯 2026 年 9 月 15 日,Google 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,将其定位为目前最先进的实时对话模型。这也是 Google 首次在实时语音模型线上,明确拆出面向通用对话与面向复杂推理的两个版本。

01标准版 Live:规模化与连续对话

Gemini 3.8 Live 面向规模化与成本效率设计,强调对话智能、流畅度与视觉 grounding 的结合。它可以近实时处理视觉输入,并在对话中自动切换 97 种语言;在语音智能体工作流中,它可以在后台执行工具与 API 调用,同时保持对话继续,从而维持连续交互体验。在 Speech Agent Arena 中,Gemini 3.8 Live 排名第二。

02Extended Thinking:为复杂任务加推理

Gemini 3.8 Live Extended Thinking 则面向高复杂度任务,强调更高智能与多步推理。与标准版不同,它可以在推理的同时说话,通过“Let me check that…”等早期口头提示并保持进度叙述,让复杂推理过程仍然嵌入在连续对话之中。

从 Google 披露的基准成绩看,Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Quality Index 中得分 82.6,位列第一;在 τ-Voice 上取得 68.6%,在 Sierra 的 τ-Voice-banking 上取得 35.1%,在 Big Bench Audio 上得分 97.7%。这些成绩目前均来自 Google 官方披露,资料中未见独立第三方复现。

03可用入口

两款模型均可通过 Gemini API、Google Workspace 与 Gemini 应用使用。第三方追踪账号在 X 上披露,Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 的模型名已出现在 GCP Console quotas 页面,显示其已进入 Google Cloud 的计费与配额体系。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签