AI 快讯 | 谷歌 Gemini 3.8 Live 发布:AA 语音对语音质量全球第一,97 种语言自动切换
一句话核心:谷歌推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时对话模型——Extended Thinking 版以 82.6% 拿下 Artificial Analysis 语音对语音质量指数全球第一,支持 97 种语言自动检测切换、近实时视觉理解与后台工具调用,且所有 AI 生成音频均内嵌 SynthID 隐形水印。
双版本分工
- Gemini 3.8 Live:面向规模化部署与成本优化,兼顾对话智能、流畅交流与视觉理解。在 Speech Agent Arena 排名第二
- Gemini 3.8 Live Extended Thinking:面向高复杂度任务,可实现「推理与发言同步进行」——通过「让我确认一下…」这类早期语言提示自然回应,并实时讲解多步后台任务进度
官方自报 Benchmark
| 基准测试 | Extended Thinking | 排名 |
|---|---|---|
| AA 语音对语音质量指数 | 82.6% | |
| Big Bench Audio(推理) | 97.7% | 领先 |
| τ-Voice 智能体任务完成率 | 68.6% | — |
| Sierra τ-Voice-banking | 35.1% | — |
| Speech Agent Arena(3.8 Live) | — | 第二 |
上述为谷歌官方口径。模型 9/15 发布,第三方独立复测数据待补充。
需要注意:这个「AA 全球第一」与两天前阶跃 StepAudio 3 的「AA 全球第一」是不同指标——StepAudio 3 拿的是 Conversational Dynamics(交互动态)98.9% 和 Speech Reasoning(语音推理)99.7%,Gemini 拿的是 Speech-to-Speech Quality(语音对语音质量)82.6%。两个模型在各自维度领先,不是同一张榜的胜负。
生态与合规并重
- 开发生态:可通过 Gemini Live API 在声网、LiveKit、Pipecat、Vercel 等平台构建语音界面;与 Salesforce、Genspark、Lumeris 合作
- 合规内建:所有 AI 生成音频直接嵌入 SynthID 隐形水印,可检测 AI 生成内容、防止虚假信息传播
SynthID 这一点值得单独关注:谷歌把「AI 音频溯源」做进了产品层而非事后检测。对内容平台审核来说,这是可以直接复用的思路。
语音赛道的竞争升级
Gemini 3.8 Live 与阶跃 StepAudio 3 在两天内正面碰撞,说明语音大模型赛道的竞争已从「能否全双工」升级为「并行推理 + 工具调用 + 智能体任务完成率」的综合比拼。
