AI 快讯 | 谷歌 Gemini 3.8 Live 发布:AA 语音对语音质量全球第一,97 种语言自动切换

AI 快讯 | 谷歌 Gemini 3.8 Live 发布:AA 语音对语音质量全球第一,97 种语言自动切换

:fire: 一句话核心:谷歌推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时对话模型——Extended Thinking 版以 82.6% 拿下 Artificial Analysis 语音对语音质量指数全球第一,支持 97 种语言自动检测切换、近实时视觉理解与后台工具调用,且所有 AI 生成音频均内嵌 SynthID 隐形水印。


:key: 双版本分工

  • Gemini 3.8 Live:面向规模化部署与成本优化,兼顾对话智能、流畅交流与视觉理解。在 Speech Agent Arena 排名第二
  • Gemini 3.8 Live Extended Thinking:面向高复杂度任务,可实现「推理与发言同步进行」——通过「让我确认一下…」这类早期语言提示自然回应,并实时讲解多步后台任务进度

:bar_chart: 官方自报 Benchmark

基准测试 Extended Thinking 排名
AA 语音对语音质量指数 82.6% :1st_place_medal: 全球第一
Big Bench Audio(推理) 97.7% 领先
τ-Voice 智能体任务完成率 68.6% —
Sierra τ-Voice-banking 35.1% —
Speech Agent Arena(3.8 Live) — 第二

:warning: 上述为谷歌官方口径。模型 9/15 发布,第三方独立复测数据待补充。

需要注意:这个「AA 全球第一」与两天前阶跃 StepAudio 3 的「AA 全球第一」是不同指标——StepAudio 3 拿的是 Conversational Dynamics(交互动态)98.9% 和 Speech Reasoning(语音推理)99.7%,Gemini 拿的是 Speech-to-Speech Quality(语音对语音质量)82.6%。两个模型在各自维度领先,不是同一张榜的胜负。


:globe_with_meridians: 生态与合规并重

  • 开发生态:可通过 Gemini Live API 在声网、LiveKit、Pipecat、Vercel 等平台构建语音界面;与 Salesforce、Genspark、Lumeris 合作
  • 合规内建:所有 AI 生成音频直接嵌入 SynthID 隐形水印,可检测 AI 生成内容、防止虚假信息传播

SynthID 这一点值得单独关注:谷歌把「AI 音频溯源」做进了产品层而非事后检测。对内容平台审核来说,这是可以直接复用的思路。


:bullseye: 语音赛道的竞争升级

Gemini 3.8 Live 与阶跃 StepAudio 3 在两天内正面碰撞,说明语音大模型赛道的竞争已从「能否全双工」升级为「并行推理 + 工具调用 + 智能体任务完成率」的综合比拼。


来源链接