一句话核心:9 月 23 日,Google 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音合成模型,官方称其「迄今最具表现力的音频生成模型」。官方给这次升级的定位是——把语音生成从「静态预设音色」变成「动态创作工作室」:可以用自然语言从零造出音色、覆盖 100 多种语言与方言、用 30 秒样本复刻声线,并能逐句导演表演。

背景脉络
- 它属于 Gemini Audio 家族的新成员,官方列出的同族前作为 3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinking。
- 两款模型分工明确:
- Gemini 3.8 Flash TTS——面向深度创作指导与角色设计(游戏、沉浸式有声书、播客、互动媒体);
- Gemini 3.8 Flash-Lite TTS——面向高并发、低成本的规模化场景(大批量配音、音频内容生产、有表现力的语音智能体)。
- 与已发 163(Grok Voice Transcribe 2.0)方向相反:那条是语音转写(听→文),本条是语音合成(文→声),两者可对照但不属同一条线。
关键细节
能力(官方博文原文口径)
- 生成式音色设计:用自然语言提示从零定制角色、口音与声音特征,覆盖 100 多种语言与方言(官方举例:墨尔本口音的高能 DJ、极细的单音机器人声、日语巨龙);
- 音色库:2,000+ 可直接使用的音色,含墨西哥西语、魁北克法语、苏格兰英语等区域变体——官方称从「30 个原创音色扩展到无限音色库」;
- 音色复刻:仅需 30 秒音频样本即可复刻一致的声线;配套同意验证、SynthID 水印与 C2PA 凭证;
- 逐句导演:可写舞台指示或让模型按剧本线索演绎,控制表演提示、节奏、方言切换与回应性语气词(backchanneling);
- 长音频生成:跨数小时连续音频保持音质、节奏与音色,说话人漂移最小(面向播客与有声书);
- 原生双人对话调度:一份脚本直接调度多轮对话,两个声线清晰分离、轮次自然;
- 脚本化非语言发声:
<laughs>、<sigh>、<gasp>等,以及|mhm|、|yeah|这类主动倾听插话; - 音色重混(voice remixing)即将推出:从音色库挑一个,微调音色、音高、语速与口音(官方举例提示词:「add subtle Southern US accent」)。
第三方读数(
均为 Google 自行引用,本文未独立打开榜单页)
- Hume AI 的 Voice Design Benchmark:以 71.4 分列第一,口音建模 60.8 领先;
- Hume AI Overall Quality Index:Flash TTS 与 Flash-Lite TTS 分列第一与第二;
- Voice Arena 的盲测人类偏好:在日语、巴西葡语、越南语、现代标准阿拉伯语、墨西哥西语、印地语等关键语言上进入前列;
- 官方称相对 Gemini 3.1 Flash TTS 在长内容与双人剧本控制上提升明显。
安全与透明度
- 音色复刻须提供声主的「口头同意录音」,且须与参考说话人匹配;
- 所有生成音频均嵌入 SynthID 不可感知水印(官方称用于「保持 AI 生成语音可被检测,帮助防止错误信息」);
- 详细说明指向模型卡。
可用范围(官方称「今日起陆续推出」)
- 开发者:Gemini API 与 Google AI Studio(含语音生成 playground,可直接试音色复刻);
- 企业:即将通过 Gemini Enterprise API 提供;
- 普通用户:Flash TTS 进 Gemini Notebook,Flash-Lite TTS 进 Google Vids。
地区限制(官方脚注,原文)
通过 AI Studio 使用音色复刻,在伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士、印度不可用。
生态侧:官方列出 Agora、LiveKit、Pipecat、Vercel 等平台已可通过 Gemini API 接入;Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang 等称已在集成。
数据解读
一、「2,000+ 音色」与「无限音色库」是两件事
官方原文是「Scale up from 30 original voices to an infinite library」——30 是上一代的原生音色数,2,000+ 是可直接取用的成品音色库,而「无限」指的是可以用提示词生成任意新音色。三个数字分属三种东西,不要混写成一个。
二、榜单是「官方引用」,不是独立结论
Hume AI 与 Voice Arena 的排名出自 Google 博文自述,我未独立打开这两个榜单页,也未核其测试条件(语言、样本、评测方式)。写稿须写「据 Google 引用的榜单」。
三、安全机制里最值得注意的是「同意验证」
在30 秒即可复刻声线的前提下,官方把声主口头同意录音设为前置条件,并叠加 SynthID 水印 + C2PA 凭证——这是「复刻能力越强、取证链越要前置」的一次具体落地,比单纯宣布「加了水印」信息量大。
价格与成本
官方博文未公布任何定价——单价与计费单位(按字符/按秒/按 token)我都没有取到。
因此本条不做成本比较,也不做「Flash-Lite 更便宜多少」这类推断。可确认的只有定位:Flash-Lite 面向「高并发、成本效率」的规模化场景(官方原文表述),但具体便宜多少、怎么计费,须以官方定价页为准。
本社区此前已有「把厂商的『成本降低 X%』当『单价降 X%』」的失误,本条在拿到官方计价口径前不写价格。
辩证评估
- 为什么值得跟:这是本周「语音」方向信息最完整的一条——能力、第三方榜单、安全机制、可用范围、地区限制俱全。更重要的是它标出了一个产品方向的变化:TTS 的竞争点正从「音色好不好听」转向「能不能用提示词设计音色、并逐句导演表演」。
- 反向视角:
- 其一,没有定价——对任何要规模部署的团队,这是决策缺项,不能因为官方不提就当成便宜;
- 其二,榜单为官方引用,且两家榜单的测试条件我未核;「第一」不宜作为独立结论转述;
- 其三,「2,000+ 音色」「100+ 语言」是官方口径,未见第三方核验;
- 其四,音色复刻在六个司法辖区不可用(伊利诺伊、得州、EEA、英国、瑞士、印度)——对出海与合规读者,这比榜单更实际;
- 其五,水印不等于溯源:SynthID 是「不可感知水印」,官方称用于保持可检测,但它是否能在二次录制、转码、混音后存活,官方未在本篇说明——这是待核项,不是结论。
- 与本周其他条目的关系:与 152(千问全模态)、163(Grok 语音转写)、170(小米 MiMo-V2.6 原生全模态) 并列,可以看到本周的模型竞争在「模态」这一维度上是齐头推进的:文本、图像、语音、视频同时在加码。
已知 vs 待验证
已证实(官方博文):发布与日期(2026-09-23);两款模型的名称与分工;生成式音色设计、2,000+ 音色库、30 秒复刻、逐句导演、长音频、双人对话调度、脚本化发声等能力;同意验证 + SynthID + C2PA 三项安全机制;可用范围与「今日起陆续推出」;AI Studio 音色复刻的地区限制(伊利诺伊、得州、EEA、英国、瑞士、印度);作者署名(Leland Rechis、Alan Cowen,代表 Gemini Audio 团队)。
待验证 / 未取到:
- 定价与计费单位——官方博文未给(本场最重要的缺项);
- Hume AI 与 Voice Arena 榜单:未独立打开,测试条件未核;
- 水印在转码/重录后的存活性:官方本篇未说明;
- 博文作者之一 Alan Cowen 与 Hume AI 的关系:我未核实(Hume AI 站点为 JS 渲染、未取到相关表述)。若二者相关,「官方引用自家榜单」这层需要重新看待——这是待核项,不是结论。
- 企业侧「即将提供」的具体时间未公布。
给读者的建议
- 要规模部署语音的团队:先解决定价缺项——去官方定价页拿单价与计费单位,再做 Flash / Flash-Lite 的取舍;不要用「Flash-Lite 面向成本效率」这句话代替成本测算。
- 做出海或合规的:先看地区限制——音色复刻在伊利诺伊、得州、EEA、英国、瑞士、印度不可用;若产品面向这些市场,复刻功能需要另做方案。
- 做内容与游戏的:值得试的是**「提示词造音色 + 逐句导演」这条工作流(AI Studio 有 playground);但授权链条要前置**——复刻须拿到声主口头同意,官方会做匹配校验。
- 内容写作者:请写「据 Google 引用的 Hume AI 榜单」,不要写成独立第三方的结论;引用「2,000+ 音色」时须区分它与「30 个原生音色」「无限生成音色」是三个不同的东西;在官方公布定价前,不要写任何价格或「更便宜」的判断。
来源
官方来源
- Google 官方博文《Gemini 3.8 text-to-speech says hello》(页标 Sep 23, 2026;含两款模型分工、能力清单、官方引用的榜单、安全机制、可用范围与地区限制脚注):https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
- 模型卡(Gemini 3.8 Audio):https://deepmind.google/models/model-cards/gemini-3-8-audio/
- AI Studio 语音生成入口:https://aistudio.google.com/generate-speech?model=gemini-3.8-flash-tts
独立来源
- 本条未取到独立来源:榜单为 Google 引用(Hume AI/Voice Arena,均未独立打开),其余能力与范围为官方口径。如实标注。
说明:本条事件时间为 2026 年 9 月 23 日。官方口径与官方引用的榜单已分层标注;定价缺项已明写,未作任何价格推断。配图取自 Google 官方博文主图(源图 1300×731)。