一句话核心:xAI(现以 SpaceXAI 名义运营)发布 Grok Voice Transcribe 2.0,官方页面写得很直接:精度翻倍,价格不变——批量转写 0.10 美元/小时音频、流式 0.20 美元/小时,说话人分离(diarization)、时间戳与关键术语加权包含在价格内、不额外收费。两个必须注意的动作项:2.0 将很快成为语音转写 API 的默认模型,而 1.0 将在数周内弃用——需要留在旧版的用户必须在请求里钉住 grok-voice-transcribe-1.0。
背景脉络:这条的价值在「计价单位」
过去几轮本专区一直缺「价格与计费单位」这个维度——多数厂商要么只发模型不调价,要么只在发布时给个笼统的相对降幅。这条不一样:它给出了明确的、按音频小时计的单价,并且公开列出与竞品的价格对比图(官方页面对比对象为 ElevenLabs Scribe v2 与 Deepgram Nova-3)。
按音频小时计价对做语音产品的团队是关键信息:成本不再与「token 数」挂钩,而直接等于你要处理多少小时的音频——这让预算可以按业务量线性估算。
关键细节
- 能力主张:官方称 2.0 的精度是 1.0 的两倍(twice as accurate)——属厂商口径,本轮未见第三方测评。
- 价格(官方页面):批量(Batch)0.10 美元/小时音频;流式(Streaming)0.20 美元/小时;与 1.0 完全一致。
- 包含项:说话人分离(diarization)、时间戳、关键术语(key terms)均包含在价格内,不额外计费。
- 迁移动作:官方称 2.0 将很快成为语音转写 API 的默认模型;1.0 将在数周内被弃用;想继续用旧版的客户可在请求中钉住
grok-voice-transcribe-1.0。 - 发布信息:官方页面标注发布日 2026 年 9 月 18 日;据第三方报道,2.0 还支持智能话轮检测(smart turn detection)。
- 官方引用的一条榜单口径:官方页面称,在 Artificial Analysis 公开榜单上,Grok Voice Transcribe 2.0 在 32 个流式模型中精度排名第一——属厂商引用的榜单口径,读者可自行回榜单核对。
- 官方给出的使用场景规模(用于说明该音频基座的成熟度):Grok Voice 每天承载数万通客服通话、转录数百万小时视频旁白,并驱动实体产品中的语音 Agent(包括特斯拉车辆里的 Grok 助手);训练数据为跨环境的真实、嘈杂、多语种音频。
价格解读
| 模式 | 单价 | 计价单位 | 说明 |
|---|---|---|---|
| 批量转写 | 0.10 美元 | 每小时音频 | 与 1.0 同价;含说话人分离、时间戳、关键术语 |
| 流式转写 | 0.20 美元 | 每小时音频 | 同上 |
(以上为 xAI 官方发布页口径。官方页面同时给出了与 ElevenLabs Scribe v2、Deepgram Nova-3 的价格对比图表;本文字面只采用其自身价格,未转述竞品数值以免误引图表读数。)
怎么算自己的账:如果你每月要处理 1 万小时音频,批量的成本是 1000 美元/月(不含并发与重试);流式是 2000 美元/月。这个口径比 token 计价更容易做预算,但也意味着成本优化空间主要在减少处理时长(例如先用语音活动检测裁掉静音),而不是压缩 token。
两个容易被忽略的变量:一是**「精度翻倍」若成立,能显著减少人工复核成本**——对转写类业务,人工复核往往比 API 费用更贵;二是流式与批量的两倍价差决定了架构选择:直播场景必须流式,离线批量(会议录音、内容归档)应尽量走批量。
价格与使用成本
- 价格未变:官方口径为 1.0 与 2.0 同价,属于「同价换精度」的升级,不是降价。
- 包含项即省钱项:说话人分离、时间戳、关键术语加权通常在其他厂商按附加功能计费,这里包含在单价内——对会议纪要与内容审核类应用,这项差别可能比单价本身更重要。
- 迁移成本:1.0 弃用后,未迁移的调用需要改模型 ID 或钉住旧版本;钉住旧版本意味着放弃「精度翻倍」的收益,属于过渡期权宜。
辩证评估
- 对语音产品团队的直接价值:这是可立即行动的决策信息——按音频小时计价、含关键附加功能、且给了明确的弃用时间窗。若你在用 1.0,现在就该排迁移;若你在选型,可以把这条价格放进对比表。
- 反向视角:
- 其一,「精度翻倍」是厂商口径,本轮没有第三方测评,也没有分场景(噪声、方言、多说话人重叠)的细分数据;转写质量的差异往往在难场景才显现。
- 其二,官方页面把自己与两家竞品并列对比,属于自选口径,读者不宜把图表当作中立评测。
- 其三,弃用窗口「数周内」未给确切日期,需要提前按最保守估计安排迁移。
- 其四,计价单位是音频时长而非 token,因此「便宜」与否取决于你的静音/无效音频比例——长静音较多的素材会放大成本。
- 其五,归属信息注意:xAI 现以 SpaceXAI 名义运营(据第三方报道,源于 SpaceX 今年 2 月的收购),引用厂商名称时需与官方页面的用法一致。
- 与本周其他条目的关系:这条与 152 篇(千问全模态输入统一 0.8 元)属于同一类信息——计价维度本身发生了变化(一个是把多模态输入拉平,一个是按音频小时计)。对做多模态应用的团队,这两条应该放在一起看。
已知 vs 待验证
官方已证实(xAI 官方发布页):批量 0.10 美元/小时音频、流式 0.20 美元/小时;说话人分离、时间戳与关键术语包含在价格内;价格与 1.0 一致;2.0 将很快成为语音转写 API 的默认模型;1.0 将在数周内弃用,可用 grok-voice-transcribe-1.0 钉住旧版。
待核实:「精度翻倍」的第三方验证与分场景数据;弃用的确切日期;智能话轮检测等具体能力(来自第三方报道);与竞品对比的图表读数(本文未转述)。
给读者的建议
- 正在使用 Grok Voice Transcribe 1.0 的团队:立即排迁移(官方口径为「数周内」弃用),先在小流量上对照 2.0 的输出质量,再全量切换;不要等到弃用通知才动。
- 在选型的团队:把「按音频小时计价」与竞品的「按分钟/按字符」换算到同一口径再比较;同时把说话人分离、时间戳是否额外收费计入——这是最容易漏算的部分。
- 成本敏感的批量场景:优先走 Batch(单价为流式的一半),并在预处理阶段裁掉静音与无效段落,收益比换模型更直接。
- 质量敏感的合规场景:等第三方或自建测试覆盖难场景(噪声、方言、重叠语音)后再定;不要用官方「精度翻倍」直接换算成人工复核成本的下降。
来源
官方来源
- xAI(SpaceXAI)官方发布页《Introducing Grok Voice Transcribe 2.0》(含价格与竞品对比图):https://x.ai/news/grok-voice-transcribe-2
独立来源
- MarkTechPost《SpaceXAI Releases Grok Voice Transcribe 2.0》(2026-09-18):SpaceXAI Releases Grok Voice Transcribe 2.0: A Speech-to-Text API Claiming 2x Accuracy Over 1.0 at $0.10 per Hour - MarkTechPost
- Unite.AI《xAI Releases Grok Voice Transcribe 2.0 Speech-to-Text Model》(2026-09-18,含默认模型与弃用说明):xAI Releases Grok Voice Transcribe 2.0 Speech-to-Text Model – Unite.AI
