AI 快讯 | GPT-Live-1 上线 API:全双工语音模型,单模型取代 ASR→LLM→TTS 三件套

AI 快讯 | GPT-Live-1 上线 API:全双工语音模型,单模型取代 ASR→LLM→TTS 三件套

:fire: 一句话核心:OpenAI 将 GPT-Live-1 全双工实时语音模型正式上线 API——将传统「ASR→LLM→TTS」三步管线压缩为单一模型,支持打断处理、背景噪声过滤和工具调用,前端语音 $0.05/分钟,可连接 Codex 构建企业级语音 Agent。


:key: 核心亮点

  • 单模型全双工:一个模型同时完成语音理解与语音输出,省去了 ASR→LLM→TTS 的三段衔接延迟。复杂推理和工具调用可交由后端文本模型(如 GPT-6 Astra)处理。
  • 实战效果已验证:语言学习平台 Speak 使用后误打断次数减少约 80%;医疗服务平台 CTO 称代码量减少 80%、删除约 2.3 万行代码。
  • 企业工作流集成:可连接 Codex 和 OpenAI Presence,构建能查询企业系统、执行获批操作、必要时转交人工的语音工作流。12 种新声音同步上线(Quartz、Ripple、Vesper 等)。
  • 定价清晰:前端语音层 $0.05/分钟(约每小时 $3),后端模型和工具调用费用另计。

:bar_chart: 官方评测数据

指标 结果
Full Duplex Bench 比 GPT-Realtime-2.1 高 30 个百分点
Tau3 端到端语音 Agent(配 GPT-6 Astra 中等推理) 排名第一
Speak 误打断 减少约 80%
医疗平台代码量 减少 80%(删约 2.3 万行)

解读:Full Duplex Bench +30pp 是这次最硬的数据——它直接衡量「同时听和说」的能力,传统流水线架构在这个指标上天然吃亏。单模型架构的延迟优势在这里完全体现。


:money_bag: 价格

计费项 价格
前端语音层 $0.05 / 分钟(约 $3/小时)
后端文本模型 另行计费(按所选模型定价)
工具调用 另行计费

实操换算:一个典型的客服通话如果是 5 分钟,前端语音成本约 $0.25。如果后端接的是 GPT-6 Astra 做复杂推理,就要叠加文本模型的 token 费用。对于需要 Codex 工具调用的企业场景(预订餐厅、查库存、转人工),工具调用费用另算。


:bullseye: 为什么这次升级值得关注

过去语音 Agent 最大的痛点是延迟和「机械感」——ASR 转文字再送 LLM 再 TTS 念出来,每一步都是延迟叠加。GPT-Live-1 把三步压成一步,延迟降下去了,但更关键的是「打断处理」和「噪声过滤」让语音交互不再像对讲机。

对企业来说,$0.05/分钟的价格意味着语音 Agent 从「技术演示」阶段进入了「商业化」阶段。配合 Codex 工具链,电话预订、客服查询、语音下单这些场景可以开始算 ROI 了。

但有一点值得注意:前端 $0.05/分钟看起来便宜,但如果任务需要频繁调用后端文本模型做复杂推理,总成本会明显上升。适合「高频简单交互」(如预约、查询状态),不适合「低频深度推理」(如语音编程辅助)。


来源链接