AI 快讯 | 阶跃星辰发布 StepAudio 3:5 款语音大模型,AA 交互全球第一

AI 快讯 | 阶跃星辰发布 StepAudio 3:5 款语音大模型,AA 交互全球第一

:fire: 一句话核心:阶跃星辰发布 StepAudio 3 系列 5 款语音模型——Realtime 以 98.9% 综合得分登顶 Artificial Analysis 实时语音交互榜全球第一、99.7% Speech Reasoning 第一、ASR WER 1.7% 并列第一,覆盖对话/识别/合成/音频生成/音乐五大场景。


:bar_chart: AA 独立评测成绩

模型 榜单 成绩 排名
Realtime Conversational Dynamics 98.9% :1st_place_medal: 全球第一
Realtime Speech Reasoning 99.7% :1st_place_medal: 全球第一
ASR 非流式 WER 1.7% :1st_place_medal: 并列第一

:key: 核心突破

  • Realtime 不仅「能打断」,更能「边想边做」:支持原生全双工,Tool Call 异步执行不阻塞对话——等复杂任务结果时仍可继续交流。能理解语气、情绪、副语言和环境声音
  • TTS 逼近真人表达:不仅能还原笑声、迟疑、结巴、重复等真实交流中的副语言,还结合语义内容自主调整情绪与语气
  • Gen + Music 创作全链路:Gen 可一次生成人声+音效+环境音+BGM 的完整音频;Music 支持 ABC 记谱法多轮交互创作、清唱配乐

:bullseye: 信号意义

这是国产语音大模型在 AA 独立评测中首次实现多项全球第一。98.9% 交互动态能力 + 99.7% 语音推理,标志着国产语音 AI 从「跟跑」到「领跑」的转折。对语音 Agent、实时客服、有声内容生产有直接落地价值。


来源链接