阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一

Awake 2026-09-15 16:13 1

今日阶跃正式发布 StepAudio3 系列模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,其中多款模型在 Artificial Analysis 榜单中位列全球第一。以上五款模型,目前均已上线阶跃星辰开放平台。


官方称,StepAudio 3 系列分别面向几类核心场景:真人级语音生成、完整音频内容生成、实时语音交互、复杂场景语音理解和音乐创作。


模型官方详细介绍如下:


StepAudio 3 Realtime:不仅“能打断”,更能理解、思考和行动


今天,越来越多 Realtime 语音产品已经支持全双工、打断和低延迟交互。真正拉开体验差距的,不只是“能不能同时听和说”,而是模型能否在一场持续发生的对话中,边听边理解、判断何时接话,同时完成推理和任务执行。


StepAudio 3 Realtime 围绕这一目标进一步提升实时交互能力,支持原生全双工实时对话。


在 Artificial Analysis Conversational Dynamics 榜单中,StepAudio 3 Realtime 以 98.9% 的综合得分排名全球第一,展现出领先的实时语音交互能力。这意味着模型不仅能够“听懂”和“回答”,更能够像真实交流中的人一样判断对话节奏 —— 知道什么时候该回应、什么时候该等待,以及如何处理用户的临时打断和连续反馈。


阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一

最新回复 (4)
  • learner063 09-15 16:25
    1

    但是asr说话人分离这个好像没咋明确说

  • 内一衡径数 09-15 16:37
    2

    还没开源,等开源了部署看看效果

  • lastsue 09-15 18:00
    3

    目前用的几家的都很难处理多人说话问题

  • 老酒 09-15 18:04
    4

    以后打电话找“人工”客服,真就有可能是实时语音聊天的模型服务了

* 帖子来源Linux.do
返回