阶跃星辰发布 StepAudio 3 五模型音频家族
阶跃星辰推出覆盖实时语音、识别、合成、音频生成和音乐创作的五模型家族,并同步接入开放平台。
中国 AI 公司阶跃星辰发布 StepAudio 3 系列,包含实时对话、自动语音识别、文本转语音、通用音频生成和音乐创作五类模型。全系列已接入阶跃开放平台,因此这不是单纯的研究预览,也不只是一次单模型升级。
五个模型覆盖完整音频链路
StepAudio 3 系列包括 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen 和 StepAudio 3 Music。阶跃将 Realtime 模型定位为全双工交互模型:它可以处理用户打断,同时继续理解上下文、判断下一步行动并作出回应。ASR 和 TTS 则分别面向需要独立控制识别与声音输出的生产流程。
StepAudio 3 Gen 试图在统一框架中处理语音、声音设计、人声、音效、音乐以及混合音频场景。其技术报告介绍了渐进式预训练、多任务指令训练和监督微调等方法。对开发者而言,这意味着从一句语音提示生成完整音频资产时,不必为每种媒介分别接入不同服务。
关键在于整合,而不只是榜单
此次发布正值 AI 音频市场加速分化。大型实验室重点提升实时对话,专业厂商则分别深耕声音克隆、音乐和后期制作。阶跃把五款相互关联的模型放在同一个开放平台上,意图将分散能力组织成一套音频基础设施,尤其服务中文和亚洲市场开发者。
阶跃称,多款模型在 Artificial Analysis 评测中排名全球第一,但这类说法仍应理解为特定榜单上的结果,而非对整体能力的最终裁决。更重要的事实是,五款模型在发布时就已作为服务提供。它们可以缩短多模态产品从原型到上线的距离,但声音授权、音乐版权、训练数据、水印和跨境可用性仍是未解问题。StepAudio 3 的价值在于把语音、声音设计和音乐放到同一个产品入口;能否持续领先,最终取决于治理能力与创作者工作流,而不只是排名。