阿里推出 CosyVoice Studio,把语音能力打包成一个平台
基于自研 Qwen-Audio 模型,把录音成稿、语音智能体与有声内容创作合为一体,四端上线并限时免费。
一个平台,三条产品线
阿里 8 月 7 日上线 CosyVoice Studio,称其为国内首个一体化 AI 语音生产平台。产品基于自研的 Qwen-Audio 语音模型,把识别、合成与语义理解收进同一套栈里,而不是拆成彼此独立的 API 对外提供。
平台包含三块。CosyFlow 是录音成稿层,会过滤「那个」「嗯」之类的口头禅,把说话人中途的自我更正悄悄改对,并把散乱表达重新组织成结构化内容——邮件、会议纪要或工作汇报,按场景排好版,而不是一份原始转录。它还支持连续录音模式,可区分发言人并自动多语种翻译。CosyAgent 允许用自然语言搭建语音智能体,接入企业知识库与工具调用,面向智能客服、电话营销等实时对话场景。CosyCreative 则把上传的文档转成对谈式播客或多角色有声书,配以数千种音色和音色克隆。
开放情况
录音成稿应用已在 iOS、安卓、Mac 与 Windows 四端上架,限时免费且核心功能不限量。智能体搭建与音频创作两块目前对企业客户白名单邀测,后续再逐步放开。
为何重要
真正值得看的是架构选择。多数语音产品把转写视为已解决的通用件,再在外面挂一层意图处理;阿里的主张是把语义理解下沉进语音层,产出物的性质就变了——不再是一份待整理的转录稿,而是一份已经理解了说话人意图的文档。这个框架也把语音重新定位为智能体的输入方式,而非无障碍功能,而企业付费意愿恰恰在后者之外。对这家此前开源过 CosyVoice 系列模型的厂商而言,此次发布意味着把分散的音频研究线收拢成一个商业化界面——恰逢中国各家平台争夺智能体栈的语音入口。