⚡ 猫叔的AI资讯雷达
模型AIGC产业

通义千问发布 Audio 3.1,语音模型全面扩容并降价

阿里通义千问推出覆盖识别、合成、实时交互与音频创作的 Audio 3.1 系列,并大幅下调语音调用价格。

发生了什么

阿里通义团队发布 Qwen-Audio 3.1,更新覆盖自动语音识别、文本转语音和实时语音交互三大方向,并新增 TTS-Next 音频创作模型与 ASR-Next 音频理解模型。通义将这套产品定义为覆盖语音理解、生成、交互和创作的完整能力栈。

此次更新还伴随明显降价。阿里方面信息显示,TTS 价格下降约 70%,Realtime 下降约 85%,ASR 降幅最高达到 95%。阿里云 Model Studio 文档显示,Qwen-Audio 3.1 Realtime Plus 支持文本和音频输入输出、函数调用、联网搜索与声音克隆,上下文上限为 262144 个 token。

为什么重要

这次升级的价值不只是增加一个语音模型,而是把语音能力包装成一层通用应用基础设施。开发者可以在同一模型家族内完成转录、语音回复、实时对话、音频生成和音频分析,并把这些能力接入工具调用和网页检索。

降价可能比型号升级更值得关注。语音系统往往服务于长时对话和高频客服流程,音频 token 很容易成为主要成本。更低的调用价格,会让持续语音界面、通话分析和多语言助手更容易进入大规模部署,尤其适合预算敏感的市场。

当然,独立评测仍然不足。现有信息证明了产品覆盖扩大和价格下降,但还不能证明它在延迟、发音、情绪控制或嘈杂多人识别方面领先。尽管如此,完整产品线叠加激进定价,已经释放出一个清晰信号:语音 AI 正从单点能力走向可调用工具的综合平台。

信源