通义连发两款多模态模型:图像 3.0 卷排版,TTS 登顶榜单
阿里通义本周连发 Qwen-Image-3.0 与 Qwen-Audio-3.0-TTS:前者单次生成整版信息图、连 10 像素小字都清晰可读,后者登顶 Artificial Analysis 语音榜。
阿里通义团队本周接连推出两款多模态模型:面向高密度图文排版的图像生成模型 Qwen-Image-3.0,以及托管式语音合成系列 Qwen-Audio-3.0-TTS——后者已登顶 Artificial Analysis 的 Speech Arena 榜单。
图像生成不再只画画,而是排版
7 月 21 日发布的 Qwen-Image-3.0 支持最长 4500 token 的提示词,可单次生成完整的多栏信息图、报纸版面、论文排版和多层嵌套的界面原型——小到约 10 像素的文字依然清晰可读,数学公式也能正确渲染,覆盖 12 种语言。它还支持匹配原作风格的精细编辑,例如修复传统水墨画。这一转向既是技术的也是战略的:此前的 Qwen 图像模型追求审美质量,3.0 直接瞄准实用文档生产。目前仅开放邀请制 API,且团队已暗示权重大概率不会开源——对一个靠开源立身的实验室来说,这是个值得注意的转折。
语音合成登顶
早一天上线的 Qwen-Audio-3.0-TTS 分 Flash 和 Plus 两档,支持 16 种语言及多种中文方言,可通过自然语言提示和"[生气]"这类非语言标签控制说话风格。Plus 档以 1236 的 Elo 分登顶 Speech Arena,险胜 Simba 3.2;定价为每百万字符 27.6 美元,通过阿里云百炼提供。短板在吞吐:约每秒 16 字符,远逊于 Sonic 3.5 等竞品;Flash 档则以约 300 毫秒延迟主打实时场景。
为什么重要
这两连发展示了中国头部开源实验室的双轨策略:文本模型层继续开源"卷平价",最强的多模态系统则收进付费云服务。10 像素可读文字和单次成图的信息图,把图像生成从"插画"推向"文档工具"——那是大得多的企业市场;而就在华盛顿争论是否封禁中国 AI 的同一周,中国模型登顶西方语音榜单,能力差距收窄的速度不言自明。