⚡ 猫叔的AI资讯雷达
AIGC开源模型

腾讯混元开源AuK,统一支持语音与音频编辑

腾讯混元联合上海交大等机构发布开源基础模型AuK,尝试用自然语言统一生成和编辑语音、音频与音乐。

腾讯混元发布AuK开源基础模型,面向语音、通用音频和音乐的生成与编辑,并支持通过自然语言描述创作意图。这一项目在亚洲白天时段公布,同时开放了代码仓库和项目页面。

从语音合成走向统一音频模型

AuK并非只做语音合成,而是试图把多类音频任务放进同一套架构。项目介绍称,模型由负责语义控制的多模态大语言模型、同时在语音、通用音频和音乐上训练的音频变分自编码器,以及混合Rectified Flow Transformer组成。后者先使用双流多模态模块,再转入统一的单流结构完成生成。

这套设计的目标,是让用户同时用文字描述“要生成什么”和“如何修改”。AuK既可用于语音生成和编辑,也试图覆盖音效、音乐以及混合声音场景。项目由腾讯混元、上海交通大学和上海人工智能实验室相关机构共同推进。

开源音频仍缺一块基础设施

相比文本和图像,音频生成对开源开发者一直更不友好。传统语音系统往往把语义规划、声学建模、音色保持和后期处理拆成多个组件,改造和组合成本较高。AuK若能提供足够完整的权重、数据说明和许可条款,有机会成为开发自然语言音频工具的共同底座。

不过,现阶段还不能据此判断它已达到商业闭源系统的最佳水平。公开信息尚未证明其在自然度、节奏、歌声、说话人保持和安全控制方面的表现,也没有完全回答训练数据来源、声音滥用防护以及本地运行所需硬件等问题。

为什么值得关注

AuK的意义,不在于今天就击败某个商业产品,而在于开源模型生态开始补上音频这一关键拼图。若模型和评测能够复现,配音、游戏音效、无障碍工具以及交互式智能体都可能获得更低的试错门槛。真正决定其影响力的,将是开放权重的完整程度,以及编辑已有录音时能否同时保住音色、语义和上下文。

信源