Meta 推出实时语音模型 Muse Voice Transcribe
Meta首款实时音频感知模型以80毫秒为单位处理语音,覆盖70多种语言,并通过自适应等待在速度与准确率之间动态取舍。
边听边写,而非录完再处理
Meta发布Muse Voice Transcribe,并称其为Meta Superintelligence Labs开发的首款实时音频感知模型。该模型属于Muse Spark系列,采用自回归多模态架构,目标是在说话仍在进行时持续输出文字,而不是等完整录音结束后再统一转写。
模型以80毫秒为一个音频处理单元,相当于每秒接收12.5个输入步骤。每一步都可以选择立即输出文字,也可以等待更多声音证据。这个自适应延迟机制能够让模型在遇到含混词语时暂缓决定,同时快速返回较清晰的内容,从而在转写准确率和一句话最终定稿所需时间之间进行动态平衡。
Meta称,以最终转写时间衡量时,该模型处于速度与准确率权衡的帕累托前沿。换言之,在其对照范围内,其他系统若要改善其中一项,就必须牺牲另一项。Meta表示,该模型使用70多种语言训练,其中25种在发布时经过较充分验证;它还支持超过一小时的音频、20名以上说话者和语言切换。不过,目前仍缺少足够的独立部署数据来判断它在不同口音、嘈杂环境及多人重叠发言中的稳定性。
Muse Voice Transcribe已通过Meta Model API公开预览,并用于Mac版Meta AI和Muse Code中的语音输入。Meta没有发布可下载权重,因此这次上线属于托管服务,而非开放权重发布。开发者接口的首发价格为每1000分钟音频3美元,折合每小时0.18美元。
为何重要
实时转写正在成为语音智能体、现场助手和无障碍工具的底层能力。在这些产品中,最后一个词多久才能确定,与总体准确率同样重要:等待过久会让智能体显得迟钝,过早输出又可能触发错误操作。Meta的逐片段决策机制正面处理了这一矛盾。其商业价值将取决于官方公布的多语言和多人识别能力能否在真实部署中稳定复现。