微软发布MAI-Transcribe-2流式语音模型
微软新模型支持60种语言的连续转写,让语音代理能在用户说完之前开始理解请求、准备工具调用。
微软发布MAI-Transcribe-2-Streaming流式语音识别模型,可通过Microsoft Foundry和Azure Speech使用。模型会持续生成阶段性转写,随着音频输入不断修正,并在一句话结束后提交稳定结果。
为连续对话而设计
该模型支持60种语言和自动语言检测。微软称,它能在接收音频后的数百毫秒内给出初始结果,通常约在语音发出320毫秒后显示文字;在微软引用的评测中,最接近的竞争系统需要超过500毫秒。
阶段性结果与最终结果的区别,对语音代理尤其关键。系统可以在用户尚未说完时开始判断意图、准备工具调用或选择回复,从而减少传统流程中的空等时间:过去,应用通常要等完整句子结束,再把文字交给语言模型。
微软将其定位于呼叫中心、语音助手、会议、课堂和实时字幕等场景。开发者既可以通过兼容OpenAI Realtime的WebSocket接口接入,也可以使用Azure Speech SDK,由后者处理连接管理等工作。
为什么重要
这次发布的重点不只是语音识别榜单上的新成绩,而是把语音代理的延迟问题推进到应用架构层面。更快的阶段性转写能让推理和工具准备与说话过程重叠,但早期结果也可能出错,甚至诱发过早操作。由于目前仍是公开预览版,稳定性和错误处理方式尚待验证。不过,多语言覆盖、流式输出和面向代理的接口组合,正在把语音识别从被动转录步骤变成AI系统的主动控制入口。