⚡ 猫叔的AI资讯雷达
模型AIGC产业

通义发布实时同传模型Qwen3.8-LiveTranslate

阿里通义推出实时同传模型,整合说话人识别、翻译和语音合成,覆盖数十种语言与多说话人场景。

阿里通义团队推出Qwen3.8-LiveTranslate,这是一款面向实时同声传译的模型,能够处理音频和视觉上下文,并输出翻译文本与语音。

模型采用Thinker–Talker双模块架构。Thinker把源音频、视频、文本和译文放进同一条交错序列中处理,Talker则生成译后语音,并尝试保留原说话人的声音特征。通义称,该模型支持60种输入语言和29种语音输出语言,涵盖中文、英语、日语、韩语、粤语、阿拉伯语和越南语等。

通义公布了两组评测结果。在覆盖14个语言方向的长音频、多说话人Omnilingua-MSpeaker数据集上,通义称LiveTranslate在翻译忠实度、流畅度、简洁度和说话人分离错误率方面优于主流实时系统。在覆盖70个语言方向的FLEURS测试集上,通义报告其翻译质量、语音识别准确率、平均延迟和语音合成质量均有提升。

该模型目前通过阿里云实时API提供,并非公开权重模型。商业服务支持音频和图像输入,返回文本与音频,并通过WebSocket接口调用。阿里云文档显示,Flash Realtime版本的端到端延迟约为2.3秒。

实时同传的难点并不只是翻译本身,还包括何时停止聆听、如何保持多人对话上下文、如何避免人名误译,以及在句子尚未说完时提前生成自然语音。通义采用交错式架构,试图把这些问题放在一个模型流程中共同处理,而不是简单拼接语音识别、机器翻译和语音合成系统。

为什么重要:这项发布强化了中国厂商在多模态实时交互领域的竞争力。不过,在嘈杂环境、多人抢话和低资源语言条件下,通义的性能仍需要独立验证。

Uncle Cat take

真正值得注意的是“60种输入、29种输出”的完整链路,通义卖的是同传系统而非单纯翻译器。

信源