腾讯混元发布 Hy ASR 3.0 preview,元宝已首发上线
腾讯混元新一代语音识别模型上线,普通话、英语、粤语词错率均约 3%,已在腾讯云开放 API,元宝端免费可用。
腾讯混元团队 8 月 4 日发布新一代语音识别模型 Hy ASR 3.0 preview,其定位不是传统意义上的声学识别管线,而是把语音识别直接架在大模型的语言能力之上。
发布了什么
按混元的说法,Hy ASR 3.0 preview 复用了自家 Hy3 基座模型的语言理解能力,用它去消解纯声学解码解决不了的歧义——同音词、专有名词、行业术语,以及只有结合前几句话才能判断的表述。腾讯把这一变化概括为:从「逐字转写」走向「理解上下文、判断场景、一次给出结果」。
公开测试集上,团队给出的词错率为普通话 3.34%、英语 2.62%、粤语 3.12%。在内部评测中,混元称该模型在通用识别、方言识别、上下文理解和复杂声学场景鲁棒性四个维度上,词错率均低于对比系统。粤语及更广泛的方言覆盖是这次重点强调的方向,而这恰恰是中文语音产品长期以来的薄弱环节。
该模型走的是商业服务路线,并未开源权重。目前已在腾讯云官网开放 API,面向智能客服、语音搜索、内容理解等场景;腾讯自家的元宝已首发接入,用户可免费体验方言识别、结合上下文纠错以及嘈杂环境下的稳定转写。
为什么重要
语音识别正在悄悄变成语音智能体的关键底座:智能体的工具调用可靠性上限,取决于它拿到的那份转写文本——一个听错的订单号或地址,会顺着整条链路一路错到底。把识别过程交给大模型的语言先验来兜底,腾讯下的注和阿里 Qwen ASR 系列、xAI 语音栈近期的选择是同一个:转写精度的瓶颈已经从声学转到了语义。
发布节奏同样值得注意。腾讯一边把模型免费塞进元宝,一边在云上按量计费开放 API——这是国内厂商拉开发者的惯用双轨打法。而粤语、方言的词错率已接近普通话水平,也让腾讯在香港与东南亚市场更有底气:在那些地方,多语言与语码混用是常态,而不是长尾特例。