⚡ 猫叔的AI资讯雷达
模型Agent

谷歌推出Gemini 3.5 Transcribe语音转写模型

谷歌新模型支持实时多语种音频、自动清理口头停顿,并能把语音输入直接连接到调用工具的任务流程。

实时与录音分为两个版本

谷歌推出Gemini 3.5 Transcribe语音转文字模型,分别提供面向实时流媒体,以及预录音频和批处理的两个预览版本。开发者可通过Gemini API和Google AI Studio使用,模型还将进入Gemini macOS版、Gboard、Workspace及谷歌企业智能体平台。

批处理版本支持超过85种语言,输入上限为96,000个词元,并可为最多三名说话者添加身份区分和时间戳。谷歌在部分FLEURS语言上的自测结果显示,非流式词错误率为5.04%,流式模式为5.50%。这些结果尚不能代表所有口音、噪声环境和专业词汇场景。

转写开始成为操作入口

这款模型并不局限于逐字记录,而是试图直接输出可用文本。它可以删除“嗯”“啊”等填充词,自动添加标点和排版,理解用户口头作出的修改,并改善电话号码、邮编和订单编号的识别。对话中途切换语言时,模型也能继续处理。

实时版本还支持函数调用,可把语音请求交给其他Gemini能力执行搜索、图像生成、摘要或文件分析。这让语音转写变成智能体的输入层:用户可以连续口述内容、用语言修订措辞,再直接启动任务。但这种“理解后整理”也带来准确性与治理问题,因为删除停顿或推断意图可能改变记录的证据价值。

为什么重要

语音识别正在从独立的文字转换工具,变为智能体系统的基础设施。谷歌能够同时通过手机键盘、桌面软件、企业产品和开发接口分发该模型,首发覆盖范围十分广泛。它对字母数字组合的加强解决了语音界面的长期痛点,函数调用则进一步把说话与实际操作连在一起。不过,医疗、法律和合规用户必须明确区分“整理后的听写稿”与“忠实逐字记录”,因为被删掉的犹豫或被改写的表达有时本身就有意义。

信源