谷歌推出Gemini 3.5 Transcribe语音转写模型
谷歌新模型支持实时多语种音频、自动清理口头停顿,并在Gemini macOS版等产品中为语音驱动的任务流程提供输入能力。
实时与录音分为两个版本
谷歌推出Gemini 3.5 Transcribe语音转文字模型,分别提供面向实时流媒体和预录音频的两个预览版本。开发者可通过Gemini API和Google AI Studio使用;谷歌也已将相关技术用于Android版Gboard的Rambler功能及Gemini macOS版等产品。
预录音频版本支持超过85种语言,输入上限为96,000个词元,并可为最多三名说话者添加身份区分和时间戳。谷歌在部分FLEURS语言上的基准测试显示,非流式词错误率为5.04%,流式模式为5.50%。这些结果来自谷歌公布的测试,不能代表所有口音、噪声环境和专业词汇场景。
转写开始成为操作入口
这款模型并不局限于逐字记录,而是试图直接输出可用文本。它可以删除“嗯”“啊”等填充词,自动添加标点和排版,理解用户口头作出的修改,并改善电话号码、邮编和订单编号的识别。对话中途切换语言时,模型也能继续处理。
在Gemini macOS版中,谷歌把转写功能与其他Gemini模型组合,使语音命令能够启动图像生成、信息查询、文档摘要和文件分析等任务。谷歌将这一产品体验描述为函数调用,但当前Gemini API文档明确标注Transcribe接口本身不支持函数调用。因此,开发者不应把工具调用视为两个转写API的原生能力。
这种产品层面的组合仍让语音转写成为智能体的输入层:用户可以连续口述内容、用语言修订措辞,再直接启动任务。但这种“理解后整理”也带来准确性与治理问题,因为删除停顿或推断意图可能改变记录的证据价值。
为什么重要
语音识别正在从独立的文字转换工具,变为智能体系统的基础设施。谷歌能够同时通过消费级软件、企业工具和开发接口分发该模型,使其在发布时就具有广泛覆盖。它对字母数字组合的加强解决了语音界面的长期痛点,Gemini macOS版等产品集成则进一步把说话与实际操作连在一起。不过,医疗、法律和合规用户必须明确区分“整理后的听写稿”与“忠实逐字记录”,因为被删掉的犹豫或被改写的表达有时本身就有意义。