谷歌推出可编程声音设计的Gemini语音模型
Gemini 3.8 Flash TTS系列支持用自然语言设计声音、逐句控制表演,并覆盖100多种语言和方言。
发生了什么
谷歌发布Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,定位已经从固定音色库转向可编程的音频生成系统。Flash TTS主打表现力和角色设计,Flash-Lite则面向配音、批量音频制作和语音智能体等高并发、低成本场景。
用户可以用自然语言描述声音,指定角色、口音和表达方式。谷歌称,这两款模型覆盖100多种语言和方言,提供2000多种可直接用于生产的声音,并支持逐句控制语速、情绪、停顿以及对话中的附和声。
系统还支持从30秒音频样本复制声音,但需要经过同意验证。谷歌表示,生成音频会加入SynthID水印和C2PA凭证。模型已通过Google AI Studio和Gemini API开放,也被接入Gemini Enterprise、Gemini Notebook和Google Vids等产品。
为什么重要
这次变化的核心,是从“挑选一种声音”转向“编排一场表演”。对于游戏、有声书、教育、内容本地化和交互式智能体来说,角色声音的一致性与表达控制,重要性已经接近发音准确度。
不过,现有防护措施还不能解决所有权利问题。同意验证和来源标记能帮助守规矩的客户,却无法自动处理名人声线、地方口音或训练素材授权争议。它最终能否成为基础设施,取决于Flash-Lite能否在大规模生产中保持表现力,同时不把创作者带入新的身份和许可风险。