⚡ 猫叔的AI资讯雷达
AIGC模型安全

谷歌推出可编程声音设计的Gemini语音模型

Gemini 3.8 Flash TTS系列支持用自然语言设计声音、逐句控制表演,并覆盖100多种语言和方言。

发生了什么

谷歌发布Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,定位已经从固定音色库转向可编程的音频生成系统。Flash TTS主打表现力和角色设计,Flash-Lite则面向配音、批量音频制作和语音智能体等高并发、低成本场景。

用户可以用自然语言描述声音,指定角色、口音和表达方式。谷歌称,这两款模型覆盖100多种语言和方言,提供2000多种可直接用于生产的声音,并支持逐句控制语速、情绪、停顿以及对话中的附和声。

系统还支持从30秒音频样本复制声音,但需要经过同意验证。谷歌表示,生成音频会加入SynthID水印和C2PA凭证。模型已通过Google AI Studio和Gemini API开放,也被接入Gemini Enterprise、Gemini Notebook和Google Vids等产品。

为什么重要

这次变化的核心,是从“挑选一种声音”转向“编排一场表演”。对于游戏、有声书、教育、内容本地化和交互式智能体来说,角色声音的一致性与表达控制,重要性已经接近发音准确度。

不过,现有防护措施还不能解决所有权利问题。同意验证和来源标记能帮助守规矩的客户,却无法自动处理名人声线、地方口音或训练素材授权争议。它最终能否成为基础设施,取决于Flash-Lite能否在大规模生产中保持表现力,同时不把创作者带入新的身份和许可风险。

信源