⚡ 猫叔的AI资讯雷达
模型Agent

谷歌发布 Gemini 3.8 Live 实时语音模型

Gemini 3.8 Live 面向生产级语音代理,主打更低延迟、视觉理解、97种语言切换与更低音频成本。

谷歌发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款原生音频模型,目标是生产级语音代理,而不只是展示式聊天。两款模型已分别面向消费者、开发者和企业分阶段开放:消费者可在 Search Live 中使用,开发者可通过 Gemini API 与 AI Studio 申请公测,企业则进入私测渠道。

面向连续对话设计

谷歌称,两款模型将对话推理、近实时音频处理和视觉理解结合在一起,能够在持续对话中判断何时接话、处理打断、保持上下文,并在交流过程中执行任务。Extended Thinking 版本增加了更深的推理模式,适合需要先规划再回答或行动的场景。

多语言能力也是此次发布的重点。谷歌表示,模型支持 97 种语言切换,这对客服、旅行和跨语言销售尤其重要,因为用户可能在同一通对话中改变语言。随发布同步公开的模型卡则介绍了模型用途、评测结果、安全措施与分发条件。

语音代理进入成本竞争

发布周期内,Artificial Analysis 的测算显示,Gemini 3.8 Live 输入音频成本约为每小时 0.84 美元,约为 Gemini 3.1 Flash Live 1.75 美元的一半。该机构还报告称,模型在 Big Bench Audio 上的平均首个音频响应时间为 1.18 秒,Extended Thinking 版本为 1.35 秒。若这些数据能在真实部署中保持,模型就不只是“会聊天”,而是更适合大规模客服和销售电话。

这次发布的重要性在于,语音代理正在从附加功能变成客服、销售、辅导和任务执行的工作层。更低的音频成本降低了持续保持通话的代价,更低的延迟则改善了打断和轮流说话的自然度。真正仍待验证的是,在噪声、长时通话、工具失败和企业安全约束下,实验室数据能否稳定复现。谷歌争夺的已经不只是模型能力,而是整套语音交互的运营经济学。

信源