谷歌将Gemini Live Avatar推向企业正式部署
谷歌宣布Gemini 3.8 Live with Live Avatar正式进入Gemini Enterprise,融合实时对话、同步视频形象、工具调用与97种语言支持。
谷歌宣布,Gemini 3.8 Live with Live Avatar已在Gemini Enterprise正式可用,将低延迟对话模型升级为面向企业的可视化智能体。该功能把双向语音交互与屏幕中的生成式人物结合起来:Avatar能够倾听、回应,并在后台调用工具时保持对话状态。
谷歌发布了什么
Live Avatar可以生成同步口型、面部表情和更自然的轮流发言效果,同时处理视觉与音频输入。谷歌称,系统支持97种语言切换,并能维持语音与视频的同步。企业可以使用预设Avatar;根据参考图片定制形象目前仍需获得官方许可名单资格。
这套系统面向客服、互动终端、导览和培训等场景。异步工具调用尤其关键:Avatar可以在后台查询信息或执行操作时继续与用户交流,而不是每次等待外部系统返回都停顿。
为什么值得关注
这不是一次单纯的研究展示,而是一个进入企业产品体系的正式发布。谷歌把具备视觉形象的智能体放进Gemini Enterprise,并支持部署到网页、移动端和互动终端。竞争焦点因此从“AI能否生成会说话的脸”转向企业是否愿意把合成形象当作一线交互入口。
不过,限制也很明确。定制形象仍受管控,实际价值取决于工具调用的可靠性、延迟和企业权限体系。谷歌表示所有生成的音视频都带有SynthID水印,但水印并不能单独解决冒充、披露和用户同意等问题。
对市场而言,真正重要的变化是:实时多模态智能体开始以覆盖全球语言的企业服务形式交付,而不再只是演示视频中的实验能力。