⚡ 猫叔的AI资讯雷达
模型AIGC产业

Gemini Omni 1.1补齐长视频与镜头控制

谷歌新一代视频模型支持最长40秒场景延展、首尾帧控制、低成本草稿及4K输出。

AI视频进入可反复编排的工作流

谷歌通过Gemini API发布Gemini Omni 1.1 Flash,重点增加面向实际制作流程的控制能力。模型可以每次延展十秒,连续生成最长40秒的视频,并参考此前最多十秒的画面来维持叙事和视觉连贯性;上一代方案只能参考结尾一秒。

创作者还可以同时指定镜头的起始帧和结束帧,由模型补全两者之间的运动过程。这项能力适合制作环绕运镜、推拉镜头、转场和循环动画,比单纯使用文字描述更容易约束结果。模型还能接收最长三秒的参考视频,用其动作或视觉信息指导新场景。

Omni 1.1新增360p草稿模式。谷歌称,其生成速度最高可提升60%,成本约为标准720p版本的三分之一;选定结果后,用户可以进一步生成或放大到1080p、4K。模型已进入Google AI Studio和Gemini企业智能体平台,场景延展功能也开始通过Gemini与Flow向全球Google AI Plus、Pro及Ultra订阅用户开放。

谷歌的模型说明仍将复杂编辑中的一致性、高难度运动和准确文字生成列为局限。模型虽然能够在编辑时改变人物讲话内容,但谷歌目前限制了这项能力,以继续评估安全风险。

为什么重要

这次更新最有价值的变化,是把廉价试错与高质量成片分开。视频团队通常要淘汰大量候选镜头,低清草稿、明确的首尾帧和可复用参考素材能够降低试错成本,也让结果更容易控制。40秒仍不足以直接生成完整场景,但Omni 1.1已将AI视频从一次性抽奖,推进为创作软件可以拆解、编排和反复调整的生产步骤。

信源