从“随机抽一条”到“像导演一样控制镜头”,Google 正把 AI 视频带入可续拍、可走位、可精修的新阶段
Google DeepMind 更新了 Gemini Omni 1.1 Flash。截至 2026 年 9 月 1 日,它在 Arena 文生视频榜单排名第一,在图生视频榜单排名第二。比榜单更重要的是,模型一次补齐了 AI 视频生产中最缺的五项能力:长镜头续拍、首尾帧控制、视频参考、360P 草稿和最高 4K 输出。
导航页已整理官方产品入口、能力参数、适用场景和使用提示。

一、Arena 文生视频登顶,但排名只是结果
Arena 当前榜单显示,Gemini Omni 1.1 Flash 在文生视频中排名第一,图生视频得分 1488、排名第二。榜单会随投票变化,所以真正值得创作者关注的不是一个静态名次,而是模型开始理解“上一段发生了什么”和“下一镜应该怎么走”。
过去生成视频更像抽卡:一条提示词换一个孤立片段。Omni 1.1 Flash 则把前后镜头、关键帧、参考视频和分辨率分层组合成一套制作工作流。


二、最大升级:模型能“回看”前面 10 秒
场景延展功能允许模型分析最多 10 秒历史画面,再生成下一段 10 秒视频;连续调用后,累计长度可达到 40 秒。相比只参考最后一秒,10 秒上下文能保留更多角色脸部、服装、站位、灯光方向、对白语气和镜头运动。
这并不意味着连续性绝对不会出错,但它让导演可以围绕同一场戏逐段推进,而不必每次重新描述所有细节。

三、三句提示词,把特写一路拉成完整世界
官方演示从红发女子的侧脸特写开始:第一段横摇带入对话人物,第二段拉远揭示地下墓穴,第三段继续后撤,将场景扩展为失重的巨大图书馆。几次延展中,角色外观、红色侧光与空间关系保持连贯。
这类工作流的正确用法不是一次要求模型“拍完所有内容”,而是每次只推进一个镜头目标,并在提示词中重复必须保持的视觉锚点。

四、电影级运镜可以直接写进指令
Omni 1.1 Flash 的续拍指令可以明确要求移动变焦、机械急推、360 度环绕、时间冻结或持续后拉。模型不仅要生成画面,还要理解镜头运动如何改变透视、主体大小和空间纵深。
写运镜提示词时,建议同时交代四件事:摄影机怎么动、镜头焦段怎么变、主体在画面中保持什么状态,以及背景需要产生怎样的透视变化。

五、对白也能续:画面连续只是第一层
在港口人物对话演示中,镜头连续后拉,人物继续上一句没说完的话,配乐强度也随叙事推进。对于短剧、采访和虚拟角色栏目,这意味着续拍目标从“画面接上”升级为“表演和声音一起接上”。
实际制作仍应检查口型、声线、对白事实与环境音。重要台词最好先锁定文案,再让模型负责表演,避免事实性内容被自由改写。

六、首尾帧功能:头尾你定,中间交给模型
指定起始帧和结束帧后,模型会生成中间的连续运动。这对复杂转场、环绕镜头、产品变形、甩镜匹配和无缝循环尤其有用。它把过去依赖运气的过渡镜头,变成有明确目标的插值任务。
要提高成功率,首尾帧的主体数量、构图方向和光线条件不宜差异过大;变化很复杂时,可以拆成两到三段中间关键帧。

七、一镜到底和无缝循环,更适合商业镜头
大厅中的鼓手、萨克斯手和芭蕾舞者可以通过甩镜连续连接;另一个演示则让摄影机推进电视屏幕,屏幕中再次出现同一房间和人物,形成递归式循环。
这类镜头很适合音乐视频、产品广告、品牌片头与社交媒体循环视频。相比普通文生视频,首尾帧让创作者可以先确定品牌画面,再让模型负责运动。


八、视频参考:动作难描述,直接给模型看
模型可以引用最多 3 秒的参考视频,并与文字、图片一起作为输入。参考视频可以携带动作、节奏和运镜语言,例如让不同角色分别模仿古典舞、嘻哈和霹雳舞,同时保持在同一场景中表演。
这改变了人与模型的沟通方式:动作不必全部翻译成文字。但使用真人动作或商业素材时,应确认肖像权、表演权与素材授权。

九、三个应用方向:转场、看房与草稿室
Transition Studio 类应用可以输入首帧和尾帧,再选择传送门、甩镜、形变匹配或前景擦除等技法;房产应用可以在房间之间推拉环绕,同时约束模型不添加不存在的家具;Draft Room 则用多个低清变体并排比较,每次只改变一个变量。
这些案例说明,专业价值往往来自“把模型能力包装成固定流程”,而不是单独提供一个提示词输入框。


十、360P 草稿:把试错成本放到最低
官方称 360P 草稿生成最高可比 720P 快 60%,成本约为三分之一。正确流程是先批量生成低清版本,检查构图、动作、色调和镜头方向;选中后再放大到 1080P 或 4K,而不是从一开始就用最高规格反复抽卡。
草稿阶段不必追求纹理细节,只要能判断故事、镜头和节奏是否正确。对广告和短剧团队,这会显著提升提案与分镜确认效率。

十一、4K 输出与价格:先做草稿,再做母版
Omni 1.1 Flash 支持将成片输出到 1080P 或 4K。按照发布时的官方价格表,360P 为每秒 0.03 美元、720P 为每秒 0.10 美元、1080P 为每秒 0.15 美元、4K 为每秒 0.30 美元。价格可能调整,正式预算应以 Google 当前 API 页面为准。
| 规格 | 发布时价格 | 建议用途 |
|---|---|---|
| 360P | 0.03美元/秒 | 草稿、分镜、批量试方向 |
| 720P | 0.10美元/秒 | 常规预览与社交媒体 |
| 1080P | 0.15美元/秒 | 正式内容交付 |
| 4K | 0.30美元/秒 | 广告、影视与高规格母版 |


十二、完整制作流程:从分镜到4K交片
- 先明确故事目标、角色和视觉锚点。
- 用首尾帧确定镜头的起点与终点。
- 用360P生成多个草稿,每次只改变一个变量。
- 用视频参考补充难以文字描述的动作与节奏。
- 通过场景延展逐段续拍,并在每段后检查一致性。
- 将选中的镜头放大到1080P或4K,再进入剪辑、调色和声音混合。
这条链路把“抽卡”变成了可审阅、可回退、可比较的导演流程。你也可以阅读站内的Gemini Omni Flash 实测观察,了解上一代在对话式编辑方面的能力与限制。
十三、仍需注意的限制与风险
- 连续性不是绝对:长镜头中仍可能出现脸部、服装、手部和空间结构漂移。
- 地区限制:Google AI Studio、Gemini 和 Flow 的可用性可能因地区与账号套餐不同。
- 版权合规:视频参考、角色图片、音乐和声音都应确认授权。
- 榜单会变化:Arena 名次属于当前快照,不应作为唯一采购依据。
- 高分辨率不等于高质量:4K 放大无法修复草稿阶段错误的构图和动作。
十四、结论:AI 视频正在从生成工具变成导演系统
Gemini Omni 1.1 Flash 的意义,不只是画面更清晰,而是创作者可以控制故事如何延展、镜头如何运动、动作参考什么、试错花多少钱,以及最终用什么规格交付。
首尾帧定镜头,360P做草稿,视频参考锁动作,场景延展接戏,4K完成交付——这套流程让 AI 视频第一次真正接近专业制作语言。






