8 月 27 日,谷歌在 Google AI Studio 和 Gemini API 上正式推出 Gemini Omni 1.1 Flash,一个面向开发者的视频生成模型更新。这次的重点不是参数或画质口号,而是把"生成视频"往"导演视频"的方向推:场景扩展、首尾帧指定、4K 输出,外加更便宜的 360p 预览。对做视频工具、内容生产的人来说,这是一次工作方式的改变,不是版本号 +0.1 那么简单。
这个热点的技术本质是什么
先看几个关键变化,都来自 Google 官方博客的说明:
- 场景扩展 :模型现在可以分析最多 10 秒的先前视频上下文,而之前只参考最后一秒。按 10 秒步长逐段延长,单条视频累计最长 40 秒。
-
- 首尾帧生成:指定第一帧和最后一帧,模型生成中间的连续画面,适合运镜、转场、无缝循环这类需求。
-
- 4K/1080p 输出:可以直接出高清成片,省掉"生成完再超分"这一步。
-
- 360p 预览:据报道(据 Google 官方博客),360p 草稿比 720p 生成快最多 60%,成本约是 720p 的三分之一。
-
- 视频参考 :多模态输入里可以引用最多 3 秒的视频,保持角色和画面一致性。
技术上这不是新架构,Gemini Omni 系列的底子没变,变的是一整套"控制手段"。以前生成视频基本是抽卡:写个 prompt,出一段,不满意就重抽,最多改改文字。现在模型能"理解"已有视频的内容再继续往下接,能按关键帧约束镜头运动,等于把剪辑师的工作流拆成了模型可以执行的动作。
- 视频参考 :多模态输入里可以引用最多 3 秒的视频,保持角色和画面一致性。
变了什么,没变什么
变了的是成本结构和工作流:草稿阶段用 360p 快速迭代、定稿阶段出 4K,这在以前是做不到的------之前不管成不成型,都按同样的分辨率烧钱。据报道 Adobe Firefly、Figma Weave、Runway、GMI Cloud 等都已接入该模型,说明这类"可控视频"能力正在快速成为创作工具的标配。
没变的是生成式模型的老毛病:长镜头下角色一致性、物理细节仍然要靠人工挑素材兜底;40 秒是累计上限而非单次上限,叙事稍长就得分段生成再拼接;所谓的控制是"概率上的控制",不是关键帧动画那种确定性控制。指望它一次出片,目前还不现实。
对普通开发者意味着什么
如果你在折腾视频生成、短视频工具、营销物料自动化,这个模型值得直接上手。官方博客给了场景扩展的 Python 示例,我抄过来做示范(代码来自 Google 官方文档):
python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[{"type": "text", "text": "Continue the scene."}],
response_format={"resolution": "360p"},
)
```
几个实际建议:
- **草稿和成片分开跑**:先用 360p 确认叙事和镜头,定了再出 4K。官方口径是成本差三倍,量大的项目这不是小钱。
- - **长视频用步进式扩展**:10 秒一步往外扩,比一次生成更容易控制情节走向,也方便中途修正。
- - **有运镜需求的优先用首尾帧**:指定起止帧让模型补中间,比在 prompt 里描述"镜头缓缓推进"稳定得多。
- - **别省掉素材检查**:多模态参考只有 3 秒,复杂场景的角色一致性依然要自己做参考图/参考视频的管理,指望一条 prompt 全搞定不现实。
坑也明摆着:一是计费按分辨率、时长走,官方给的"三分之一成本"是相对 720p 的口径,做预算前先跑小样实测;二是 API 形态还在快速迭代,接的时候尽量把模型调用层封装好,别把版本号写死在业务代码里。
## 结尾
视频生成打到了第二阶段:不是"能不能生成",而是"能不能按我的意思生成"。控制手段越多,离落地就越近,至于成本算不算得过来,得等真跑完一轮才知道。你怎么看,评论区聊聊。