Gemini Omni 1.1 Flash 发布:场景扩展上限 40 秒,AI 视频生成转向可控

8 月 27 日,谷歌在 Google AI Studio 和 Gemini API 上正式推出 Gemini Omni 1.1 Flash,一个面向开发者的视频生成模型更新。这次的重点不是参数或画质口号,而是把"生成视频"往"导演视频"的方向推:场景扩展、首尾帧指定、4K 输出,外加更便宜的 360p 预览。对做视频工具、内容生产的人来说,这是一次工作方式的改变,不是版本号 +0.1 那么简单。

这个热点的技术本质是什么

先看几个关键变化,都来自 Google 官方博客的说明:

  • 场景扩展 :模型现在可以分析最多 10 秒的先前视频上下文,而之前只参考最后一秒。按 10 秒步长逐段延长,单条视频累计最长 40 秒。
    • 首尾帧生成:指定第一帧和最后一帧,模型生成中间的连续画面,适合运镜、转场、无缝循环这类需求。
    • 4K/1080p 输出:可以直接出高清成片,省掉"生成完再超分"这一步。
    • 360p 预览:据报道(据 Google 官方博客),360p 草稿比 720p 生成快最多 60%,成本约是 720p 的三分之一。
    • 视频参考 :多模态输入里可以引用最多 3 秒的视频,保持角色和画面一致性。
      技术上这不是新架构,Gemini Omni 系列的底子没变,变的是一整套"控制手段"。以前生成视频基本是抽卡:写个 prompt,出一段,不满意就重抽,最多改改文字。现在模型能"理解"已有视频的内容再继续往下接,能按关键帧约束镜头运动,等于把剪辑师的工作流拆成了模型可以执行的动作。

变了什么,没变什么

变了的是成本结构和工作流:草稿阶段用 360p 快速迭代、定稿阶段出 4K,这在以前是做不到的------之前不管成不成型,都按同样的分辨率烧钱。据报道 Adobe Firefly、Figma Weave、Runway、GMI Cloud 等都已接入该模型,说明这类"可控视频"能力正在快速成为创作工具的标配。

没变的是生成式模型的老毛病:长镜头下角色一致性、物理细节仍然要靠人工挑素材兜底;40 秒是累计上限而非单次上限,叙事稍长就得分段生成再拼接;所谓的控制是"概率上的控制",不是关键帧动画那种确定性控制。指望它一次出片,目前还不现实。

对普通开发者意味着什么

如果你在折腾视频生成、短视频工具、营销物料自动化,这个模型值得直接上手。官方博客给了场景扩展的 Python 示例,我抄过来做示范(代码来自 Google 官方文档):

python 复制代码
from google import genai

client = genai.Client()
interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
        previous_interaction_id=previous_video_interaction.id,
            input=[{"type": "text", "text": "Continue the scene."}],
                response_format={"resolution": "360p"},
                )
                ```
几个实际建议:

- **草稿和成片分开跑**:先用 360p 确认叙事和镜头,定了再出 4K。官方口径是成本差三倍,量大的项目这不是小钱。
- - **长视频用步进式扩展**:10 秒一步往外扩,比一次生成更容易控制情节走向,也方便中途修正。
- - **有运镜需求的优先用首尾帧**:指定起止帧让模型补中间,比在 prompt 里描述"镜头缓缓推进"稳定得多。
- - **别省掉素材检查**:多模态参考只有 3 秒,复杂场景的角色一致性依然要自己做参考图/参考视频的管理,指望一条 prompt 全搞定不现实。
坑也明摆着:一是计费按分辨率、时长走,官方给的"三分之一成本"是相对 720p 的口径,做预算前先跑小样实测;二是 API 形态还在快速迭代,接的时候尽量把模型调用层封装好,别把版本号写死在业务代码里。

## 结尾

视频生成打到了第二阶段:不是"能不能生成",而是"能不能按我的意思生成"。控制手段越多,离落地就越近,至于成本算不算得过来,得等真跑完一轮才知道。你怎么看,评论区聊聊。
相关推荐
智慧物业老杨3 小时前
物业数字化落地思考:真正的转型,是底层数据秩序的重构
java·大数据·人工智能·微服务·系统架构
m0_614523556 小时前
音频排障|多段视频音量忽大忽小,怎么统一响度:先分类再校准
音视频·视频编辑
7177776 小时前
中小团队 DevOps 平台选哪家:2026 年主流平台对比与 Gitee 本土化方案解析
人工智能·gitee
武子康6 小时前
小智断网后还能做什么?沿一次唤醒看清设备与服务端的分工
人工智能·llm·agent
梦帮科技7 小时前
AI 音乐产品的发布工程:验证门、数据发布、回滚与生产运维纪律
数据结构·数据库·架构·node.js·音视频·动态规划·推荐算法
西安栈上月明软件科技7 小时前
从 Linux 0.01 到 AI 开源:星图邻的开源实践
人工智能·自然语言处理·架构·开源·fastapi
麻雀飞吧7 小时前
先判断工具用来学习、开发还是执行
人工智能·python
甲维斯7 小时前
ZCode:快来领“免费”3亿tokens和“Git打包服务”
人工智能
揽秀亭长7 小时前
视频转文字有哪些方法?在线AI、剪辑软件、本地对比
人工智能·音视频
RoboWizard8 小时前
三星和金士顿内存条哪个更适合游戏超频
大数据·人工智能