Gemini Omni 1.1 Flash 发布:场景扩展上限 40 秒,AI 视频生成转向可控

8 月 27 日,谷歌在 Google AI Studio 和 Gemini API 上正式推出 Gemini Omni 1.1 Flash,一个面向开发者的视频生成模型更新。这次的重点不是参数或画质口号,而是把"生成视频"往"导演视频"的方向推:场景扩展、首尾帧指定、4K 输出,外加更便宜的 360p 预览。对做视频工具、内容生产的人来说,这是一次工作方式的改变,不是版本号 +0.1 那么简单。

这个热点的技术本质是什么

先看几个关键变化,都来自 Google 官方博客的说明:

  • 场景扩展 :模型现在可以分析最多 10 秒的先前视频上下文,而之前只参考最后一秒。按 10 秒步长逐段延长,单条视频累计最长 40 秒。
    • 首尾帧生成:指定第一帧和最后一帧,模型生成中间的连续画面,适合运镜、转场、无缝循环这类需求。
    • 4K/1080p 输出:可以直接出高清成片,省掉"生成完再超分"这一步。
    • 360p 预览:据报道(据 Google 官方博客),360p 草稿比 720p 生成快最多 60%,成本约是 720p 的三分之一。
    • 视频参考 :多模态输入里可以引用最多 3 秒的视频,保持角色和画面一致性。
      技术上这不是新架构,Gemini Omni 系列的底子没变,变的是一整套"控制手段"。以前生成视频基本是抽卡:写个 prompt,出一段,不满意就重抽,最多改改文字。现在模型能"理解"已有视频的内容再继续往下接,能按关键帧约束镜头运动,等于把剪辑师的工作流拆成了模型可以执行的动作。

变了什么,没变什么

变了的是成本结构和工作流:草稿阶段用 360p 快速迭代、定稿阶段出 4K,这在以前是做不到的------之前不管成不成型,都按同样的分辨率烧钱。据报道 Adobe Firefly、Figma Weave、Runway、GMI Cloud 等都已接入该模型,说明这类"可控视频"能力正在快速成为创作工具的标配。

没变的是生成式模型的老毛病:长镜头下角色一致性、物理细节仍然要靠人工挑素材兜底;40 秒是累计上限而非单次上限,叙事稍长就得分段生成再拼接;所谓的控制是"概率上的控制",不是关键帧动画那种确定性控制。指望它一次出片,目前还不现实。

对普通开发者意味着什么

如果你在折腾视频生成、短视频工具、营销物料自动化,这个模型值得直接上手。官方博客给了场景扩展的 Python 示例,我抄过来做示范(代码来自 Google 官方文档):

python 复制代码
from google import genai

client = genai.Client()
interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
        previous_interaction_id=previous_video_interaction.id,
            input=[{"type": "text", "text": "Continue the scene."}],
                response_format={"resolution": "360p"},
                )
                ```
几个实际建议:

- **草稿和成片分开跑**:先用 360p 确认叙事和镜头,定了再出 4K。官方口径是成本差三倍,量大的项目这不是小钱。
- - **长视频用步进式扩展**:10 秒一步往外扩,比一次生成更容易控制情节走向,也方便中途修正。
- - **有运镜需求的优先用首尾帧**:指定起止帧让模型补中间,比在 prompt 里描述"镜头缓缓推进"稳定得多。
- - **别省掉素材检查**:多模态参考只有 3 秒,复杂场景的角色一致性依然要自己做参考图/参考视频的管理,指望一条 prompt 全搞定不现实。
坑也明摆着:一是计费按分辨率、时长走,官方给的"三分之一成本"是相对 720p 的口径,做预算前先跑小样实测;二是 API 形态还在快速迭代,接的时候尽量把模型调用层封装好,别把版本号写死在业务代码里。

## 结尾

视频生成打到了第二阶段:不是"能不能生成",而是"能不能按我的意思生成"。控制手段越多,离落地就越近,至于成本算不算得过来,得等真跑完一轮才知道。你怎么看,评论区聊聊。
相关推荐
光锥智能14 分钟前
安全筑基,WPS 365政务AI全产品体系首次亮相数博会
人工智能·安全·wps
音视频牛哥14 分钟前
世界人形机器人运动会9项新赛技术解读:全自主、灵巧手与机器人实时音视频系统演进
音视频·世界人形机器人运动会·世界人形机器人运动会9项新赛·人形机器人技术发展·机器人实时音视频·机器人低延迟视频·机器人远程接管
chunmiao303216 分钟前
阿里全新Qoder上线:自然语言驱动开发,编程门槛再降一级
人工智能
天远数科17 分钟前
零信任架构实战:基于天远风控经营异常预警构建自动化企业准入网关
运维·人工智能·架构·自动化
Rocktech_ruixun17 分钟前
破人类记录!机器人如何跑得更快更稳?瑞迅科技RK3588机器人主板三大核心技术解析
人工智能·嵌入式硬件·机器人
chunmiao303219 分钟前
英伟达129亿美元收购Hugging Face,开源AI枢纽易主
人工智能·开源
zhonyu鱼21 分钟前
Shotcut:免费开源的专业级视频剪辑软件
音视频·开源软件