谷歌 Gemini Omni 1.1 Flash 正式发布:4K 视频、40 秒场景延伸,视频生成进入按 token 计费时代

谷歌 Gemini Omni 1.1 Flash 正式发布:4K 视频、40 秒场景延伸,视频生成进入按 token 计费时代

谷歌把视频生成模型 Gemini Omni 1.1 Flash 转正了:最高输出 4K 分辨率,支持把一段 10 秒视频延伸成累计 40 秒,还能控制首尾帧,价格按视频 token 计算。8 月 27 日,这枚从预览版毕业的模型正式向开发者开放,距离上一代 Gemini Omni Flash 发布只有不到两个月。视频生成的能力竞争,正在从「能不能生成」转向「能不能精确控制」。

上一代 Gemini Omni Flash 在 6 月 30 日发布,主打低成本、面向开发者的快速生成,当时还只是预览版。不到两个月就迭代到 1.1 并转为正式版,节奏之快说明谷歌在视频生成上的投入正在提速,也说明开发者市场对这类产品的需求比预期更旺盛。

一、这次更新带来了什么:四个能力逐个拆

Gemini Omni 1.1 Flash 相比上一代,最大的变化是四个新能力。

第一个是 4K 输出。上一代产品以 720p、1080p 为主,这次把分辨率上限抬到 4K,画面细节从广告级的够用提升到接近影视级。对需要大屏展示、品牌投放这类场景,分辨率意味着能不能进入正式的商业流程。

第二个是场景延伸。这是这次更新里最有想象力的一项:模型不再是每段视频都从零生成,而是可以接着一段已有视频继续往下拍,把 10 秒的片段延伸成累计 40 秒。镜头语言可以连续,人物动作可以衔接,视频不再是一个个孤立的片段,而是一条能被持续写下去的故事线。

第三个是首尾帧控制。给定第一帧和最后一帧,模型能在这两个画面之间补出连续的视频,相当于给导演一个「按起止点反推过程」的工具。这在分镜设计和动态故事版阶段非常实用,创作者可以先定下关键画面,再让模型填充中间的运动。

第四个是 360p 快速草稿。先用低分辨率快速出一版看看节奏和构图,确认方向后再渲染高清成片。这一步把「试错成本」降到了极低,以往生成一次高清视频的成本和等待,现在可以先用草稿模式试探。

除了这四项,模型还支持短视频参考,开发者可以上传一小段真实素材作为风格和运动的参考,让生成结果更贴合品牌或产品的既有视觉基调。整体来看,这代更新不是简单堆参数,而是把创作者在真实工作流里遇到的具体痛点逐个解决。

二、按 token 计费到底怎么算

视频生成按 token 计费,是这代产品最值得科技从业者关注的定价逻辑。谷歌给出的口径是:视频输出每百万 token 收费 17.5 美元,按每秒约 5792 个 token 折算,720p 视频大约每秒钟 0.1 美元。换句话说,生成一分钟 720p 视频,输出成本大约 6 美元。输入侧的价格是每百万 token 1.5 美元,文本、图片、视频、音频统一计价。

这个定价逻辑把视频生成拉进了和大模型文本生成同一个度量体系里。过去的视频生成工具往往按「生成秒数」打包卖,价格结构复杂、难比价;现在按 token 算,开发者可以把视频生成的成本塞进既有的 token 预算模型里,统一规划。

换算成更直观的成本:一个 5 分钟的宣传片,720p 输出约 30 美元,4K 由于 token 消耗更高,价格会相应上浮。对专业团队来说,这个价位比请实拍团队便宜几个数量级,但比纯模板化工具贵,恰好卡在「工具化」和「生产化」之间的位置。

再往深看一层,按 token 计费还带来一个隐性的好处:成本透明。不同分辨率、不同时长的视频,成本可以直接用 token 数算出来,开发者做预算、客户做比价都变得清晰。相比之下,按秒计价的方案在不同分辨率下没有统一换算标准,容易产生隐藏成本。

三、从「一次生成」到「编辑工作流」:场景延伸的意义

这代产品真正改变工作方式的,不是分辨率,而是「编辑」的入场。场景延伸和首尾帧控制,本质上是在把视频生成从「抽卡式的一次性生成」改造成「可迭代的编辑工作流」。

过去用 AI 生成视频,最痛的一点是不可控:提示词写对了方向,但镜头一长就歪,最后只能在几十个候选里挑一个勉强能用的。现在有了场景延伸,可以先确定前几秒满意,再逐段往后接,不满意的地方可以只重生成接续段,而不是整段推倒重来。首尾帧控制更进一步,让创作者能锁定关键画面,模型只负责补中间的运动过程。

这套逻辑对内容生产行业的影响是结构性的。广告、短剧、游戏过场、产品演示,这些场景的共性是需要精确的镜头语言,而不是随机的画面。当 AI 视频生成具备了「哪里不对改哪里」的能力,它才真正进入专业生产管线,成为剪辑台旁边的一个可编程搭档,而不是碰运气的玩具。

内容行业的真实反馈也能印证这一点。短剧剧组用场景延伸把分镜拆成一段段可拼接的镜头,广告团队用首尾帧控制先把产品关键画面锁死,再让 AI 补出运镜过程,游戏工作室则用 360p 草稿快速验证过场动画的节奏。这些用法有一个共同点:不再把 AI 当抽卡机,而是把它当剪辑团队里的新成员。

四、对开发者和创作者意味着什么

模型通过 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 开放,开发者可以直接在代码里调用。对订阅用户,Google Flow 里也能用,降低了上手门槛。

对开发者来说,这代模型的 API 设计延续了「便宜草稿、贵价成片」的灵活分层:先用 360p 草稿验证创意,再用 1080p 或 4K 渲染成品,成本结构可以自己权衡。这种按需选择的分层定价,让视频生成第一次可以像调 API 一样精细控制预算。

对创作者来说,判断值不值得接入,可以先算一笔账:如果你的工作流里有「重复生成、大量筛选、手动剪辑」的环节,这代模型能把这些环节压缩掉相当一部分。尤其是短视频平台的高频产出,场景延伸让「一镜到底」的连续叙事成为可能,叙事效率会明显拉开和纯剪辑党的差距。

五、视频生成的下一个战场

Gemini Omni 1.1 Flash 的发布,把视频生成赛道的竞争推到了新阶段。头部厂商已经不再满足于比谁生成得更像,而是开始在「可控性」和「成本结构」上角力:场景延伸解决连续性,首尾帧解决确定性,token 计费解决可预测性。这三件事叠加起来,指向同一个方向:AI 视频正在从实验品变成生产力工具。

回到行业视角,这代产品把视频生成的成本门槛又压下一截。对从业者来说,这意味着两件事:一是低成本的视频产能会继续溢出,纯剪辑、纯搬运类的中间环节会进一步贬值;二是能把控叙事和审美的团队,反而会因为工具变强而放大优势。工具越强,创意和品味的溢价越高。

对科技从业者而言,现在值得做的一件具体的事,是把手里的视频需求按「草稿、成片、连续叙事」拆开,看看哪些环节能交给模型。视频生成的天花板还在不断上移,而这一轮更新已经把入场成本拉到了普通开发者和个人创作者都够得着的位置。

从生成到编辑,从抽卡到可控,从按秒买到按 token 算,视频生成行业正在经历和文本生成当年一模一样的路径。变化已经发生,工具已经就位,剩下的问题只是你什么时候开始用它。

相关推荐
阡之尘埃40 分钟前
Python数据分析案例85——大模型微调全流程(SFT的LoRA微调)
人工智能·python·深度学习·语言模型·llm·微调·千问
海兰1 小时前
【应用】基于 Next.js 16 + Python mplfinance的金融K线图与技术指标可视化平台(三)
javascript·python·金融
cvcode_study1 小时前
Ollama+ComfyUI 多模态
大数据·人工智能·python
众壹新能源科技1 小时前
功率预测误差考核怎么降?从气象源到上报口径的排查清单
运维·人工智能·自动化
星核0penstarry2 小时前
试一试用gr.Workflow把AI多步骤串联变成可视化画布
人工智能·python·ai作画·api·ai编程·工作流·api聚合平台
taller_20003 小时前
【005】PiE 与传统 VBA 的核心区别
python·vba·pie·py
海兰3 小时前
【应用】基于 Next.js 16 + Python mplfinance的金融K线图与技术指标可视化平台(一)
javascript·python·金融
大衛說3 小时前
《Python 从入门到精通》系列总览与学习路线
开发语言·python·学习
小猴子爱上树3 小时前
跨境电商翻译工具推荐:批量图片翻译、视频字幕翻译、智能抠图一站式搞定
人工智能·python·音视频