标签:
#具身智能#世界模型#人形机器人#Sora#AI视频生成
前言
近期OpenAI全面关停Sora对外视频业务线,在行业内引发广泛讨论。很多人误以为Sora只是退出中国市场,而这件事背后释放了一条非常关键的产业信号:Sora作为长时序视频生成模型,它最大的长期价值或许并不是产出短视频、影视素材,而是充当一座"物理模拟器",用来训练世界模型,最终赋能具身人形机器人,让AI理解真实世界运行的物理规律。
以此拐点为切入点,国内各家企业走出了多条截然不同的技术演进路线。本文梳理Sora关停事件的本质、国内AI视频生成厂商商业化现状,并对比「内容视频工具」「视频‑世界模型‑具身双线布局」「纯具身原生大脑」三类玩家的发展路径与优劣势。
一、Sora"退场"真相:全球视频产品线关停,底层技术转向物理世界模型
首先厘清一个关键事实:Sora退场属于全球范围整个对外视频产品线终止,并不是仅退出中国市场。
- 关停范围:Sora独立App、网页版、对外开发者API、ChatGPT内置视频生成功能全部下线;迪士尼等影视合作项目取消。
- Sora从未正式进入中国大陆,国内用户原本就无法合规使用。
- 底层视频仿真技术并未销毁:Sora长时序物理推演、视频仿真能力予以保留,原Sora研发团队并入OpenAI世界模型项目组,资源转向人形机器人、物理仿真方向。
OpenAI做出了战略取舍:砍掉面向C端、B端的视频生成产品,将视频模型降格为内部科研工具,不再作为商业化产品对外售卖。
两条技术范式对比:VLA VS 视频式世界模型
| 方案 | 核心逻辑 | 优缺点 | 落地节奏 |
|---|---|---|---|
| VLA(视觉‑语言‑动作) | 读取当前画面,直接输出机器人动作 | 落地快、算力成本适中;缺少对未来环境预判能力 | 短期工业项目首选方案 |
| 视频式世界模型 | 借助视频先预判未来一段时间环境演化,再规划动作 | 自带物理常识,可降低真机采集数据量;算力开销大、延迟高 | 中长期复杂非结构化场景路线 |
OpenAI放弃Sora对外视频业务,本质上也是押注:AI竞争主战场已经从生成虚拟视频,转向操控真实的物理世界。
二、国内一众AI视频生成厂商为何能够顺利商业化?
快手可灵、字节即梦/Seedance、智谱清影、MiniMax海螺、阶跃星辰、昆仑万维SkyReels、阿里通义万相、腾讯混元,这批国内视频生成模型产品均顺利上线并持续迭代。
其和Sora路线最核心的差异可以总结为五点:
- 自带现成变现生态
国内拥有全球规模最大的短视频、短剧、电商广告产业,AI视频生成上线即可用来批量产出种草视频、短剧素材、商家宣传物料,能够快速形成现金流。 - 产品定位为可控内容生产工具,而非物理模拟器
国产视频模型优先保证人物一致性、镜头可控、局部编辑、适配后期剪辑流水线;物理仿真精度够用即可,并非最高优先级目标。 - 工程降本,推理成本可控
通过DiT架构、模型蒸馏、算力优化等方式压低单条视频生成成本,走普惠商用路线,逐步靠近盈亏平衡。 - 视频基座是多模态能力的必争之地
视频训练能够补齐大模型时序视觉认知短板,反向赋能集团内数字人、虚拟直播等多条业务。 - 赛道已经出现明显分化,两条路线目标终点并不一样
- 路线A:纯内容视频赛道:快手、字节、腾讯、阿里等大厂为主,终点为短剧、广告等内容生产力工具;视频生成业务独立运营,没有强制走向人形机器人。
- 路线B:视频‑世界模型‑具身赛道:以OpenAI Sora、极佳视界YiSu为代表,视频生成只是训练物理认知的载体,最终目标落地物理机器人。
三、国内世界模型与具身赛道玩家全景盘点
除去上面大厂内容视频产品线之外,国内还有两类和世界模型、具身智能强相关的玩家。
1、长视频生成创业梯队(具备对标Sora长时序视频能力)
- 生数科技 Vidu:清华朱军团队;长视频商用产品+世界模型双线布局。视频业务商业化,技术能力向具身大脑迁移;暂不研发人形硬件本体。
- 爱诗科技 PixVerse:海外起步,C端用户体量庞大;布局实时交互式世界模型,落点偏向虚拟游戏、互动数字空间,暂未向物理机器人延伸。
2、无对外商用视频产品,视频仅作为机器人内部训练底座
这类公司不卖文生视频API,视频预测架构纯粹用来训练机器人大脑:
- 阿里达摩院 Qwen‑RobotWorld:机器人专属视频世界模型,生成仿真训练数据赋能机械臂规划,与通义万相视频产品线相互独立。
- 蚂蚁灵波 LingBot‑VA:从零研发视频‑动作联合预测模型,人类视频预训练之后迁移真机;定位机器人大脑方案供应商,不做硬件本体。
- 智在无界、大晓机器人、妙动科技:以人类第一视角视频扩充机器人训练数据集,蒸馏物理常识,降低真机数据采集成本。
3、视频商业化+具身本体双线闭环路线代表:极佳视界
极佳视界走出了一条和OpenAI完全不同的差异化道路:没有关停对标Sora的YiSu(视界一粟)视频业务。
技术链路:YiSu长视频生成(商用变现) → GigaWorld通用世界模型 → GigaBrain具身大脑 → Maker H1人形机器人本体
一边依靠视频业务带来现金流反哺世界模型长期研发;另一边世界模型沉淀出来的物理时序能力向下赋能人形、轮臂机器人工业项目落地,实现短期交付营收和长期技术预研双线并行。
四、四家典型企业路线对标:极佳视界 / 生数科技 / 爱诗科技 / 蚂蚁灵波
| 对标维度 | 极佳视界 | 生数科技 | 爱诗科技 PixVerse | 蚂蚁灵波 |
|---|---|---|---|---|
| 产品线 | YiSu商用长视频 + GigaWorld具身世界模型 | Vidu商用长视频 + Motus具身世界模型 | PixVerse视频生成+实时交互虚拟世界模型 | 无对外商用视频产品线 |
| 演进路径 | 商用视频萃取物理能力→世界模型→自有具身本体完整闭环 | 视频基座赋能具身,数字‑物理双线,无硬件自研计划 | 主攻数字虚拟交互赛道,暂未布局物理机器人 | 具身原生路线,视频预测仅作为机器人内部训练工具 |
| 硬件策略 | 自研Maker‑H1人形、轮臂本体 | 不做自有机器人本体,输出大脑方案 | 无机器人硬件规划 | 大脑方案供应商,适配第三方硬件 |
| 商业化收入 | YiSu视频现金流 + 工业具身项目落地营收 | 视频SaaS/API;具身大脑处于验证阶段 | 海外订阅、视频API、互动引擎授权 | 具身大脑项目合作收入,无视频业务营收 |
| 路线定位 | 双线闭环路线,内容商业化反哺物理机器人落地 | 数字‑物理双轨世界模型底座厂商 | 虚拟世界路线,聚焦数字交互娱乐场景 | 纯具身原生大脑路线 |
五、赛道总结与行业启示
当前国内世界模型赛道分化为四条清晰路线:
- 大厂内容视频路线:视频生成作为独立生产力工具,优先商业化变现;
- 生数科技代表的「商用视频+具身大脑」双线底座路线,不涉足机器人硬件;
- 爱诗科技代表的虚拟世界路线,世界模型落地游戏、互动影视等数字场景;
- 蚂蚁灵波代表的纯科研路线:不从通用视频模型迁移,原生面向机器人研发视频‑动作世界模型;
- 极佳视界差异化闭环路线:商用视频业务沉淀长时序物理推演能力,赋能自研人形本体,完成世界模型从研发到工业真机落地的全链路闭环。
OpenAI关停Sora已经证明一条行业结论:单纯烧钱做面向C端的长视频生成,很难跑出健康商业闭环。未来一段时间内,VLA方案依旧是工业具身项目落地的主流选择;世界模型更多属于中长期技术储备,3‑5年后才有望迎来大规模拐点。
本文仅代表技术路线分析,不构成任何企业投资建议。