2024 年,大语言模型(LLM)让 AI 学会了写作、编程和对话。2026 年,Yann LeCun 离开 Meta,融资 10.3 亿美元创立 AMI Labs,宣称"LLM 将在 3-5 年内过时"。
一、两个世界的分野:LLM 与世界模型
1.1 LLM:精通语言的"文科生"
大语言模型(如 GPT-5、DeepSeek-V4、Claude 4)的核心机制极其简单:预测下一个 token。通过在数万亿文本 token 上训练,模型学会了语言的语法、风格、知识关联和逻辑结构。
LLM 的能力边界:
- ✅ 写作、翻译、代码生成、知识问答
- ✅ 抽象推理、概念组合、数学证明(配合 CoT)
- ❌ 无法理解"杯子掉落会碎"背后的物理因果
- ❌ 无法区分客观现实与主观信念
- ❌ 缺乏对连续时空动态的直观把握
正如李飞飞教授所言:"大语言模型的核心是 'Saying things',而具身世界模型的核心是 'Seeing and doing things'。"
1.2 世界模型:精通物理的"理科生"
世界模型的核心定义来自强化学习之父 Richard Sutton(1990):
"一个黑箱,输入当前状态和即将执行的动作,输出对下一个状态的预测。"
用公式表达:f(观察, 动作) → 下一状态。
世界模型不预测下一个词,而是预测物理世界的下一个状态。它通过观察视频、传感器数据、仿真环境,学习:
- 重力、摩擦、碰撞等物理规律
- 物体的时空连续性和身份保持
- 因果链:"如果我推这个杯子,它会掉下去并碎掉"
关键能力:
- 想象推演(Imagined Rollouts):在内部"做梦"模拟未来,无需真实试错
- 模型预测控制(MPC):在想象中评估不同动作序列的后果,选择最优策略
- 惊喜量化:当预测与现实不符时,识别出分布外(OOD)场景,触发安全机制
二、核心差异:符号 vs 物理
| 维度 | LLM(大语言模型) | 世界模型(World Model) |
|---|---|---|
| 核心问题 | 下一个词是什么? | 下一个状态是什么? |
| 训练数据 | 文本、代码、知识(离散符号) | 视频、传感器、仿真环境(连续信号) |
| 学习对象 | 语言的统计分布和语义关联 | 物理规律、时空动态、因果关系 |
| 世界表征 | 基于人类创造的抽象符号系统 | 基于客观连续的物理现实 |
| 典型输出 | 文字、代码、结构化答案 | 未来状态预测、仿真场景、机器人控制信号 |
| 优势 | 知识面广、交互自然、易于操控 | 物理直觉强、可安全内部模拟、适合实体应用 |
| 核心风险 | 幻觉、事实错误、缺乏物理常识 | 物理不一致、仿真到现实失配、动作失败 |
一个通俗的类比是:LLM 像"文科生",擅长语言、知识、沟通和组织概念;世界模型像"理科生",关心空间、时间、运动、光线、声音、材料和因果变化。
三、关系本质:互补而非替代
3.1 LLM 是世界模型的"语言接口"
世界模型擅长物理模拟,但不擅长与人类沟通。LLM 可以将世界模型的内部状态"翻译"成人类可理解的语言,或将人类的自然语言指令转化为世界模型可执行的动作计划。
在具身智能(Embodied AI)系统中,典型的架构是:
- LLM 负责高层规划:理解人类意图,分解任务步骤
- 世界模型负责底层执行:预测每个动作的后果,选择最优控制信号
3.2 世界模型是 LLM 的"物理底座"
当前 LLM 的一个根本缺陷是缺乏 grounding(接地)。它知道"苹果会掉下来"这句话,但从未"看到"过苹果掉落的物理过程。世界模型可以为 LLM 提供:
- 物理常识基础:重力、惯性、材料属性等
- 因果验证机制:LLM 的推理是否违背物理规律?
- 状态跟踪能力:在多智能体交互中维护客观世界状态
研究表明,LLM 可视为在文本世界中训练出的一个不完整且不精确的世界模型------它捕捉了语言描述中的世界模式,但缺乏对物理现实、感官体验和真实因果的直接建模。
3.3 融合趋势:从 VLA 到 WAM
2026 年,具身智能领域正在经历从 VLA(Vision-Language-Action) 到 WAM(World-Action Model) 的范式转移。
- VLA:看(Vision)→ 理解语言(Language)→ 执行动作(Action),但缺乏对动作后果的预测
- WAM:理解物理因果 → 在内部模拟动作后果 → 选择最优动作,实现了真正的"知行合一"
四、DeepSeek 的启示:当推理模型遇到世界模型的边界
4.1 DeepSeek-R1 的社会推理困境
DeepSeek-R1 在数学和代码推理上表现卓越,但在社会推理任务中暴露出深层局限。浙江大学的研究团队通过分析 R1 的推理轨迹发现:
"LLM 在处理涉及多个参与者和时间线的场景时,频繁遇到推理僵局,倾向于输出'tricky'、'confused'等矛盾术语,导致错误推理或无限循环。核心问题是它们无法区分客观现实与智能体的主观信念。"
这正是 LLM 缺乏世界模型的典型症状:R1 可以完美执行数学证明,但在"小明以为小红知道..."这类需要维护多个心智状态(Theory of Mind)的任务中,因为没有内部的"世界状态跟踪器"而迷失。
4.2 世界模型增强 LLM 的解决方案
同一研究团队提出了自适应世界模型增强推理机制:
- 构建动态文本世界模型,跟踪实体状态和时间序列
- 监控推理轨迹中的困惑指标
- 及时干预,提供清晰的世界状态描述
实验结果显示,该方法在 Hi-ToM 等社会推理基准上准确率提升 10% ,同时 token 消耗降低 33.8%。
这一发现意义重大:即使对于以文本为载体的推理任务,引入显式的世界状态跟踪也能显著提升 LLM 的表现。世界模型不仅是机器人需要的东西,也是 LLM 突破自身瓶颈的钥匙。
这正是世界模型与推理模型融合的想象空间:一个既能进行长链符号推理,又能进行物理直觉验证的混合系统。
五、行业格局:十亿美元赌注与两条路线
5.1 LeCun 的"叛逃":从 LLM 到世界模型
2026 年初,图灵奖得主 Yann LeCun 离开工作 12 年的 Meta,创立 AMI Labs ,融资 10.3 亿美元,估值 35 亿美元,目标只有一个:建造通用世界模型。
LeCun 的核心论点 blunt 而尖锐:
"我们永远不会仅仅通过文本训练达到人类水平的智能。LLM 本质上只是模式匹配系统,没有真正的理解能力。它们可以在 3-5 年内变得过时。"
他的技术路线是 JEPA(Joint Embedding Predictive Architecture) ------不预测像素,而是预测潜在表示空间 latent space 中的变化。V-JEPA 2 在 100 万小时互联网视频上预训练,仅用 62 小时机器人交互数据微调,就在零样本机器人操作任务上达到 ~80% 成功率。
5.2 世界模型的两大阵营
2026 年的世界模型领域分裂为两个哲学阵营:
| 阵营 | 代表 | 核心思想 | 优势场景 |
|---|---|---|---|
| 压缩理解派 | JEPA、Dreamer、V-JEPA 2 | 预测潜在表示,不浪费算力在无关纹理上 | 机器人规划、推理、控制 |
| 渲染预测派 | Genie 2、Sora、Cosmos | 逐帧生成像素级未来场景 | 交互式世界生成、仿真、创意 |
LeCun 属于前者,他的联合创始人 Saining Xie(DiT 架构作者)直言:"目标不是生成漂亮的视频,而是理解世界。"
六、未来展望:从"文科生+理科生"到"工科生"
6.1 三层智能架构
未来的通用人工智能(AGI)很可能不是单一的 LLM 或世界模型,而是一个三层架构:
| 层级 | 角色 | 类比 | 代表技术 |
|---|---|---|---|
| 感知层 | 理解物理世界 | 理科生 | 世界模型(JEPA、Genie) |
| 认知层 | 组织知识、推理规划 | 文科生 | LLM(DeepSeek、GPT) |
| 执行层 | 在真实环境中行动 | 工科生 | 物理 AI / 具身智能 |
正如科学网文章所指出的:"把大语言模型与世界模型结合到机器人、自动驾驶和工业智能体中,则更像'工科生':既能理解人的意图,又能预测物理后果,还能在真实或仿真环境中执行任务。"
6.2 关键挑战
尽管前景光明,世界模型与 LLM 的融合仍面临三大挑战:
- 数据稀缺:高质量物理交互数据(机器人动作、触觉、多视角视频)远比文本数据难获取
- 长时程一致性:短片段中保持物体身份已不容易,多步任务中的因果链更难维持
- 仿真到现实的鸿沟(Sim-to-Real Gap):在虚拟世界中学到的物理规律,能否迁移到真实世界?
七、实践选型指南
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 文本生成、知识问答、代码编写 | 纯 LLM(DeepSeek-V4) | 语言能力强,成本低,生态成熟 |
| 数学/逻辑推理(纯符号) | 推理模型(DeepSeek-R1) | CoT 自我验证,准确率最高 |
| 机器人操作、自动驾驶 | 世界模型 + LLM 混合 | 需要物理预测 + 语言理解 |
| 多智能体社会推理(如博弈、谈判) | LLM + 显式世界状态跟踪 | 维护信念状态,避免推理混乱 |
| 创意内容生成(视频、3D 场景) | 渲染派世界模型(Genie 2) | 生成可交互的虚拟世界 |
| 工业仿真、数字孪生 | 压缩派世界模型(JEPA) | 高效预测,适合控制决策 |
结语:不是取代,而是补全
LLM 与世界模型的关系,不是"谁杀死谁"的零和博弈,而是智能的两个支柱。
- LLM 让 AI 掌握了人类文明的符号遗产------语言、知识、逻辑
- 世界模型让 AI 获得了物理世界的因果直觉------空间、时间、力、运动