27届大模型面试准备(四十四):生成式世界模型与视频生成——从 JEPA 到 Sora/GenieA40 讲了多模态大模型怎么把视觉编码器、投影器、图文对齐训在一起;A31 讲了多模态推理与视觉思维链。本篇再往前走一步,进入世界模型(World Model)——不只是"看懂一张图、答好一道题",而是让模型内部建模世界的动态规律:给定当前状态与一个动作/条件,能预测下一刻会发生什么。这是视频生成、具身智能、自动驾驶的共同底层,也是 2024–2026 最热的研究前沿。面试里能把它和"多模态理解"区分开,并讲清 JEPA、Dreamer、Sora、Genie 各自的范式,是拉开差距的关键。