写在前面
【从零走向AGI 】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址 🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
AIGC算法岗/开发岗面试面经交流社群 (涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
导读
很多"世界模型"最终输出的是一段视频:镜头可以运动,画面可以变化,但对象一旦换视角就可能闪烁、几何无法复用,视频结束后也没有可继续编辑或导入引擎的世界。HY-World 2.0 选择另一种目标:将文本、单张图像、多视图图像或视频,变成可渲染、可探索、可导入引擎的 3D Gaussian Splatting(3DGS)、点云和网格资产。
对文本或单图输入,它先生成 360° 全景,再规划观察路径、生成一致的关键帧、重建并优化为 3DGS;对多视图或视频输入,WorldMirror 2.0 可直接一次前馈预测深度、法线、相机、点云和 3DGS 属性。WorldLens 则将得到的世界接到实时渲染、碰撞和角色探索。论文的重点因此不只是某一个生成模型,而是一条将"世界想象"落到持久 3D 表示的系统链路。
原文从应用愿景和四阶段总览开始,依次展开全景生成、轨迹规划、世界扩展、WorldMirror 2.0 重建与世界合成;实验随后分别评估全景质量、镜头控制、3D 重建、3DGS 优化和可交互结果。

图 1:HY-World 2.0 将文本/单图的世界生成与多视图输入的世界重建汇合为可探索的 3D 表示。来源:论文 Figure 1。
猫先生认为,HY-World 2.0 的关键转向是把"能生成一段连贯视角变化"改成"能产出一个可继续计算的空间对象"。这会把难题从视频观感转到几何一致性、镜头可控性、资产轻量化与引擎交互,但也让结果能真正进入下游工作流。
- 论文标题:HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
- 论文地址:https://arxiv.org/abs/2604.14268
- 项目主页:https://3d-models.hunyuan.tencent.com/world/
- GitHub:https://github.com/Tencent-Hunyuan/HY-World-2.0
- 论文 PDF:https://arxiv.org/pdf/2604.14268
- 论文源码:https://arxiv.org/e-print/2604.14268
原文脉络
Figure 1 先说明生成和重建的两类入口,Figure 2 给出四阶段管线。Section 3 处理世界的 360° 初始化,Section 4 将全景解析为无碰撞且信息密集的相机轨迹,Section 5 生成跨轨迹一致的新视角,Section 6 以 WorldMirror 2.0 重建几何,随后 Section 7 完成深度对齐和 3DGS 合成。Section 8 用生成、重建和运行时实验验证这套系统。
1. Introduction:从"可观看视频"转向"可复用 3D 资产"
视频世界模型擅长逐帧合成,但输出通常没有持久的三维结构:换到未出现的视角可能破坏一致性,角色碰撞、光照、物体编辑和长期探索也难以直接成立。HY-World 2.0 的输出选择 3DGS、点云和网格,意图把一次生成的结果保存为可在 Blender、Unity、Unreal、Isaac Sim 等环境继续使用的资产。
这一定义带来两种不同任务。世界生成 从文本或单一透视图补全一个未知 3D 环境,主要风险是补全内容与全局几何不一致;世界重建从多视图或视频恢复已观察到的世界,主要风险是相机、深度、法线和点云之间互相矛盾。HY-World 2.0 没有强行让一条网络包办所有环节,而是用生成链路解决前者,用统一前馈重建模型解决后者,再在最终资产层汇合。
2. Overview:四阶段将多模态条件变成可探索世界
文本或单图走四个阶段:HY-Pano 2.0 生成高保真全景;WorldNav 从全景推导可探索的相机轨迹;WorldStereo 2.0 沿轨迹扩展出多视角关键帧;WorldMirror 2.0 与 3DGS 优化把这些帧组成最终世界。多视图图片或视频则可以直接进入 WorldMirror 2.0,跳过"从一个条件生成未知视角"的前半段。

图 2:文本或单图通过四阶段生成世界;多视图/视频重建则可直接使用 WorldMirror 2.0 的 3D 预测能力。来源:论文 Figure 2。
四阶段的价值在于分离不确定性。第一阶段负责给出一个整体世界假设;第二阶段决定应该观察哪里;第三阶段在受控镜头下补足视角;第四阶段才把图像序列固化为空间资产。代价是端到端链路很长,任一步的几何偏差都会传给后续模块,因此论文专门使用点云、相机轨迹和记忆作为中间约束。
3. World Generation Stage I:HY-Pano 2.0 先建立 360° 空间上下文
全景比普通透视图多出完整的环绕上下文,是后续规划的世界起点。HY-Pano 2.0 训练数据混合高分辨率真实全景与 Unreal Engine 等引擎渲染的合成环境;前者提供真实光照、纹理和结构先验,后者提供难以从真实采集获得的多样场景和精确几何标注。作者还过滤拼接缝、低质量样本和暴露的全景相机。
在模型侧,它不再依赖精确焦距或 FoV 将透视图几何投影到 equirectangular panorama(ERP)。条件图 latent 与全景噪声 latent 被拼成统一 token 序列,由 Multi-Modal Diffusion Transformer 在特征空间学习透视到 ERP 的映射;这让输入相机信息缺失或不准时仍能工作,但也意味着遮挡区域的几何本质上仍是生成假设。

图 3:全景左右边界在 latent 空间采用环形 padding、像素空间再做 blending,以保证 360° 环绕的连续性。来源:论文 Figure 3。
4. World Generation Stage II:WorldNav 用几何与语义决定"往哪里看"
一张全景不足以给出所有遮挡面的细节,因此系统需要主动选择相机路径。WorldNav 先将 ERP 切成透视视图,用 MoGe2 构造全景点云,再配合低分辨率网格、SAM3 语义掩码、Qwen3-VL 地标识别和 Recast NavMesh。点云服务于几何理解与后续生成控制,网格和 NavMesh 则用于碰撞检测与可通行区域约束。
其路径不是单一的"向前走":规则轨迹扩展整体视角,环绕轨迹围绕显著物体,重建感知轨迹处理物体遮挡面,wander 与 aerial 轨迹补足区域和鸟瞰覆盖。最多可规划 35 条路线。这个设计把世界扩展从无约束的视频续写,改成带空间覆盖目标和无碰撞条件的观察计划。
5. World Generation Stage III:WorldStereo 2.0 生成一致的关键帧,而非一条越来越长的视频
5.1 Keyframe latent 与镜头控制
标准 Video-VAE 会在时间维度压缩连续帧,慢镜头运动容易产生冗余,快速视角变化又可能模糊纹理和几何。WorldStereo 2.0 改用 Keyframe-VAE:对稀疏关键帧逐帧进行空间压缩,在跨度相同但帧数更少的 latent 中保留高频细节。其 Video Diffusion Transformer 不必一次生成一条很长的轨迹,而是生成多段中等长度、互补视角的关键帧序列。
全景点云、轨迹与相机射线作为 Global-Geometric Memory(GGM)进入相机控制分支,使生成帧遵循指定轨迹;这比只用文本或相对运动条件更接近可用于 3D 重建的观测序列。
5.2 两种记忆与三阶段训练
除了全局几何,模型还需跨路线保持局部纹理和物体对应。Spatial-Stereo Memory(SSM++)从 memory bank 检索参考视图,并将其与目标帧在空间维度拼接;参考视图继承相应目标帧的时间索引,帮助 DiT 在不同轨迹间建立局部 stereo 对应。训练依次进行镜头控制 domain adaptation、带 GGM/SSM++ 的 memory middle-training、以及 DMD 后蒸馏以加速推理。

图 4:WorldStereo 2.0 将全局几何记忆与局部空间立体记忆分工,用于连续、多轨迹的关键帧生成。来源:论文 Figure 7。
猫先生认为 ,WorldStereo 2.0 最重要的取舍是放弃"单段超长视频"的表面完整性,转而追求多次生成之间可重建的对应关系。对 3D 资产而言,补全更多视角不够,这些视角必须指向同一个空间。
6--7. WorldMirror 2.0 与 World Composition:把图像序列固化为几何、3DGS 与可交互场景
WorldMirror 2.0 是多视图/视频重建入口,也是生成链路的合成骨干。它以共享 Transformer 编码多视图图像和可选几何先验(相机位姿、内参、深度),再用任务专属 DPT decoder 同时输出稠密点云、深度、法线、相机和 3DGS 属性。多任务共用骨干的目的,是让相机和表面几何在同一表示中协同,而不是让深度、姿态、法线互相独立估计。

图 5:WorldMirror 2.0 用共享特征与多头解码统一处理多视图几何预测,支持多模态先验注入。来源:论文 Figure 12。
相对 WorldMirror 1.0,2.0 的关键更新包括支持灵活分辨率的 normalized position encoding、深度---法线耦合监督、无效像素掩码、数据和训练策略升级。生成世界中,WorldMirror 深度还需与初始全景点云进行线性对齐;作者使用可靠区域估计对齐系数并剔除离群值,再将扩展点云用于 3DGS 优化。MaskGaussian 与自适应 densification 用来避免用均匀降采样粗暴牺牲细节。
WorldLens 位于资产落地一侧:采用与引擎无关的渲染架构,支持自动 IBL 光照、碰撞检测和角色模式。3DGS 提供外观,提取并轻量化后的网格承担物理碰撞代理;二者分工使实时探索不必每帧重新运行生成模型。
8. Experiments:质量、几何、效率与可交互性是否同时成立?
8.1 文本/单图世界生成
全景实验覆盖 text-to-panorama 与 image-to-panorama,论文报告 HY-Pano 2.0 在开源方法中取得领先质量,并给出与闭源 Marble 的条件一致性对比。更关键的不是单张全景好看,而是扩展后点云和 3DGS 能否稳定:在单图生成的 3D 重建评测中,WorldStereo 2.0 在 Tanks-and-Temples 的 F1/AUC 为 41.43/58.19,在 MipNeRF360 为 51.27/65.79,优于表中比较的 SEVA、Gen3C、Lyra 和 FlashWorld。
镜头控制实验也显示其设计针对的是重建而非纯视频指标。WorldStereo 2.0 的相机旋转误差、平移误差和 ATE 低于视频生成基线;消融中,全量训练 Keyframe-VAE 虽可提高若干视觉指标,却会造成风格漂移,作者选择冻结 Cross-Attention 与 FFN 以取得镜头精度和用户偏好之间的平衡。
端到端一座世界在 H20 GPU 上的时间为 712 秒:全景 15 秒、轨迹 182 秒、世界扩展 286 秒、重建/对齐 102 秒、3DGS 127 秒。它不是即时生成,但与视频模型每次交互都要再次推理不同,完成后资产可被反复渲染。3DGS 消融还显示,MaskGaussian 将 Gaussian 数量从 5.254M 降至约 1.383M,减少 73.7%,PSNR 只从 25.158 降至 25.017。
8.2 多视图/视频重建
WorldMirror 2.0 在 7-Scenes、NRGBD、DTU 的点图重建,以及相机位姿、深度、novel-view synthesis 和表面法线任务上进行评估。高分辨率并注入全部先验时,7-Scenes 的平均 Accuracy/Completeness 为 0.012/0.016;论文显示它在高分辨率和稀疏/稠密输入下比 1.0 更稳定。对 128 个输入视图,BF16、Sequence Parallelism 与 FSDP 可将每 GPU 运行时间降至 5.60 秒;256 视图也能运行,而单 GPU FP32 基线会 OOM。
这些结果支持 WorldMirror 2.0 是一套可用的通用重建部件,但也要注意:世界生成的几何质量仍受第一张全景和扩展视角的生成正确性限制;与 Marble 的比较主要是定性且针对 Marble 1.0,不能据此概括所有闭源世界模型。碰撞网格来自生成资产的近似几何,所谓"物理可交互"更接近可用的导航和碰撞反馈,而非经过严格物理仿真的真实动力学。
总结:世界模型的输出开始从画面走向空间资产
HY-World 2.0 将多模态条件、主动观察、带记忆的新视角生成、统一前馈重建和 3DGS 合成串成一条长链。它最鲜明的技术判断是:一个可用世界不应只在原始镜头里连贯,还应在新的视角、网格碰撞、渲染引擎和下游仿真中保持可用。
猫先生认为,HY-World 2.0 的下一步挑战不是继续堆叠生成质量,而是验证这种资产在更长交互、动态物体、真实机器人感知和可量化物理任务中是否仍然可信。若几何可用性能够从静态 benchmark 延伸到闭环行动,它才更接近世界模型而不只是"3D 内容生产线"。
参考资料
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列