腾讯混元 2026 年 4 月开源多模态 3D 世界模型 HY-World 2.0------不生成视频,而是直接生成可编辑、可漫游、可导入游戏引擎的 3D 资产(Mesh/3DGS)。本文拆解"视频世界模型 vs 3D 世界模型"的范式差异、四阶段生成流水线与 WorldMirror 2.0 重建技术,并给出本地复现实战(环境搭建 / 重建 / 生成三步走)。
关键词:HY-World 2.0、3D世界模型、腾讯混元、3DGS、世界生成、AIGC、游戏开发、WorldMirror
一、AI 生成内容的下一个战场:从"视频"到"世界"
-
视频世界模型的局限:Genie 3、Cosmos、HY-World 1.5 等生成的是像素视频------"看完即消失",不可编辑、无 3D 一致性、不可交互
-
HY-World 2.0 的解法:直接生成真实 3D 资产(Mesh/3DGS/点云),可导入 Blender/Unity/Unreal/Isaac Sim
-
官方金句:"更像是构建一个可玩的游戏,而非录制一段视频"

二、两种路线:视频世界模型 vs 3D 世界模型
| 维度 | 视频世界模型 | 3D 世界模型(HY-World 2.0) |
|---|---|---|
| 输出 | 像素视频(不可编辑) | 真实 3D 资产(网格/3DGS,完全可编辑) |
| 可交互时长 | 有限(约 1 分钟) | 无限------资产永久保存 |
| 3D 一致性 | 无保证(闪烁/伪影) | 原生一致 |
| 实时渲染 | 逐帧推理,延迟高 | 消费级 GPU 实时渲染 |
| 可控性 | 弱 | 精确------物理碰撞、准确光照 |
| 推理成本 | 随交互累积 | 一次生成,渲染成本≈0 |
| 引擎兼容 | 仅视频文件 | 可直接导入 UE/Unity/Isaac |
"构建世界,永久保留" vs "看完视频,即刻消失"

三、技术拆解:HY-World 2.0 怎么做
3.1 世界生成:四阶段流水线

-
HY-Pano 2.0:文本/图像 → 360° 全景
-
WorldNav:VLM 规划相机轨迹,障碍物感知导航
-
WorldStereo 2.0:沿轨迹生成带记忆一致性的关键帧
-
WorldMirror 2.0 + 3DGS:组合训练出最终 3D 世界
3.2 世界重建:WorldMirror 2.0
统一前馈模型,单次前向传播同时预测:稠密点云 / 深度图 / 表面法线 / 相机参数 / 3DGS 属性。支持 50K--500K 像素,SOTA 精度。
"拍一段视频,即可获得数字孪生"
3.3 技术亮点
-
第一人称导航 + 第三人称角色模式,物理碰撞
-
生成的是"能走进去的空间",不是"好看的图"

四、模型库与开源计划
4.1 模型库
| 模型 | 参数量 | 角色 |
|---|---|---|
| WorldMirror-2 | ~1.2B | 多视图/视频 → 3D 重建 |
| HY-Pano-2 | ~80B | 文本/图像 → 360° 全景 |
| HY-Pano-2-Qwen | ~425M | 轻量版全景生成 |
| WorldStereo-2 | ~17B | 全景 → 3DGS 世界扩展 |
4.2 开源进度(全链路开源)
| 时间 | 开源内容 |
|---|---|
| 2026-04-16 | 技术报告 + 部分代码 + WorldMirror 2.0 权重 |
| 2026-05-11 | HY-Pano 2.0 推理代码与权重 |
| 2026-05-18 | 世界生成推理代码 + WorldStereo 2.0 权重 |
| 2026-07 | HY World 2.1 产品更新 |
五、对游戏开发的价值
-
关卡原型:一句话 → 可导入引擎的 3D 资产
-
场景概念:文本 → 可漫游 3D 概念
-
数字孪生:真实视频 → 3D 重建
-
多风格:写实/卡通/游戏
AI 游戏开发拼图 :AI 角色(8/27 篇)→ AI 工具链(8/31 篇)→ AI 世界(本篇),三者闭环。
六、实战:本地跑通 HY-World 2.0
6.1 环境准备(CUDA 12.8 / Python 3.11+)
git clone https://github.com/Tencent-Hunyuan/HY-World-2.0
cd HY-World-2.0
conda create -n hyworld2 python=3.11.15
conda activate hyworld2
# 基础依赖(此步后可跑世界重建)
pip install -r requirements.txt
cd hyworld2/worldgen/third_party/gsplat_maskgaussian
pip install -e . --no-build-isolation
cd ../../../../
pip install flash-attn --no-build-isolation # FlashAttention-2
# 世界生成额外依赖(如需跑 worldgen)
pip install --no-build-isolation -r requirements_git.txt
git submodule update --init --recursive
cd hyworld2/worldgen/third_party/navmesh
pip install . --no-build-isolation
cd ../../../../
6.2 世界重建实战(WorldMirror 2.0)
from hyworld2.worldrecon.pipeline import WorldMirrorPipeline
pipeline = WorldMirrorPipeline.from_pretrained('tencent/HY-World-2.0')
result = pipeline('path/to/images') # 多视图图像或视频抽帧
命令行(单卡/多卡):
python -m hyworld2.worldrecon.pipeline --input_path path/to/images
torchrun --nproc_per_node=2 -m hyworld2.worldrecon.pipeline \
--input_path path/to/images --use_fsdp --enable_bf16
Gradio 交互版:
python -m hyworld2.worldrecon.gradio_app
6.3 世界生成实战(HY-Pano 2.0 + 五阶段)
from pipeline import HunyuanPanoPipeline
pipeline = HunyuanPanoPipeline.from_pretrained('tencent/HY-World-2.0')
output = pipeline('input.png') # 单图 → 360° 全景
output.save('output_panorama.png')
完整世界生成五阶段脚本:
| 阶段 | 脚本 | 说明 |
|---|---|---|
| 1. 轨迹规划 | traj_generate.py |
VLM 相机轨迹规划,障碍物感知 |
| 2. 轨迹渲染 | traj_render.py |
沿轨迹多卡点云渲染 |
| 3. 世界扩展 | video_gen.py |
WorldStereo-2 记忆一致性关键帧 |
| 4. GS 数据准备 | gen_gs_data.py |
提取图像/深度/法线/相机 |
| 5. 3DGS 训练 | world_gs_trainer.py |
导出最终 GS 世界 |
6.4 实战注意
-
资源有限先跑 WorldMirror 2.0 重建(1.2B)验证链路;HY-Pano-2(80B)/WorldStereo-2(17B)需较强 GPU
-
多卡推理时输入图像数 >= GPU 数
-
本地硬件受限可用官方产品页在线体验
七、生态与展望
三条线交汇:游戏开发(关卡/资产门槛降低)、具身智能(3D 环境即训练场)、数字孪生(视频 → 3D 重建)。
我的观点:
-
世界模型的竞争从"生成好看"转向"生成可用"------可编辑、可交互、可导入引擎才是生产环境需要的
-
这个赛道,开源是竞争力------HY-World 2.0 全链路开源换来社区快速采用,是"以开源换生态"的打法
-
开发者别被 80B 吓到------先用 1.2B 的 WorldMirror 2.0 跑通重建,理解"视频 → 3D",再上生成
世界模型的下一个战场,不是生成更长的视频,而是生成真正能走进、能编辑、能使用的世界。
参考资料
-
HY-World 2.0 官方 GitHub(README_zh)(一级)2026-09-03
-
arXiv 2604.14268 技术报告(一级)2026-04
-
混元3D 官方页面(一级)2026-08-14
-
央广网:一句话造出 3D 世界(二级)2026-04-16
-
ModelScope 模型页(一级)