当具身世界模型从「生成逼真视频」迈向「理解动作后果」,强大的算力底座正是这场技术跃迁的隐形引擎
近日,具身世界模型权威评测 WorldArena 更新最新榜单,由莫刻机器人(Muka Robotics)打造的具身世界模型 LJM(Latent Joint-conditional Model),以匿名代号 SisyphusWorld 提交,EWMScore_P分数为73.06 ,位列公开榜单第二,仅次于小米 UNIS(73.64),领先 BWM-Fast、SACWM、DexWorldEngine 等前列模型。
这一成果的背后,阿里云人工智能平台 PAI 提供高性能真武810E 算力与全流程训练支撑,助力莫刻机器人以仅 32 卡规模实现有竞争力的性能,验证了云上高性能算力在世界模型训练场景的工程可靠性。

LJM 登榜:从「会生成视频」到「先理解动作再生成未来」
当前主流动作条件世界模型常通过线性投影、FiLM/AdaLN、cross-attention 等接口,把低维动作直接送入扩散骨干。这些方式可以提高可控性,却仍把动作视为外部数值信号,模型必须独自从视频损失中反推:当前这串数字究竟意味着移动、接触、抓取还是放置。
LJM 的核心突破在于:不把机器人动作只当作一串附加到扩散模型中的低维数值,而是先将语言、视觉历史与未来动作转换为可推理的交互 latent,再用它约束后续视频生成。 具体而言,LJM 将视觉语言模型与视频扩散模型组织为两个协同工作的专家:
-
Latent Reasoning Expert(推理专家):使用 Qwen3-VL-2B 编码语言、历史视觉、当前锚点观察与未来动作,输出一组连续 reasoning tokens。这里的「推理」并非生成自然语言思维链,而是在连续潜空间中预测机器人将到达什么状态、场景会怎样变化、动作会引发怎样的运动。
-
World Modeling Expert(生成专家):使用 Wan2.2-TI2V-5B Diffusion Transformer 作为视频世界模型,在 VAE latent 空间中执行 flow matching,将推理专家给出的交互约束还原为连续未来视频。
两个专家通过 Mixture-of-Transformers(MoT)的 shared attention 逐层交换信息,让「理解动作会造成什么」与「把未来渲染成视频」成为同一个联合建模过程。此外,LJM 还引入 Value-Driven Temporal Conditioning(VTC),在固定预算内主动保留信息密度更高的历史状态,有效解决了长时记忆漂移问题。
WorldArena 公开榜单第二名
截至 2026 年 7 月 16 日,SisyphusWorld(LJM)以 73.06 EWMScore_P 位列第二,仅与第一名 UNIS(Xiaomi-Robotics-U0,73.64)相差0.58 分。分项结果中,LJM 在 3D Accuracy(三维准确性)取得 92.60 的高分,在 Motion Quality(运动质量)取得 89.17,在 Controllability(可控性)取得 85.93,展现出强大的空间认知与动作控制能力。
| WorldArena 维度 | 分数 |
|---|---|
| Visual Quality | 60.18 |
| Motion Quality | 89.17 |
| Content Consistency | 58.11 |
| Physics Adherence | 58.28 |
| 3D Accuracy | 92.60 |
| Controllability | 85.93 |
LIBERO 基准四项指标全部最优
除 WorldArena 外,莫刻机器人进一步基于知名机器人操作基准 LIBERO 评估 LJM 在复杂具身交互场景中的世界建模能力。在 100 个未参与训练的测试 episode 上,LJM 在 PSNR、SSIM、FVD 和 LPIPS 四项指标上均取得最优结果,全面超越 IRASim、Ctrl-World、WoVR 等对比方法。
相较各指标上的最强非 LJM 基线,LJM 将 PSNR 从 27.25 提升至 28.60,SSIM 从 0.8820 提升至 0.9238;同时将 FVD 从 77.09 降至 46.49(下降约 39.7%),LPIPS 从 0.0639 降至 0.0247(下降约 61.3%)。这表明 LJM 的收益不仅体现在逐帧重建质量,也体现在长时视频的感知与时序一致性。
阿里云人工智能平台 PAI:32 张真武810E背后的算力底座
具身世界模型的训练复杂度远超传统视频生成任务。LJM 需要同时处理语言、视觉、动作三模态的联合建模,在 DROID 与 RoboTwin 两个数据集上分阶段训练,每个样本由 8 帧历史上下文、1 帧当前锚点和 56 帧未来共 65 帧组成。这对底层计算平台的算力规模、分布式训练稳定性和多专家联合优化能力都提出了很高要求。
在 LJM 的研发过程中,阿里云人工智能平台 PAI 为莫刻机器人团队提供了全方位的计算服务保障:
真武810E 算力支撑全流程训练。 LJM 的 DROID 预训练与 RoboTwin 继续训练均在 32 张真武810E 上完成,全局批大小为 32,使用 AdamW 优化器、BF16 混合精度与 ZeRO-3 并行策略。以 32 卡规模取得 73.06 EWMScore_P,说明 LJM 并非单纯依赖扩大训练集群换取分数,而是通过 latent joint conditioning 与分阶段训练提高了单位计算预算的有效产出,也验证了真武810E在大规模具身世界模型训练场景中的工程可靠性。
高效的分布式训练与通信优化。 PAI 平台原生支持大规模异构算力集群的高效调度与通信优化,能够在多节点间实现稳定的梯度同步与数据并行。对于 LJM 这类涉及双专家联合建模、MoT shared attention 逐层交互、大规模视频数据吞吐的复杂架构,PAI 提供了坚实的训练底座,显著缩短了从实验构想到结果验证的迭代周期。
灵活的资源弹性与实验管理。 从大规模多模态数据的预处理,到 DROID 与 RoboTwin 两阶段训练的无缝衔接,再到训练过程中的监控与断点恢复,PAI 提供了贯穿模型研发全流程的工具链支持。这让莫刻机器人团队能够将更多精力聚焦于算法创新本身:如何让世界模型在生成未来之前先「理解」动作,而非基础设施的搭建与运维。
面向 Physical AI 场景的深度适配。 阿里云 PAI 与 NVIDIA Physical AI 软件栈全面集成,提供覆盖数据采集、数据预处理、数据扩增/虚拟数据合成、模型训练、模仿学习/强化学习、仿真测试、闭环验证等全链路平台能力。PAI 在异构计算资源管理、大规模数据流水线编排、多任务训练调度等方面的长期积累,为莫刻机器人这类世界模型创新企业提供了有力的工程支撑。 
从实验室到产业:国产世界模型的加速时刻
莫刻机器人(Muka Robotics)致力于打造面向真实物理世界的下一代通用机器人智能体系,以视觉基础泛化模型为核心,推动机器人突破封闭演示场景、走向开放环境,实现真正的具身智能落地。公司由香港科技大学博士池晓威创立。他长期深耕机器人世界模型与多模态生成智能,聚焦真实物理场景下机器人的通用感知、智能决策与自主执行等核心能力,相关成果发表于 CVPR、ICML、ICRA、AAAI 等国际顶级会议。LJM 的登榜,是前沿算法创新与云上高性能平台深度协同的成果。
在 WorldArena 榜单前列,来自中国团队的身影越来越多。这一趋势表明,在全球世界模型竞赛中,中国力量正在核心技术层面加速突破:从感知到认知,不再满足于「看懂画面」,而是追求对物理世界的深度理解;从仿真到落地,切实将模型能力转化为工业制造、仓储物流、智能服务等场景中的实际生产力。
随着 2026 年成为世界模型发展元年,阿里云将持续深化与世界模型创新力量的合作,以 PAI 平台和真武810E算力为核心,为世界模型的技术探索与产业落地提供坚实的算力与工程支撑,共同推动世界模型从实验室走向真实世界------让模型知道:在当前状态下,执行这组动作,会对未来产生什么样的影响。