莫刻机器人LJM登榜WorldArena第二!阿里云PAI提供全流程训练支撑

当具身世界模型从「生成逼真视频」迈向「理解动作后果」,强大的算力底座正是这场技术跃迁的隐形引擎

近日,具身世界模型权威评测 WorldArena 更新最新榜单,由莫刻机器人(Muka Robotics)打造的具身世界模型 LJM(Latent Joint-conditional Model),以匿名代号 SisyphusWorld 提交,EWMScore_P分数为73.06 ,位列公开榜单第二,仅次于小米 UNIS(73.64),领先 BWM-Fast、SACWM、DexWorldEngine 等前列模型。

这一成果的背后,阿里云人工智能平台 PAI 提供高性能真武810E 算力与全流程训练支撑,助力莫刻机器人以仅 32 卡规模实现有竞争力的性能,验证了云上高性能算力在世界模型训练场景的工程可靠性。

榜单地址:huggingface.co/spaces/Worl...

LJM 登榜:从「会生成视频」到「先理解动作再生成未来」

当前主流动作条件世界模型常通过线性投影、FiLM/AdaLN、cross-attention 等接口,把低维动作直接送入扩散骨干。这些方式可以提高可控性,却仍把动作视为外部数值信号,模型必须独自从视频损失中反推:当前这串数字究竟意味着移动、接触、抓取还是放置。

LJM 的核心突破在于:不把机器人动作只当作一串附加到扩散模型中的低维数值,而是先将语言、视觉历史与未来动作转换为可推理的交互 latent,再用它约束后续视频生成。 具体而言,LJM 将视觉语言模型与视频扩散模型组织为两个协同工作的专家:

  • Latent Reasoning Expert(推理专家):使用 Qwen3-VL-2B 编码语言、历史视觉、当前锚点观察与未来动作,输出一组连续 reasoning tokens。这里的「推理」并非生成自然语言思维链,而是在连续潜空间中预测机器人将到达什么状态、场景会怎样变化、动作会引发怎样的运动。

  • World Modeling Expert(生成专家):使用 Wan2.2-TI2V-5B Diffusion Transformer 作为视频世界模型,在 VAE latent 空间中执行 flow matching,将推理专家给出的交互约束还原为连续未来视频。

两个专家通过 Mixture-of-Transformers(MoT)的 shared attention 逐层交换信息,让「理解动作会造成什么」与「把未来渲染成视频」成为同一个联合建模过程。此外,LJM 还引入 Value-Driven Temporal Conditioning(VTC),在固定预算内主动保留信息密度更高的历史状态,有效解决了长时记忆漂移问题。

WorldArena 公开榜单第二名

截至 2026 年 7 月 16 日,SisyphusWorld(LJM)以 73.06 EWMScore_P 位列第二,仅与第一名 UNIS(Xiaomi-Robotics-U0,73.64)相差0.58 分。分项结果中,LJM 在 3D Accuracy(三维准确性)取得 92.60 的高分,在 Motion Quality(运动质量)取得 89.17,在 Controllability(可控性)取得 85.93,展现出强大的空间认知与动作控制能力。

WorldArena 维度 分数
Visual Quality 60.18
Motion Quality 89.17
Content Consistency 58.11
Physics Adherence 58.28
3D Accuracy 92.60
Controllability 85.93

LIBERO 基准四项指标全部最优

除 WorldArena 外,莫刻机器人进一步基于知名机器人操作基准 LIBERO 评估 LJM 在复杂具身交互场景中的世界建模能力。在 100 个未参与训练的测试 episode 上,LJM 在 PSNR、SSIM、FVD 和 LPIPS 四项指标上均取得最优结果,全面超越 IRASim、Ctrl-World、WoVR 等对比方法。

相较各指标上的最强非 LJM 基线,LJM 将 PSNR 从 27.25 提升至 28.60,SSIM 从 0.8820 提升至 0.9238;同时将 FVD 从 77.09 降至 46.49(下降约 39.7%),LPIPS 从 0.0639 降至 0.0247(下降约 61.3%)。这表明 LJM 的收益不仅体现在逐帧重建质量,也体现在长时视频的感知与时序一致性。

阿里云人工智能平台 PAI:32 张真武810E背后的算力底座

具身世界模型的训练复杂度远超传统视频生成任务。LJM 需要同时处理语言、视觉、动作三模态的联合建模,在 DROID 与 RoboTwin 两个数据集上分阶段训练,每个样本由 8 帧历史上下文、1 帧当前锚点和 56 帧未来共 65 帧组成。这对底层计算平台的算力规模、分布式训练稳定性和多专家联合优化能力都提出了很高要求。

在 LJM 的研发过程中,阿里云人工智能平台 PAI 为莫刻机器人团队提供了全方位的计算服务保障:

真武810E 算力支撑全流程训练。 LJM 的 DROID 预训练与 RoboTwin 继续训练均在 32 张真武810E 上完成,全局批大小为 32,使用 AdamW 优化器、BF16 混合精度与 ZeRO-3 并行策略。以 32 卡规模取得 73.06 EWMScore_P,说明 LJM 并非单纯依赖扩大训练集群换取分数,而是通过 latent joint conditioning 与分阶段训练提高了单位计算预算的有效产出,也验证了真武810E在大规模具身世界模型训练场景中的工程可靠性。

高效的分布式训练与通信优化。 PAI 平台原生支持大规模异构算力集群的高效调度与通信优化,能够在多节点间实现稳定的梯度同步与数据并行。对于 LJM 这类涉及双专家联合建模、MoT shared attention 逐层交互、大规模视频数据吞吐的复杂架构,PAI 提供了坚实的训练底座,显著缩短了从实验构想到结果验证的迭代周期。

灵活的资源弹性与实验管理。 从大规模多模态数据的预处理,到 DROID 与 RoboTwin 两阶段训练的无缝衔接,再到训练过程中的监控与断点恢复,PAI 提供了贯穿模型研发全流程的工具链支持。这让莫刻机器人团队能够将更多精力聚焦于算法创新本身:如何让世界模型在生成未来之前先「理解」动作,而非基础设施的搭建与运维。

面向 Physical AI 场景的深度适配。 阿里云 PAI 与 NVIDIA Physical AI 软件栈全面集成,提供覆盖数据采集、数据预处理、数据扩增/虚拟数据合成、模型训练、模仿学习/强化学习、仿真测试、闭环验证等全链路平台能力。PAI 在异构计算资源管理、大规模数据流水线编排、多任务训练调度等方面的长期积累,为莫刻机器人这类世界模型创新企业提供了有力的工程支撑。

从实验室到产业:国产世界模型的加速时刻

莫刻机器人(Muka Robotics)致力于打造面向真实物理世界的下一代通用机器人智能体系,以视觉基础泛化模型为核心,推动机器人突破封闭演示场景、走向开放环境,实现真正的具身智能落地。公司由香港科技大学博士池晓威创立。他长期深耕机器人世界模型与多模态生成智能,聚焦真实物理场景下机器人的通用感知、智能决策与自主执行等核心能力,相关成果发表于 CVPR、ICML、ICRA、AAAI 等国际顶级会议。LJM 的登榜,是前沿算法创新与云上高性能平台深度协同的成果。

在 WorldArena 榜单前列,来自中国团队的身影越来越多。这一趋势表明,在全球世界模型竞赛中,中国力量正在核心技术层面加速突破:从感知到认知,不再满足于「看懂画面」,而是追求对物理世界的深度理解;从仿真到落地,切实将模型能力转化为工业制造、仓储物流、智能服务等场景中的实际生产力。

随着 2026 年成为世界模型发展元年,阿里云将持续深化与世界模型创新力量的合作,以 PAI 平台和真武810E算力为核心,为世界模型的技术探索与产业落地提供坚实的算力与工程支撑,共同推动世界模型从实验室走向真实世界------让模型知道:在当前状态下,执行这组动作,会对未来产生什么样的影响。

相关推荐
栈底拾遗2 小时前
AtomGit:国内唯一开源 + AI 一体化自主基础设施
人工智能·开源
Akir.weiwen2 小时前
AI 总把红色用错地方?你需要一张“颜色使用说明书“
人工智能·设计规范
mykj15512 小时前
AI景区抓拍系统搭建让旅游多一层乐趣
人工智能·旅游·景区ai抓拍系统·ai抓拍小程序
donoot2 小时前
《大话文渊慧典》:外二篇-Tesseract+OpenCV自制OCR,我写了三百个if-else,最后代码成了玄学
人工智能·aigc·文渊慧典·大话系列
延凡科技2 小时前
延凡科技电力数字化平台技术解析:从电力交易到虚拟电厂的全链路架构实践
人工智能·科技·物联网·架构·虚拟电厂·电力平台
Staticy2 小时前
Claude Code 接国产模型不能识图?一个 MCP 让纯文本模型也能看图
人工智能·ai编程·全栈
极梦网络无忧3 小时前
real-ai-editor:一款轻量、智能的纯前端 AI 富文本与 Markdown 编辑器
前端·人工智能·编辑器
phltxy3 小时前
LangChain v1 Agent核心能力详解
大数据·人工智能·langchain
吴佳浩3 小时前
AI 核心技术解析|OPD:大模型开始复制的不再是知识,而是判断力
人工智能·深度学习·llm