摘要
本文解读 arXiv 2026 论文《ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment》。该论文提出 ABot-PhysWorld 物理对齐交互式世界模型 ,通过融合物理感知数据管护 、解耦判别器 Diffusion-DPO 对齐 与零初始化动作注入 ,让 14B Diffusion Transformer 生成物理可信、动作可控的机器人操纵视频,其特别之处在于用"出题人/打分人分离"的清单化偏好优化压制穿透、反重力等物理违规而不损伤画质。实验表明PBench Domain Score 0.9306、EZSbench 平均 0.8030 双 SOTA,在物理合理性与轨迹一致性上同时超越 Veo 3.1 与 Sora v2 Pro,并首次提出训练无关的具身零样本基准 EZSbench,为具身视频生成提供了重要借鉴。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [ABot-PhysWorld 与 Veo 3.1、Sora v2 Pro 相比强在哪里?](#ABot-PhysWorld 与 Veo 3.1、Sora v2 Pro 相比强在哪里?)
- [为什么 Diffusion-DPO 不会把画面质量"训坏"?](#为什么 Diffusion-DPO 不会把画面质量"训坏"?)
- [EZSbench 与 PBench 有什么本质区别?](#EZSbench 与 PBench 有什么本质区别?)
- 动作是怎么"注入"视频生成模型的?
- "解耦判别器"解决了什么问题?
- [这篇工作与 World Action Model(WAM)是什么关系?](#这篇工作与 World Action Model(WAM)是什么关系?)
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment |
| 标题(中文) | ABot-PhysWorld:物理对齐的交互式世界基础模型 |
| 作者 | Yuzhi Chen, Ronghan Chen, Dongjie Huo, Haoyun Liu, Yandan Yang, Dekang Qi, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Zhiheng Ma, Xing Wei, Mu Xu |
| 机构 | AMAP CV Lab · 阿里巴巴(高德) |
| 会议 | arXiv 2026 |
| arXiv | https://arxiv.org/abs/2603.23376 |
| 项目网站 | https://github.com/amap-cvlab/ABot-PhysWorld |
背景与动机
视频生成是具身智能最有想象力的范式之一:它能为 VLA 策略当仿真器、提供可解释的轨迹预览,甚至直接作为 World Action Model(WAM)预测动作条件下的动力学。但视觉逼真不等于物理可信 :Veo 3.1 与 Sora v2 Pro 这类顶尖闭源模型,在生成抓取、放置等操纵序列时频繁出现物体穿透、隔空取物、反重力运动、非自然形变------论文明确指出这不是渲染瑕疵,而是物理推理能力的根本失败。
为什么会这样?论文把根因归结为两条:其一,模型训练于通用视觉数据,缺少摩擦、碰撞响应、质量分布等丰富的具身交互信号 ,难以习得细粒度物理动力学;其二,标准最大似然微调目标把所有预测误差一视同仁,无法区分物理合法与物理非法的转移。同时,主流评测基准(如 PBench)侧重视觉质量与分布内精度,很少考察物理一致性与零样本泛化,导致问题被系统性低估。
ABot-PhysWorld 的应对思路可以概括为三线闭环:数据 上构建 300 万条物理感知标注的真实操纵片段并做层次化平衡;模型 上用"物理清单出题 + 独立裁判打分"的 DPO 偏好对齐压制违规行为;评测上发布首个训练无关的 Embodied Zero-Shot 基准 EZSbench,让物理一致性与动作对齐在分布外被严格度量。

图 1:PAI-Bench 机器人域定性对比------现有视频生成模型的物理伪影问题(物体穿透、几何畸变、目标定位错误)
研究主线:从问题到结论

图 8:ABot-PhysWorld 研究主线------从物理荒谬问题到三件套方法与双基准结论(Mermaid 流程图)
基准/方法设计
ABot-PhysWorld 建立在一条严格的数据管护流水线上,设计目标是让"物理知识"在训练前就进入数据,而不是等模型自己犯错后再修。
数据过滤共四道关卡:视频级质量门控剔除异常分辨率与移动相机,片段限制在 80--500 帧,长视频按任务索引切分;光流运动过滤在 2 FPS 灰度帧上计算 Farnebäck 稠密光流,用极坐标幅值平均得到全局运动学分数,剔除近零运动与不规则振荡;CLIP 时序一致性检查对每片段均匀采样 8 帧、提取 768 维特征,相邻帧余弦相似度过低(黑屏、剪辑、接缝)即丢弃;视觉-动作对齐验证则把标定动作图投影到视频帧上,由 Qwen3-VL 检查动作轨迹与视觉运动是否吻合,过滤标定漂移与同步错误样本。
层次化平衡跨越四个层级:数据集内多样性保留(如 OXE 的小子集整体保留);跨机器人再平衡(欠表征机器人上采样,保留双臂等稀有模式);任务感知配额分配(头部任务封顶 8--15%、主体任务均匀采样 40--50%、长尾任务全保留);宏数据集规模调节(AgiBot/OXE 等大集统一降采样,RoboMind 等微集保底下限),配合三轮补充策略填充剩余配额。
物理感知标注采用两阶段管线:Qwen3-VL-32B 感知模块抽取结构化物理属性(机器人形态、物体属性、空间布局、接触事件),Qwen3-32B-FP8 写作模块生成四阶段叙事(场景搭建、动作细节、状态转移、镜头总结),通过 few-shot 正反例、动态词表与可见事实基线压制空间幻觉,显式标注重力掉落、表面形变、力反馈等物理因果------为世界模型提供"发生了什么 + 为什么发生"的语言监督。
分类全景

图 9:方法定位分类全景------三条技术线及本文与既有工作的差异(Mermaid 流程图)
方法细节
**骨干与两阶段训练。**模型以 Wan2.1-I2V-14B 为骨干全量微调:SFT 阶段学习从观测与指令预测未来帧;随后生成 N 个候选视频,用解耦判别器打分选出胜者/败者三元组,通过 LoRA 注入的 Diffusion-DPO 在潜空间优化。
解耦 VLM 判别器 是物理对齐的关键创新。让同一模型既出题又裁判会产生自我评估幻觉 ,因此论文把角色拆开:Qwen3-VL-32B-Thinking 担任出题人 ,仅观察首帧与文本指令,动态生成任务特定的物理检查清单------Tier 1 覆盖穿透、反重力等致命违规并拥有一票否决权,Tier 2 用微观物理保真度与接触动力学区分合格样本;Gemini 3 Pro 担任打分人,用显式思维链(全局扫描 → 可疑帧标记 → 回溯确认)评估 N 个候选,通过淘汰赛选最优、败者组选最差,两阶段把复杂度控制在 \\mathcal{O}(N) 且三元组间隔清晰。

图 2:两阶段训练管线------SFT 加解耦判别器 Diffusion-DPO(物理清单出题、独立裁判打分、LoRA 微调)
Diffusion-DPO 训练。 对视频潜变量 z 注入高斯噪声 \\epsilon \\sim \\mathcal{N}(0,I) 与时间步 t \\sim \\mathcal{U}(0,T),单步去噪误差为 L(\\theta,z)=\|\\epsilon_\\theta(z_t,t,c)-\\epsilon\|_2\^2;DPO 目标同时压低胜者去噪误差、抬高败者去噪误差,分布散度由 \\beta=5000 控制。为规避 14B 模型双计算图显存爆炸,LoRA rank 64 只注入自注意力的 q/k/v/o 与前馈层,参考模型损失通过临时关闭 LoRA 权重零显存计算。
动作条件化生成(A2V)。 输入动作是 7 维增量向量(3D 位置、3D 姿态、夹爪开度,双臂 14 维)。论文用相机内外参把 3D 位置投影为 2D 中心点,姿态编码为彩色箭头(长度编码深度),夹爪开度映射为透明度圆斑,形成空间动作图 弥合低维指令与高维视觉的语义鸿沟。注入采用 VACE 式并行上下文块 :复制主 DiT 每第五个块处理动作图,输出经零初始化卷积残差相加 \\mathbf{x}*i = \\mathrm{DiT}_i(\\mathbf{x}*{i-1}) + \\alpha W_{\\mathrm{zero}}\^{(i)}\\mathbf{h}_i------训练初期上下文支路贡献为零,主干物理先验不被扰动,逐步学会动作可控。

图 3:A2V 架构------并行上下文块与零初始化卷积残差注入(对比 AdaLN 注入与直接拼接全量微调)
**数据质量的对齐验证保障(附录 A)。**动作-视频错配来自标定漂移、时钟不同步或坐标系不一致,会在数据里注入伪相关。论文将标定后的关节位置、末端笛卡尔位姿与夹爪状态渲染为半透明动作图叠加到视频帧上,由人工与 Qwen3-VL 自动验证器共同检查:投影轨迹与视觉夹爪轨迹偏离、或夹爪开合与视觉证据矛盾的片段一律剔除。

图 4:视觉-动作对齐验证------半透明动作图叠加视频帧,偏差样本在数据源头被拦截
实验设计与结果
**评测设置。**文本条件生成用 PAI-Bench 机器人域:174 条来自 BridgeData V2、AgiBot 与 Open X-Embodiment 的复杂操纵视频,Qwen2.5-VL-72B 作为裁判做二值问答,886 个问题覆盖空间(36.3%)、时序(28.6%)、物理(34.1%)三维度。动作条件生成从 A2V 数据集均匀采样 200 个实例,用 PSNR/SSIM 逐帧比对、nDTW 度量夹爪轨迹一致性。基线包括 Veo 3.1、Sora v2 Pro、Cosmos-Predict 2.5、GigaWorld-0、WoW-wan 14B、UnifoLM-WMA-0、Wan 2.5 与动作类 Enerverse-AC、Gen-Sim。
**PBench 主结果。**DPO 版模型平均分 0.8491,Domain Score 0.9306 为当前最优,较 SFT 基座 0.8785 提升 5.2 个百分点;画质上 Quality Score 0.7676 与基座 0.7678 几乎持平,而 Veo 3.1(0.7740)与 Sora v2 Pro(0.7679)虽然画质占优,Domain Score 分别只有 0.8350 与 0.7626------"视觉保真"与"物理保真"的跷跷板被打破。
| Model | Quality | Domain | Avg. | I2VB |
|---|---|---|---|---|
| Wan 2.5 | 0.7548 | 0.8644 | 0.8096 | 0.9438 |
| Veo 3.1 | 0.7740 | 0.8350 | 0.8045 | 0.9317 |
| Sora v2 Pro | 0.7679 | 0.7626 | 0.7652 | 0.9507 |
| WoW-wan 14B | 0.7605 | 0.8301 | 0.7953 | 0.9613 |
| Ours(SFT 基座) | 0.7678 | 0.8785 | 0.8232 | 0.9777 |
| Ours + DPO | 0.7676 | 0.9306 | 0.8491 | 0.9768 |
**EZSbench 零样本结果。**在机器人 × 任务 × 场景全未见的分布外测试上,本文平均 0.8030(Quality 0.7694 / Domain 0.8366),全面领先 WoW-wan 14B(0.7780)、GigaWorld-0(0.7549)、Cosmos-Predict 2.5(0.7394)与 UnifoLM-WMA-0(0.6294),证明物理保真收益可以泛化出训练分布。

图 5:EZSbench 构建流程------合成/编辑双分支图像增广与三段式稠密描述生成
**A2V 动作跟随结果。**本文 PSNR 21.09、SSIM 0.8126、轨迹一致性 0.8522,三项指标全面超过 Enerverse-AC(20.42 / 0.7542 / 0.8157)与 Gen-Sim(18.05 / 0.7413 / 0.6195),接触密集操作下物体几何与视觉完整性保持良好。
**评测协议防作弊设计(附录 B)。**EZSbench 的初始观测池与全部训练数据零重叠:合成支路用 Nano Banana 控制机器人形态、场景、任务、视角四个正交变量;编辑支路用大 VLM 对真实机械臂图像做背景替换并保留前景物理交互。稠密描述经视觉锚定、运动学合规动作模拟与叙事合成三段生成。评判同样解耦:Qwen3-VL-32B-Thinking 用 System 2 协议按空间/时序/物理九大准则动态出题,并强制混入 30--50% 负向问题(如"红苹果是不是绿的")杜绝随机猜测捷径,最终由 Qwen2.5-VL-72B-Instruct 独立裁决。

图 6:EZSbench 零样本定性对比------红刀进红盒、黑勺进黑盒的长程组合任务
**A2V 定性补充(附录 D)。**动作条件生成对比中,Genie-Envisioner 与 Enerverse-AC 出现物体形变、隔空抓取伪影与目标定位错误;本文在相同动作序列下保持物体几何与视觉完整性,末端轨迹贴合命令动作,全程无接触畸变。

图 7:A2V 定性对比------接触密集操作中的几何保持(左:基线形变;右:本文稳定)
结果对比总结

图 10:结果对比总结------PBench/EZSbench/A2V 三线领先幅度(Mermaid 流程图)
关键发现
- 物理对齐是净收益:PBench Domain Score 从 SFT 基座 0.8785 提升至 0.9306(+5.2 pp),而 Quality Score 0.7678→0.7676 几乎不变,证明压制物理违规不以画质为代价。
- 保真收益可泛化:EZSbench 域外测试平均 0.8030,Domain Score 0.8366 保持领先------物理一致性不是训练分布内的过拟合。
- 数据管护贡献独立可验:SFT 基座模型 I2VB 0.9777、MS 0.9916,说明过滤与平衡流水线带来强时空稳定性,为 DPO 提供了干净起点。
- 动作可控性领先显著:A2V 轨迹一致性 0.8522 较 Gen-Sim 0.6195 领先 0.23 以上,零初始化并行上下文块没有引入灾难性遗忘。
- 创新模式完整(Oral 信号分析):方法同时命中 P15 属性定向预训练目标(物理合理性被精确改变,+5.2 pp)、P13 条件化适配而非重训练(零初始化注入)与 P10 异构分解差异化处理(出题/打分/评判角色分离),每项宣称都有量化消融背书。
- 叙事执行质量高:痛点开场、双根因归因、开源 EZSbench 承诺收尾,全文强声称均有表/图支撑,无 hedge 残留(arXiv 版仅有若干拼写笔误,如 Diffusion 误写为 Difusion)。
局限性
- 固定视角数据:依赖静态相机机位,无法建模视角变化下的物理动态。
- 缺乏闭环评测:尚未接入真实或仿真环境的闭环策略验证(规划、RL 环路)。
- 判别器成本:Qwen3-VL 出题 + Gemini 3 Pro 打分的偏好数据生产管线开销较大,长视频规模化需要权衡。
- 未来方向:作者计划扩展多视角生成,并推动真实世界部署;EZSbench 将开源,为具身视频生成提供标准化评测。
常见问题(FAQ)
ABot-PhysWorld 与 Veo 3.1、Sora v2 Pro 相比强在哪里?
在物理合理性上:PBench Domain Score 0.9306 对 Veo 3.1 的 0.8350 领先 9.56 个百分点,EZSbench 域外测试平均 0.8030 也全面领先,同时视觉质量(Quality 0.7676)与闭源模型同一水平。
为什么 Diffusion-DPO 不会把画面质量"训坏"?
DPO 偏好数据由物理清单驱动,优化的只是"物理违规 vs 合规"的排序间隔;且 LoRA rank 64 微调仅作用于 q/k/v/o 与前馈层,基座分布被约束在很小的低秩邻域内,实验显示 Quality Score 仅变化 0.0002。
EZSbench 与 PBench 有什么本质区别?
PBench 的测试样本与训练数据同分布;EZSbench 的机器人、任务、场景组合在训练中完全未见,且图像源(合成 + 真实背景编辑)与描述生成(运动学动作模拟)都不依赖任何训练数据,是首个训练无关的具身零样本基准。
动作是怎么"注入"视频生成模型的?
7D 动作先投影成空间动作图(箭头编码朝向与深度、圆斑编码夹爪开度),再由每第五个 DiT 块克隆出的并行上下文块处理,经零初始化卷积残差加回主干------训练初期注入支路输出为零,因此不会冲掉预训练物理先验。
"解耦判别器"解决了什么问题?
单模型既出物理题又自我打分会产生自我评估幻觉。本文让 Qwen3-VL 只出题(动态物理清单、Tier 1 一票否决)、Gemini 3 Pro 只打分(思维链 + 淘汰赛),判别与生成彻底分离,偏好三元组质量更高、间隔更清晰。
这篇工作与 World Action Model(WAM)是什么关系?
WAM 直接把动作条件世界模型当零样本策略用。ABot-PhysWorld 的动作可控生成(A2V 轨迹一致性 0.8522)与跨本体数据平衡,恰好为 WAM 提供了"物理可信 + 动作可控"的预测基座,是同一技术路线的上游组件。
参考链接
- 论文 arXiv 摘要页:ABot-PhysWorld (arXiv:2603.23376)
- 项目主页 / 代码仓库:AMAP CV Lab ABot-PhysWorld
- PAI-Bench:A Comprehensive Benchmark for Physical AI
- WoW:Towards a World Omniscient World Model through Embodied Interaction
- World Action Models are Zero-Shot Policies
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)