人工智能顶会ICLR 2026论文分享|Ctrl-World:让机器人策略在想象空间中完成评估与改进机器人学习领域一直有个核心难题,如何在不依赖大量真实机器人rollout的情况下,判断通用机器人策略是否真正理解了指令,并进一步利用这些经验提升策略在陌生物体和新任务上的表现。真实世界中的策略评估通常需要反复执行任务,研究者不仅要准备不同的物体、场景和相机位置,还需要通过多次实验获得具有统计意义的结果。当策略在某类任务上失败时,后续改进往往还需要重新采集专家示范数据。这个过程成本较高,也限制了通用机器人策略的迭代速度。近期,来自斯坦福大学和清华大学的研究团队在ICLR 2026上提出Ctrl-World,