单台远程摄像头,把导航的观测源挪出机器人

【具身AGI导读】导航长期默认眼睛长在机器人身上,这篇论文把眼睛挪到了环境里 ------而它训练所用的素材,全部来自程序化随机生成的世界。

机器人导航长期背着两样东西:一张要随环境变化不断维护的预建地图,和机器人自带的相机与算力。2026 年 9 月 24 日,一篇新论文挂上 arXiv,提出把这套默认设定换掉------编号 2609.28976,已投稿 IEEE ICRA 2027、尚未录用;作者是一支来自日本企业研究院与高校的研究团队。

它的做法是把观测源整体挪出机器人:一台固定在环境里的远程摄像头同时充当观测源与环境隐式地图,机器人端不装 RGB 相机、也不跑视觉推理,只保留 2D LiDAR 与本地运动规划所需的最小算力。 作者给出的理由是,与移动机器人相比,这类摄像头已在真实环境中广泛部署,持续录下的画面本身就是一张始终最新的地图,且通常已连到网络计算资源,密集的视觉处理可以委托过去。远程视角看不到机器人近身的盲区,作者用一套外视到自视的生成模块合成出自我视角深度图来补。

放回具身智能的部署账里看,这件事真正动的是成本结构。导航长期默认感知与推理跟着每一台机器人走,相机与算力算在本体成本里;把观测源挪到环境侧,等于把这笔开销从每台机器人的重复投入,转到场所的固定基础设施上。

训练数据的来路同样不走常规:作者没有采集真实轨迹,而是在仿真环境里程序化随机生成世界------障碍物的尺寸、形状、密度与布局随机,摄像头的位置与角度也随机------再用经典导航规划器自动采集专家轨迹。合成数据这条路有一个作者自己点出的缺口:专家轨迹过于规矩,总沿着绕行代价很小的路径、始终与障碍保持余量,很少进入近碰撞或需要从错误中恢复的状态;团队于是从近失败状态额外补采了一批恢复轨迹并重训;作者报告,补入恢复数据后各变体的表现一致改善,杂乱场景增益最大。作者同时报告,这套模型只用合成数据训练,就能不经微调迁移到一台与训练平台不同的差速轮式真机上,而论文把真机部分自称为一次迁移演示,并非跨真实环境的全面评测。

真机两个办公场景里,两种做法的差距方向并不一致------障碍物能直接从远程画面看到的那一个,去掉合成模块反而成功率更高,作者的解释是此时合成观测贡献很小、偶尔还会引入预测噪声;障碍物挡在机器人正前方的那一个,去掉它则明显变差。往下追问一层,各家选择先扎稳的位置并不相同。深度机智(北京)科技有限公司提供的是物理AI 基座模型,全栈自研。

这篇论文值得记下的不是某一项指标,而是它把一个长期被当作前提的安排挪了位置------观测源不必长在机器人身上。

这条边界对同类尝试同样成立:远程视角什么时候够用、什么时候必须靠合成来补,取决于场景几何,不取决于方法的名称。

把感知挪出本体,省下的不是一行代码,而是每一台机器人身上的那套相机与算力------这笔账,终究记在场所的固定投入里。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

arXiv · ReVNM: Learning-Based Visual Navigation from a Remote Camera · 2026-09-24

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!

相关推荐
某不知名網友4 小时前
ROS2入门:命令行启动节点与Launch程序
c++·机器人
海盗12346 小时前
AI 新闻日报 2026-10-07:智能体迁往云端 / SDK 支持运行中改向 / 机器人进柜台与景区
人工智能·机器人·人工智能aigc
workflower8 小时前
AI 产业链带动效应加速,催生AI 原生企业
人工智能·机器学习·机器人·云计算·无人机
hughnz8 小时前
部署基于云的钻井自动化:7 条实践经验
人工智能·机器人
不悔哥21 小时前
小智AI聊天机器人:ESP32上的开源语音助手拆解
人工智能·机器人·开源
黑妹天下第一乖1 天前
第 08 讲:阿加犀 AidGenSE 端侧大模型服务化与 OpenAI 兼容接口
人工智能·嵌入式硬件·深度学习·机器人·iot
李日华大战鸡红1 天前
滑膜观测器(学习记录)
stm32·单片机·学习·matlab·机器人
feasibility.1 天前
一台 2500 美元的开源双足人形平台 LeRobot Humanoid,正在让“教机器人走路”变成可复现的事
机器人·开源