免标定视觉伺服综述:严格定义、四级分类与端到端的边界
调研日期:2026-09-30;修订:2026-10-08、2026-10-09
调研动因:近年"免标定(calibration-free)"成为机器人视觉与视觉伺服领域的热词,但不同工作对该词的使用宽严不一。本文做一次概念审计 ------以严格定义(根本不存在手眼标定流程、不用标定板)为基准,把 2021--2026 年所有"免标定"主张分级(四级分类),检验一条守恒律:标定信息量不会消失,只会被转移或代价化 ;并从管线保留度 (P0 经典 → P1 框架内局部改造 → P2 严格端到端)给出第二条正交的分析轴。VGM-VS 与 CamVLA 两篇 2026 年预印本作为 T2 级典型案例全文通读,IBVS 结构的免标定机制给出数学级详解。
口径:本文为学术调研文档;文内引用以 n 标注,对应文末参考文献;arXiv 预印本结论引用时须降级;VGM-VS、CamVLA 为预印本(全文已通读,关键论断附英文原文);分级判定基于论文全文核查(每篇均经 arXiv/出版页核实存在);原 §10 的待核实清单已于 2026-10-09 逐项关闭(全文获取 ×2、版本核查 ×2、引用更正 ×1、口径声明 ×1),余留问题在本版定稿。
0. 结论先行
- 按严格定义审计,2025--2026 年以 "calibration-free" 为卖点的新论文全部不合格 :VGM-VS(Agile Robots + TUM 1)把标定转移进了离线优化器 (手眼矩阵从自采数据中学出),CamVLA(NTU + 阿里达摩院 3)把标定转移进了训练数据和网络回归 (标定相机采集 + GT 手眼监督 + 每帧预测手眼旋转)。两者都消灭了"标定板"和"手工标定",但标定这个信息量从未消失。
- 真正严格合格的"免标定"只有四条经典路线,每条都明码标价:IBVS 结构(数学上免手眼,价=需内参+深度,§6.1)、端到端 BC/RL(价=绑死物理布置)、图像空间伺服(价=放弃度量精度)、纯仿真零样本部署(价=sim2real 天花板 + 哲学边界);2025 年新增的边界成员 Salvato 52(集合基 min-max 鲁棒控制,价=需外参区间界+内参已知,§6.5)表明严格定义一侧仍在产出 new results。
- 两条分析轴正交,而论文叙事常把它们捆绑 :"免标定"的来源是所选框架 (IBVS 在数学上免手眼),神经网络的引入贡献的是特征鲁棒性而非免标定------把 ViT-VS 的 DINOv2 换回 Harris 角点,免手眼性质原封不动;反过来 MIRAI 式端到端用了神经网络,标定却进了权重(§3)。
- 严格端到端(LLM 直接输出物体状态/运动指令)的中间环节不是"被模型完成",而是"被前移或放弃":标定与识别前移进预训练语料与 VLM 预训练------DROID 每条 episode 都记录相机标定,VLA 把语料内参"背"了下来,换相机即退化;点云生成在 RGB 接口处被放弃------代价体现为系统性空间短板(VSI-Bench 最佳模型 46% vs 人类 79.2%)与度量精度的无基准状态(§3.4)。2024--2026 的回摆潮(VLA 主干重新显式接入内参/点云/几何头)是守恒律的闭环验证。
- "免标定板 ≠ 免标定流程":标定板被消灭后,标定流程残留仍分六档(L0--L5 光谱,§8)。2026 年最新工作(RobotArena∞ 42 / PointWorld 43)已站到"标定融入数据管线"(L4)的门槛上,但**"运行时后台连续估计、随作业收敛、零专门激励"的 L5 形态在机械臂域无人认领**------自动驾驶 sensor 标定已做到,机械臂没有。
- "顺带估计"不算免标定:正常作业中顺带估外参的三类代表(EKF 手眼 32、可观测性主动校准 33、EgoRoC 18)系统内部都显式存在外参估计量,且可辨识性依赖激励充分性------它们是"运行时持续标定",只是工序被作业运动顺带完成。
- 内参是全体"免标定"叙事的隐藏前提:免标定板谱系(EasyHeC 34 / Hydra 36 等)全体假定内参已知;"免标定板"只免了外参板。同时免内参的 T2 家族成员(如 Sensors 2025 几何约束法 29)是少数。
1. 严格定义、降级规则与审计方法
1.1 严格定义
免标定(严格意义):系统生命周期(训练、部署、维护)的任何阶段都不存在"以获得手眼/相机外参矩阵为目的"的专门步骤,且不使用任何标定板/标定物。
1.2 三条降级规则(命中任一即不算严格免标定)
- R1 免标定板但有标定流程:标定板被机器人本体/场景结构/可微渲染替代,但专门采集运动+一次性求解的骨架仍在(EasyHeC 系 3435 是重灾区);
- R2 标定量从数据中学出 :手眼矩阵、雅可比、calibration embedding 等被网络推理或优化器显式估计出来------这是自动化标定,不是免标定;
- R3 标定前移:训练数据用标定相机/标定传感器采集(含仿真 GT 外参监督),部署面"免标定"只是债务进了数据集。
1.3 审计一问
对任何 "calibration-free" 声明,只问:标定信息去了哪? 答不上来的,就是未披露债务。
2. 四级分类总表(审计结果)
| 等级 | 定义 | 代表工作 | 标定信息去处 | 价签 |
|---|---|---|---|---|
| T1 严格合格 | 数学/结构上不存在手眼标定步骤,标定量从未被估计 | ① IBVS 结构(ViT-VS 10 / ART-VS 11 继承此性质);② 端到端 BC/RL(Levine 2016 16 起、MIRAI 同类);③ 图像空间伺服(Robot-Relay 19 家族);④ 纯仿真零样本部署(KOVIS 21 → CNS 22 → Depth-PC 23;MERL 25);⑤ Bateux 2018 26(相机=被控对象,手眼问题不存在);⑥ Salvato 2025 52(集合基鲁棒控制,§6.5) | 被数学结构消解(①⑤)/被蒸馏进权重(②④)/被问题定义放弃(③)/被区间先验界住(⑥) | 见 §6 逐条 |
| T2 自动化标定 | 无标定板,但标定量被显式学出/在线估出 | VGM-VS 1 (手眼矩阵学出)、CamVLA 3(手眼旋转每帧回归)、NUVS 27(calibration embedding 网络推理)、MFAC 28(NN 在线估手眼)、Sensors 2025 几何约束法 29(在线雅可比学习)、Yin 2023 30(边界:免标定量但有激励辨识)、Zhong 2025 51(Kalman 在线估计复合雅可比,已核实) | 优化器 / 网络权重 / 运行时辨识器 | 激励条件、无误差界、或每场景重来 |
| T3 标定前移 | 训练/出厂有标定(含板),部署免标定 | Krishna ICRA 2017 17(7-Scenes 标定数据 + KinectFusion 位姿真值)、CamVLA 训练侧(RLBench 仿真 GT 手眼监督 + 5 台标定 D435i)、严格端到端 VLA(R3 极致:语料即标定,§3.4.2) | 数据集(真实/仿真) | 标定债进数据,债务随数据规模放大 |
| T4 假免标定 | 需内参/深度/预标定相机却被二手引用宣传为免标定 | ViT-VS 10 / ART-VS 11(论文自己从未声称免标定------"全文检索 calibrat 零命中",是引用者在加戏) | 未披露 | 内参+RGB-D 原封不动 |
审计全景的关键事实:
- 2025--2026 顶会/arXiv 上以 calibration-free 作卖点的新工作,按严格定义全部落在 T2/T3------真正守住定义的是 2020--2023 年的老工作和 Oxford 的图像空间路线;
- KOVIS/CNS/Depth-PC 有一个哲学边界:真实机器人上零标定环节,但仿真器里"知道一切" ------按 R3 宽严解释可在 T1/T3 之间移动。本文采用"真实系统"宽口径将其列 T1;若按 R3 严格追问仿真 GT,则应降级 T3------引用时须声明口径 212223;
- 内参单独记分:T1①(IBVS)免手眼但需内参+深度;同时免内参的合格者几乎没有(这是全文献最稀缺的组合)。
3. 第二条轴:管线保留度光谱(P0 经典 → P1 框架内改造 → P2 严格端到端)
四级分类回答"标定信息去了哪";本节给出第二条正交 的轴------经典视觉工作流程的骨架保留了多少。它解释了文献混淆的另一层来源:不同论文说的"新方法"其实改造的是管线的不同深度,而"改造深度"与"标定属性"经常被有意无意地捆绑营销。
3.1 判据
经典视觉伺服的工作流骨架:图像 → 特征/对应 → 中间几何表示(相对位姿 / 交互矩阵 / 标定参数)→ 控制律 → 机器人。按这个骨架的保留程度分三档:
- P0 经典 :骨架完整且各环节均为经典实现;标定是管线之外的人工前置工序,必做;
- P1 框架内局部改造 :骨架拓扑不变(中间几何表示仍在、控制律仍是经典伺服律),一个或多个环节被替换------特征换成神经网络、标定工序换成可微优化、标定参数换成在线辨识;
- P2 严格端到端 :大规模 LLM/VLM 直接输入视觉信息,直接输出物体状态或机器人运动指令 ;经典管线中的标定、点云生成、识别等环节全部不显式存在 ,由模型内部隐式完成;若局部恢复显式几何结构(如回归手眼矩阵的输出头),记为 P2′(带几何头的端到端)。
3.2 P0:经典路线------标定必做,人工介入
代表:Tsai-1989 式手眼标定(标定板 + 专门位形 + 人工)+ 经典 IBVS/PBVS 5。标定位于管线之外:先标定、再部署,标定质量直接决定控制精度,回路内无兜底。P0 没有"免标定"叙事问题------它从不声称免除什么;它是其他各档的参照系,也是 L0--L5 光谱(§8)的起点。
3.3 P1:框架内局部改造------"哪个环节被替换"
P1 的共同性质:中间几何表示仍在,因此可解释性、稳定性分析(Lyapunov)、误差审计的通道都保留;代价被隔离在改造点内部。按改造位置分四类:
| 改造点 | 替换内容 | 代表 | 标定后果 |
|---|---|---|---|
| A 感知前端 | 手工特征/匹配 → 深度特征、基础模型特征 | DFBVS 13、ViT-VS 10 / ART-VS 11(DINOv2/v3 912 patch 对应)、DINOBot 56 | 标定性质完全继承所选框架:IBVS 框架下仍免手眼、仍不免内参+深度 |
| B 标定工序本身 | 标定板+人工 → 可微渲染 / 机器人本体 / 亚秒重标定 | EasyHeC 34 → Hydra 36(0.8s)、CalibAll 40、L4 管线化(RobotArena∞ 42 / PointWorld 43) | 标定没消失,工序在压缩(L0--L5 光谱即此改造点的内部谱系,§8) |
| C 交互矩阵/雅可比的标定依赖 | 标定参数 → 在线辨识/自适应 | Piepmeier 8、Liu 2006 15、Cheah 2010 91、PHUVS 29、Yin 30、MFAC 28、MERL 25 | 标定量不再显式存在(T2 家族主体) |
| D 位姿/几何前端 | PnP / 经典 SLAM → 视觉几何基础模型、可微自标定 SLAM | VGM-VS 1(VGGT-Ω 2 替换 PnP)、DroidCalib 48 一脉、MASt3R-SLAM 57 | 标定被吸收进前馈网络或其微调(R2/R3) |
3.4 P2:严格端到端------LLM 接管全部中间环节
这是 R3(标定前移)的极致形态,也是检验守恒律的最强试金石:经典管线的标定、点云生成、识别环节全部不显式存在,由大规模 LLM/VLM 内部隐式完成 535455。本节回答三个问题:中间环节的信息去哪了?模型替代它们的能力边界在哪?阵营内部发生了什么?
3.4.1 代表工作:I/O 接口的"标定真空"
| 模型 | 输入 | 输出 | 控制频率 | 显式标定输入 |
|---|---|---|---|---|
| RT-2 55 | 单目 RGB + 语言 | 动作文本 token(基座系,每维 256 bin 离散化) | 1--3Hz | 无 |
| OpenVLA 54 | 单目第三人称 RGB + 语言 | 7 维离散动作 token(基座系) | 5--10Hz | 无 |
| π0 / π0.5 468 | 多视角 RGB + 语言 + 本体状态 | flow matching 连续动作块(50 步 chunk) | 名义 50Hz(chunked) | 无 |
| Octo 65 | 多视角 RGB + 语言/目标图 + 本体 | diffusion 去噪连续动作 | ~10Hz | 无 |
| RDT-1B 66 | ≤3 视角 RGB + 语言 + 本体 | DiT 连续动作(一次 64 步) | --- | 无 |
| GR00T N1 67 | 双视角 RGB + 语言 | flow-matching 高频动作头 | 30--120Hz 级 | 无 |
核查结论:2023--2025 的主流 VLA 无一家把相机内参/外参作为显式输入------输入一律是 RGB(+语言+关节状态),动作输出定义在机器人基座坐标系。标定信息不是"被输入",而是"被隐含进训练数据分布"。唯一的例外阵营出现在 2026 年(见 §3.4.5)。
3.4.2 中间环节去哪了:守恒律逐环节清算
| 经典环节 | 严格端到端中的去向 | 证据 |
|---|---|---|
| 标定 | 前移到预训练语料与采集台架 (R3 极致):DROID 69 自称 in-the-wild,但 76k 条遥操作 episode 每条都记录 camera calibration、深度、外参 ------采集依赖"相机-机器人几何已知且固定"的台架;Open X-Embodiment 70 把内外参作为元数据随语料分发,且已出现 "metadata decay " 观察(Dexset 报告):采集装置一变、元数据即失效,整个 episode 退化为无几何多目视频;RLBench / LIBERO 71 的动作真值直接来自仿真器状态------VLA 在 LIBERO 上的高分本质上是"仿真器替它做了标定" | 部署侧实证:ABot-M0 部署指南明确"VLA 期望内参接近 DROID/OXE 设定,FOV>120° 相机会掉点"------模型把训练语料的相机内参"背"了下来,换相机即退化;社区观察:"VLA 无法进行相机外参的单元测试" |
| 识别 | 前移到 VLM 预训练的视觉编码器(SigLIP/DINOv2 级):~90 万条机器人轨迹只训练动作头,开放词表识别几乎全部由互联网规模图文预训练带来 76 | "识别能力来自哪一级预训练"的量化归因论文尚缺(§10) |
| 点云生成 | 从未显式存在:RGB-only 接口干脆放弃 3D 中间表示------不是"被 LLM 完成",而是"在接口定义处被放弃";代价转移给空间能力(§3.4.3) | PointVLA 75 的间接证据:向 2D VLA 注入点云,任务成功率 2.0% → 34.2/51.3% |
一句话清算:严格端到端没有"消灭"标定、识别、点云中的任何一项------标定和识别被前移到语料与预训练(债权人:数据集不可见),点云被接口放弃(债权人:空间能力赤字)。这正是 §9 守恒律的预测。
3.4.3 空间与度量能力的实测短板
严格端到端成立的前提是"LLM 能隐式完成被消灭的中间环节"。实测证据指向相反方向:
| 基准/工作 | 关键数字 | 结论 |
|---|---|---|
| VSI-Bench(CVPR 2025)59 | 人类 79.2% vs 最佳模型(Gemini-1.5 Pro)46%;构型类任务(物体计数 34 vs 人类 94.3)崩溃式落后;>70% 错误归因于空间推理本身;CoT/self-consistency 无效 | MLLM 空间推理是系统性短板 |
| BLINK(ECCV 2024)60 | 人类 95.7 vs GPT-4o 60.0;深度排序、空间关系子任务接近随机 | 人类"一眼即答"的低级视觉感知恰是 MLLM 最弱项 |
| SpatialVLM(CVPR 2024)61 | 既有 VLM 在度量空间问答上仅略高于随机;需大规模 3D 合成 QA 数据灌注才能补救 | 首次系统化证明 VLM 度量推理缺失 |
| SpatialRGPT(ECCV 2024)64 | 引入深度插件后才显著提升空间关系/度量 QA | 纯 2D VLM 的空间推理需要显式深度补偿(回摆证据) |
| RoboPoint(CoRL 2024)62 | GPT-4o 无法精确输出 affordance 点;专门训练的 13B 模型反超 GPT-4o 21.8% | VLM"指不准动作落点" |
| Molmo & PixMo(CVPR 2025)63 | pointing 以归一化 0--100 图像坐标输出,最高约 92% | 能"指出",但坐标系是图像而非物理------与度量精度无关 |
| PointVLA(RA-L 2025)75 | 点云注入把同策略成功率 2.0% → 34.2/51.3% | 纯 RGB VLA 的精细空间任务成功率基数极低 |
| RoCo Challenge(AAAI 2026 工业装配)82 | 参赛 VLA 采用腕部相机中心策略,动机即"绕开全局深度标定的复杂性" | 工业高精度场景下 VLA 被迫回避外参标定问题 |
另有一项空白值得记录:截至 2026-10,不存在以"毫米级放置精度"为指标的 VLA 专门评测 ------最接近的工业部署评估 89 结论为"微调后简单抓取可用,复杂环境/高精度放置差距明显"。度量精度在严格端到端范式中没有度量衡------这本身就是中间表示消亡的代价之一。
3.4.4 "物体状态输出"的核查:3D-LLM 与 VLM 直出 6D 位姿
严格端到端的定义还包括"输出物体状态"。核查两个分支:
- 3D-LLM 家族 (3D-LLM 85、LL3DA 86、PointLLM、LEO、Chat-3D、Scene-LLM 等):没有一篇从单目 RGB 直接输出 6D 位姿 ------输入前提几乎全部是已重建好的点云/3D 场景 (ScanNet 类),即"点云生成"环节只是从系统内挪到系统外------按守恒律这是转移,不是消灭 。grounding 输出是"3D 框/对象引用",评估指标是 Acc@IoU、BLEU 等,全家族没有任何 mm/° 量级报告------它们的"定位"语义是"指对物体",不是"测准位姿"。且 2026 年已有工作指出 ego pose 是该类模型的隐含前提。
- VLM 直出 6D 位姿的尝试 :Open6DOR-GPT(IROS 2024 90,GPT-4V 直接从图像推理目标 6D 位姿)成功率远低于专用方法,且必须外挂 Grounded-SAM 掩码 + 点云 ;Closed-Loop VLM Agents(ECCV 2026)83 以 VLM 迭代提议 6D 位姿 + 经典运动规划,摘要原文声称"比最近的 VLA 更成功"------分层架构在 6D 位姿任务上击败了端到端 VLA 。对照经典 6D 管线:FoundationPose 80(CVPR 2024,ADD(-S) ~90%+、支持 model-free)与 BundleSDF 81(CVPR 2023)有完整的 mm/° 报告------VLM 直出位姿的工作没有任何 mm/° 报告,只有任务成功率。
3.4.5 回摆:P2 内部向 P1 的回归
严格端到端阵营 2024--2026 出现系统性回摆,且回摆方向精确指向被消灭的中间环节:
| 工作 | 回摆内容 |
|---|---|
| 3D-VLA 74(ICML 2024) | 点云编码器 + 3D 世界模型注入 |
| PointVLA 75(RA-L 2025) | 冻结 2D VLA,向动作专家注入点云特征 |
| SpatialRGPT 64 / VLM-3R | 深度插件回补空间推理 |
| OG-VLA 73 | 用已知内参把图像反投影成点云、渲染正交图喂回 LLM------显式重新引入内参 |
| G³VLA 72 | 内参条件化 ray embedding + 外参感知 3D 位置编码注入视觉 token 流;原文直陈:"现有 VLA 的 2D 图像 token 接口让已知内外参只能被间接推断,这是多相机系统的不良归纳偏置" |
| MVUCF | 训练期用内外参构造几何监督"塑形"隐状态,部署时丢弃几何信息(训练吃标定、运行不吃) |
| H-VLA 84 | 把每个数据集的相机/内外参/标定方法列表化------"标定现状"被显性化 |
分层共识的表述级证据:VLA 综述 76 把 hierarchical 架构定义为 "explicitly decouple planning from execution via interpretable intermediate representations" ;Agile-VLA 87 摘要点出 "a fundamental conflict between high-latency semantic inference and the high-frequency control required for dynamic manipulation" ,解法 = 感知 10Hz / 控制 50Hz 异步双流 + 几何锚点直接映射动作基元;业界观察总结为一句话:"VLMs emit geometry, not skill names"------VLM 的输出被限制在点/关键点位姿级中间量,闭环留给经典控制器。CamVLA 3(P2′,§5)正是这一回摆在"标定"维度上的对应物。
3.5 关键澄清:两条轴正交
最容易被论文叙事混淆的一点:"免标定"的来源与"神经网络"的引入是两个正交的问题。
- ViT-VS 10 免手眼,是因为它选了 IBVS 框架 (数学上免手眼,§6.1);DINOv2 改造的是特征可靠性,对标定性质零贡献------把 DINOv2 换回 Harris 角点,免手眼性质原封不动;
- 反过来,MIRAI 式端到端同样用了神经网络,标定却进了权重(布置绑死);严格端到端 VLA 用了最大规模的 LLM,标定与识别却前移进了语料(§3.4.2)------神经网络的规模与免标定的严格性之间没有任何正相关;
- 同一 IBVS 框架 + 不同深度的感知改造:手工特征(P0/P1 边界)→ DFBVS 13 → ViT-VS/ART-VS 1011,标定需求恒定(内参+深度),鲁棒性递增------改造深度与标定属性无关。
混淆的实证:VGM-VS 1 把"基础模型""免标定"捆绑叙事,但其免标定成分来自改造点 B/D 的"自动化标定"(T2),遮挡鲁棒性来自 VGGT-Ω 的视觉前端------两件事在论文中并未分离消融(其无微调消融只证明了微调必要,没有回答"VGGT-Ω 特征泛化 vs 手眼矩阵学习各贡献多少")。
3.6 十年钟摆:P0 → P2 → P1(2016--2026)
- 2016--2021 端到端浪潮:Levine 16 → QT-Opt 58 → Diffusion Policy 53,叙事主线是"中间表示是历史包袱";
- 2021--2026 框架内回归 :感知前端改造(DFBVS 13 → ViT-VS 10 → ART-VS 11)、标定工序改造(EasyHeC 34 → Hydra 36 → L4 管线化)、交互矩阵改造(PHUVS 29 等带 Lyapunov 证明的混合方法)、位姿前端改造(VGM-VS 1);同期严格端到端阵营内部也向 P1 回摆------CamVLA 3 的几何头、扩散策略的残差/分层结构、以及 VLA 主干重新接入内参与点云(G³VLA 72、OG-VLA 73)。
- 驱动力 :端到端在精度 (亚毫米一律需"学习粗定位+经典伺服/力控"两段式;6D 位姿任务上"VLM 提议+经典规划"击败 VLA 83)、频率 (学习闭环 10--30Hz 的十年统计规律 4950)、可审计性(无误差界;空间推理错误率 >70% 59)三方面撞上天花板;中间几何表示被重新承认为"必要分层"而非"包袱"。
4. T2 典型案例 I:VGM-VS(标定去了优化器)
arXiv:2609.28312 1|Sen Wang 等,Agile Robots SE(慕尼黑工业机器人公司)+ TUM |2026-09-23 预印本 v1(2026-10-09 复核:仍仅 v1)。开源状态:论文无任何代码发布承诺或链接,未检索到官方仓库;上线两周半无引用与复现。
4.1 一句话画像
预训练视觉几何模型(VGGT-Ω 2)回归"当前图↔参考图"相对位姿,迭代作 PBVS 位姿增量;尺度歧义与手眼矩阵通过"目标位姿附近 2 分钟自动扫描采集 + camera head 微调"一次性解决------不是免标定,是把一次手工标定换成一次自动化标定。
4.2 方法要点(全文级)
- 感知前端:VGGT-Ω 只取 camera head、丢深度分支;输入 = 目标位姿处单张参考图 + 当前图,一次前向输出相对位姿。参考图即"视觉锚点",靠工作台静态结构定位------不需要物体模型、检测器、手工特征("it requires no object model, detector, or hand-crafted features")。
- 控制回路:反应式 PBVS------不等运动完成就拍下一帧,新预测直接覆盖旧指令;收敛判据增量平移 <0.3mm、旋转 <0.3°;收敛后执行预定义单轴直线任务运动(插入末段开环)。
- 手眼矩阵怎么来 :初始化为单位阵,作为可学习参数与 camera head 一起被监督信号优化,学完后冻结、不在线更新 : "the hand--eye transform no longer requires a dedicated calibration procedure: initialized at the identity, a learned transform replaces ᵉT_c and is optimized directly from the loss supervision"
- 采集与训练成本(关键数字) :机器人沿锥形螺旋轨迹(apex 在目标位姿,r_max=10cm、8 圈)全自动 采集约 1 万张图像-位姿对(90Hz,2 分钟);微调 8×RTX 6000 Pro 约 2 小时。
4.3 "免标定"边界核查表
| 项目 | 是否免除 | 证据 |
|---|---|---|
| 手眼标定流程 | ❌ 自动化替代------手眼矩阵从自采数据优化出来(R2 命中) | §4.2 引文 |
| 相机内参标定 | ✅ 免(VGGT-Ω 从无标定图像回归 FOV) | 论文 III-A |
| 标定板 | ✅ 全周期不用 | --- |
| 目标定义 | ❌ 需人工在目标位姿拍参考图 + 预定义末端任务运动 | 论文 III-A/IV |
| 换工位 | ❌ 重新采集+重新训练(论文 limitation #1 自述:"a new workspace requires another recording and training session") | --- |
| 信任链前提 | ❌ 训练标签来自机器人本体位姿反馈------免标定的代价是信任转移到本体出厂标定 | --- |
4.4 性能与实验
- 平台:Franka Emika Panda / Agile Robots Thor 3,eye-in-hand + RealSense D405,部署 RTX 5090;30Hz 是 D405 帧率上限(基线 ORB-IBVS/ART-VS 11 推理 110/132Hz 同样被卡在 30Hz)。
- 定量(每设定 100 次试验):线缆 picking 0.58mm/0.20° 、insertion 0.67mm/0.08°;RAM 插装 50% 遮挡下 100% 收敛(基线 ORB-IBVS 15%、ART-VS 55%);动态场景 90--100%。
- 基线:ORB-IBVS、ART-VS 11 + 无微调消融(动态 insertion 0% 成功------证明微调不可替代,即"自动化标定不可省")。
4.5 判定与代价
判定:T2 自动化标定(R2 典型);管线定位:P1 的 B+D 双改造点 (标定工序改造 + 位姿前端改造,§3.3)。精度(亚毫米)和遮挡鲁棒性真实可信,但"每工位 8 卡 2 小时 + 换场景重来"与示教覆盖式产品(MIRAI 类)的"每工位 45 分钟示教"是同一种病:标定债按场景次数复利计息。
5. T2/T3 典型案例 II:CamVLA(标定去了训练数据+网络回归)
arXiv:2607.05396 3|Wenhao Li 等,NTU + 阿里巴巴达摩院 |2026-07-06 预印本 v1(2026-10-09 复核:仍仅 v1)。开源状态:项目页仅有 "Code (Coming Soon)" 占位按钮,官方代码/权重/数据均未发布;已有约 4 次引用与一处非官方机制复现。
5.1 一句话画像
动作定义在相机系(6DoF delta),网络加一个几何头从单目 RGB 每帧显式回归手眼旋转矩阵,平移分量被数学精确消去------部署时零外参输入。"免标定"只对部署成立:标定被转移进了训练数据(多机位标定相机采集 + GT 手眼监督)。
5.2 方法要点(全文级)
- 双头解耦 :动作头输出相机系 6-DoF delta(平移增量+轴角旋转增量+夹爪);几何头是轻量 3 层 MLP(+6.3M 参数),从视觉 token 回归 6-DoF 手眼矩阵 T_t ∈ SE(3)------是网络输出头,不是离线标定注入 : "This makes T_t an explicit network output, whereas in the cross-frame baseline, it remains implicitly entangled in the weights."
- 平移消元(核心技巧) :delta 是自由向量,合成时只需旋转矩阵 R_t,手眼平移 τ_t 在推导中精确抵消: "test-time drift in τ_t has zero physical impact on execution, confining viewpoint errors exclusively to R_t."
- "Calibration-free"的确切含义(R3 命中) : "ground-truth hand-eye matrices are used only as training supervision, and the model receives no extrinsic information at deployment."
训练时需要标定(GT 手眼作 L_ext 监督 + 真机用 5 个不同机位的标定 RealSense D435i 采集),部署时零外参输入。
5.3 性能与实验
- 零样本未见视角(仿真 RLBench):套 π0 4 上 33.2%→51.4%(+18.2pt)。
- 真机 15° 视角偏移:普通 VLA 崩到 16.0%/14.7%,CamVLA 保持 29.3%/33.0%------"相机被碰后 VLA 失效"的定量写照。
- 手眼旋转预测误差 1.41°(45° 训练间隔时升至 8.28°);12° 注入噪声下仍超无噪声基线;RTX 4090 61→62ms(几何头 +1ms),10Hz。
- 无对照:未与"部署时输入 GT 外参的标定版 VLA"对比;>15°"基线和我们都很差,继续评估不实际"(§5.2 原文)。
5.4 局限与判定
- 论文自述:"struggles under extreme viewpoint changes and high-precision tasks due to out-of-distribution visual features and hand-eye regression errors";绝对定位信息为零(相机系 delta 只能相对修正);R_t 是感知式猜测------无误差界、无收敛保证。
- 判定:T2(部署侧自动化标定------每帧回归手眼旋转)+ T3(训练侧标定前移);管线定位:P2′(带几何头的端到端,§3.4)。真正贡献不是免标定,而是**"把纠缠在权重里的几何变成显式可监督的输出头"**------这与"显式几何"的学术思想同构,但实现层是"学出来的几何"而非"测出来的几何"。适合"相机会动、精度要求低、任务语义重"的场景;不适合"相机必须准、精度必须承诺"的工业伺服。
6. T1 真免标定的路线(合格名单与价签)
6.1 IBVS 结构:数学上免手眼(最干净的经典答案)
IBVS(image-based visual servoing)不是"绕过"标定,而是手眼标定在数学上不进入控制公式。本节给出完整推导------这是全部"免标定"文献里最被低估的答案,也是 ViT-VS/ART-VS 1011 免手眼的结构根源。记号与稳定性论证遵循 Chaumette & Hutchinson 的经典教程 5。
6.1.1 交互矩阵:手眼从哪一步消失
eye-in-hand 设定:相机系 {c} 中一 static 世界点 P=(X,Y,Z)P=(X,Y,Z)P=(X,Y,Z),Z>0Z>0Z>0。透视投影(归一化坐标):
x=XZ,y=YZ,u=fxx+cx,v=fyy+cyx = \frac{X}{Z}, \qquad y = \frac{Y}{Z}, \qquad u = f_x x + c_x, \qquad v = f_y y + c_yx=ZX,y=ZY,u=fxx+cx,v=fyy+cy
控制输入为相机速度螺旋 vc=(vx,vy,vz, ωx,ωy,ωz)v_c = (v_x, v_y, v_z,\ \omega_x, \omega_y, \omega_z)vc=(vx,vy,vz, ωx,ωy,ωz)。相机运动、点相对静止:P˙=−v−ω×P\dot P = -v - \omega \times PP˙=−v−ω×P。对 x˙=(X˙−xZ˙)/Z\dot x = (\dot X - x\dot Z)/Zx˙=(X˙−xZ˙)/Z 展开并利用 X=xZ, Y=yZX=xZ,\ Y=yZX=xZ, Y=yZ 合并同类项:
x˙=−1Zvx+xZvz+xy ωx−(1+x2) ωy+y ωz\dot x = -\frac{1}{Z}v_x + \frac{x}{Z}v_z + xy\,\omega_x - (1+x^2)\,\omega_y + y\,\omega_zx˙=−Z1vx+Zxvz+xyωx−(1+x2)ωy+yωz
y˙=−1Zvy+yZvz+(1+y2) ωx−xy ωy−x ωz\dot y = -\frac{1}{Z}v_y + \frac{y}{Z}v_z + (1+y^2)\,\omega_x - xy\,\omega_y - x\,\omega_zy˙=−Z1vy+Zyvz+(1+y2)ωx−xyωy−xωz
写成 s˙=Ls vc\dot s = L_s\, v_cs˙=Lsvc,单个点的交互矩阵:
Lxy(x,y,Z)=−1Z0xZxy−(1+x2)y0−1ZyZ1+y2−xy−xL_{xy}(x, y, Z) = \begin{bmatrix} -\frac{1}{Z} & 0 & \frac{x}{Z} & xy & -(1+x^2) & y \\4pt 0 & -\frac{1}{Z} & \frac{y}{Z} & 1+y^2 & -xy & -x \end{bmatrix}Lxy(x,y,Z)=−Z100−Z1ZxZyxy1+y2−(1+x2)−xyy−x
像素坐标下 Ls=Af LxyL_s = A_f\, L_{xy}Ls=AfLxy,Af=diag(fx,fy)A_f = \mathrm{diag}(f_x, f_y)Af=diag(fx,fy);kkk 个点堆叠成 2k×62k \times 62k×6。
关键观察 :这个传感器方程里没有手眼矩阵------它只连接"相机系速度"和"图像变化"。控制对象就是相机自己:观测系与控制系是同一个坐标系,几何上自洽,手眼标定问题在问题定义中不存在。这不是工程技巧,而是 1990 年代免标定伺服传统(Hosoda & Asada 6、Jagersand 7、Piepmeier 8)的出发点。
6.1.2 控制律与稳定性
误差 e=s−s∗e = s - s^*e=s−s∗,控制律 vc=−λ L^+ev_c = -\lambda\, \hat L^{+} evc=−λL^+e(L^+\hat L^{+}L^+ 为伪逆;2k≥62k\ge 62k≥6 且满秩,最少 3 个非共线点)。取 Lyapunov 函数 F=12∥e∥2F=\frac{1}{2}\|e\|^2F=21∥e∥2:
F˙=e⊤e˙=e⊤Lsvc=−λ e⊤LsL^+e\dot F = e^\top \dot e = e^\top L_s v_c = -\lambda\, e^\top L_s \hat L^{+} eF˙=e⊤e˙=e⊤Lsvc=−λe⊤LsL^+e
L^=Ls\hat L = L_sL^=Ls 时 LsL^+L_s\hat L^{+}LsL^+ 为投影矩阵 ⪰0\succeq 0⪰0,F˙≤0\dot F\le 0F˙≤0,秩条件下 e→0e\to 0e→0;L^\hat LL^ 取期望位姿处评估可证局部渐近稳定 5。价签之一:局部收敛、奇异位形、局部极小、点跑出视场。
6.1.3 与 PBVS 对比:手眼误差进"测量"还是进"执行"
PBVS 链路:图像 →(PnP 位姿估计,需 KKK + 物体 3D 模型)→ cTo{}^{c}T_ocTo → 与期望位姿求差得 eee → 经 Ad(cTe)\mathrm{Ad}({}^{c}T_e)Ad(cTe) 转回末端系 执行。手眼矩阵 cTe{}^{c}T_ecTe 出现在最后一步,且是测量链路的一部分:标定误差直接旋转/平移每个周期的 Cartesian 误差,产生恒定指令偏置,反馈无从纠正------位姿虽每周期重测,但坐标系转换误差恒定。
IBVS 链路:图像 → e=s−s∗e=s-s^*e=s−s∗ → vc=−λL^+ev_c = -\lambda\hat L^+ evc=−λL^+e(相机系速度)。输出本身就是相机系速度;转关节速度 q˙=Jc(q)+vc\dot q = J_c(q)^{+} v_cq˙=Jc(q)+vc 时手眼变换确以常值伴随矩阵形式出现在 Jc(q)=Ad(cTe)⋅Je(q)J_c(q)=\mathrm{Ad}({}^{c}T_e)\cdot J_e(q)Jc(q)=Ad(cTe)⋅Je(q) 中,但身份已变 :它是运动学安装常数(如法兰工具长度),不是计量学外参;且它只位于执行链路 ,闭环闭合在 sss 上------安装常数误差导致的实际运动偏差被反馈逐周期吸收,而误差测量本身永远来自图像。
一句话:PBVS 的手眼误差进测量(不可自愈),IBVS 的安装常数误差进执行(被反馈吸收)------这是"IBVS 免手眼标定"的严格机制,也是 ViT-VS/ART-VS/VGM-VS 11011 全部采用 eye-in-hand 腕部相机的根本原因。
6.1.4 价签的数学根源:内参与深度
守恒律在公式里一眼可见------LsL_sLs 条目中写着两个标定量:fx,fyf_x,f_yfx,fy (内参,整体缩放 L^\hat LL^,类增益误差,反馈可部分吸收)与 1/Z1/Z1/Z (深度,只出现在平移列,旋转列与 ZZZ 完全无关 ------粗略深度主要劣化平移收敛速度而不破坏收敛)。实践上 IBVS 容忍粗糙的 fff 和 ZZZ(Chaumette 教程"对标定误差不敏感"的准确含义 5),但结构上它们没消失 ------这就是"免手眼不免内参+深度"价签的出处。两条经典缓解线:深度无关交互矩阵 (Liu 一脉 15,LsL_sLs 拆分为深度相关/无关部分 + 自适应律------注意:该术语的确切出处是 Liu 等 T-RO 2006,文献中常被误归到 Cheah 名下)与 unknown-depth 自适应雅可比控制(Cheah 一脉 91)------后者按本文四级分类已滑入 T2(运行时辨识器替代标定)。
6.1.5 两个边界
- eye-to-hand 不享受此性质 :相机固定、机器人移动工具时,特征变化经由"工具-目标"几何传导,相机安装外参仍在链上。"IBVS 免手眼"是 eye-in-hand 专属。
- **2.5D 伺服(Malis 1999 14)**走中间路线:单应分解出部分 3D 信息,需内参------"部分标定"。
6.1.6 2026 年实例化
ViT-VS 10 / ART-VS 11 即教科书 IBVS 的现代实现:sss = DINOv2 9 / DINOv3 12 patch 对应(best-buddy 匹配替代手工特征;更早的深度特征 IBVS 前驱是 DFBVS 13),L^\hat LL^ 用标定内参 + RealSense 深度构建,其余是经典控制回路------所以它们的论文里 "calibrat" 零命中:免手眼对它们是结构默认值,根本不值得宣传。被二手引用加戏成"免标定",恰暴露引用者没看懂这条数学链。
6.2 端到端 BC/RL:几何蒸馏进权重(示教覆盖式产品的学术同类)
- Levine JMLR 2016 16、Krishna ICRA 2017 17(后者实为 T3,位姿真值来自标定传感器)、Micropsi MIRAI 类产品:标定概念不存在,被蒸馏进策略权重。
- 价签:换相机/换安装/换机器人即失效(EgoRoC 18 明确批评此点:"visual-servo coupling between the camera and the robot... requires fine-tuning when the configuration differs");无收敛保证;精度受数据覆盖封顶。
6.3 图像空间伺服:放弃度量(Oxford 路线)
- Robot-Relay 19(AURO 2026 期刊版)及多机器人 CCTV 扩展 20:多墙装相机网络、纯像素空间闭环、"No inter-camera or camera-to-robot calibration required";检测网络用机器人自运动自生成标签。
- 价签:无度量精度,只适合导航/中继类任务;每相机需一次自转采集(自标注,非标定)。
6.4 纯仿真零样本部署 + 特征空间动力学
- KOVIS 21(IROS 2020)→ CNS 22(ICRA 2024,浙大,GNN 对应编码,真机亚毫米 40fps)→ Depth-PC 23(ICRA 2026,用 DepthAnythingV2 24 相对深度替代深度相机):真实系统上零标定环节,域随机化/基础模型吸收几何不确定性。
- MERL TR2025-042 25(SAC 2025):直接在视觉特征空间学习转移动力学并逐次线性化,不恢复任何标定量------绕过而非转移。
- 价签:sim2real 天花板;哲学边界见 §2(本文取"真实系统"宽口径列 T1)。
- 特例:Bateux ICRA 2018 26------相机即被控对象(龙门),手眼问题在问题定义中不存在;全文检索 "calibrat" 零命中。价签:平面场景假设 + 每场景从单张参考图合成微调。
合格名单的共同规律 :各条路线分别用"数学结构 / 权重蒸馏 / 问题放弃 / 仿真烘焙"消灭了标定,没有一条能同时给出度量精度 + 免内参 + 不绑布置------这正是守恒律的正面证据(§9)。
6.5 边界新成员:Salvato 2025------集合基鲁棒控制(T1 的"部分先验"变体)
Salvato 等(RAS 2025 52,全文已核实)代表严格定义一侧仍在产出的新结果。其机制与 T2 家族划清了界限:手眼变换未知,但假定其 RPY 角与平移分量落在给定区间 内;关键数学事实是伺服雅可比对这组不确定参数是 multi-affine 的,由 Mapping Theorem 它被包含在一个 512 顶点的矩阵多胞形内;控制律取 min-max 形式 u=−κJ^⊤eu = -\kappa \hat J^\top eu=−κJ^⊤e,J^=argminJ∈多胞形∥Je∥\hat J = \arg\min_{J\in\text{多胞形}} \|Je\|J^=argminJ∈多胞形∥Je∥------每步在线解一个凸 QP,选最坏情形下仍保证误差下降的方向。系统从不估计、从不输出手眼矩阵或任何外参估计值------原文明确与估计类方法划界:"those approaches rely on the online estimation of a Jacobian... Our method, instead, is inherently robust, because it does not rely on an online estimate, but is based on a min-max approach."
- 稳定性 :Theorem 3 给出 V=12∥e∥2V=\frac{1}{2}\|e\|^2V=21∥e∥2 下的指数收敛证明( \\dot V \\le -\\kappa\\beta_0^2\|e\|^2),前提是多胞形鲁棒非奇异(离线可检验)------T2 家族普遍缺失的严格证明,这里齐了。
- 实验:UR10e 真机(eye-in-hand),人手扰动跟踪,达到亚毫米/亚厘弧度容差。
- 判定与价签 :T1 边界成员 (满足严格定义:无标定流程、无标定板、无显式估计量;标定信息以"区间先验"形式存在而非被转移)。价签:需离线给定外参区间界 (而非标定值)+ 内参已知 + PBVS 的 FOV/奇异边界(作者自承认)。它是"消灭"标定的第四种方式:用集合有界不确定性替代点估计------守恒律的又一种付清方式。
7. T2 家族其他成员与"顺带估计"灰色地带
7.1 T2 家族(自动化标定)补充名单
| 工作 | 标定信息去处 | 一句话 |
|---|---|---|
| NUVS(ICRA 2024,浙大)27 | 网络推理出 "calibration embedding" | 只是不叫标定的标定量 |
| MFAC UIBVS(arXiv:2211.11209)28 | NN 在线估手眼关系 | 仅仿真 |
| Sensors 2025 几何约束法(PHUVS)29 | 在线雅可比学习(CMAC) | T2 家族最"干净"的:无板、宣称免内参/免深度、有 Lyapunov 证明------代价是初始化需激励运动 |
| Yin 2023(arXiv:2304.08464,DTU)30 | 有限差分激励 + LM 在线更新雅可比 | 边界案例:免标定量(手眼矩阵从不被显式恢复)但不免激励辨识------安全关键场景不便做激励(论文自述) |
| Zhong 2025(Appl. Sci.,全文已核实)51 | Kalman 滤波器显式在线估计 48 维复合图像雅可比 JsJ_sJs;DQN 仅作 FOV 网格约束补偿(非标定载体) | UR5 真机 2.5Hz;无数值 mm 报告;作者自认学习算法稳定性分析 "remains an open issue" |
| Valassakis CoRL 2022(反向样本)31 | 单张图直接回归外参 | 自己就是标定,只是无板------R1 典型 |
7.2 灰色地带:"顺带估计"判定------不算
正常作业中顺带估外参的三类代表:
| 工作 | 机制 | 为何仍属标定 |
|---|---|---|
| EKF 手眼(arXiv:2211.06881)32 | SLAM/EKF 在机器人运动中估手眼 | 显式外参估计量存在;需工作区特征+专用采集 |
| 可观测性主动校准(arXiv:2506.13420)33 | FIM 最大化规划激励轨迹 | 干脆靠设计激励保证可辨识------"顺带"是假的 |
| EgoRoC(CVPR 2026)18 | 腕部相机内置 diffusion 在线手眼模块 | 学习化顺带估计,最"灰";估计量仍显式存在 |
判定理由 :①系统内部显式存在外参估计量 = 运行时持续标定;②可辨识性依赖激励充分性,"纯顺带、无激励设计"的工作一篇都没找到;③这是把"标定工序"藏进作业,不是消灭标定。
8. "免标定板"谱系的流程残留光谱(L0--L5)
标定板被消灭后,标定流程残留仍分六档------这是拆穿 "markerless/targetless" 宣传的第二把刀(管线定位:P1 改造点 B 的内部谱系,§3.3):
| 档位 | 定义 | 代表 | 流程残留 |
|---|---|---|---|
| L0 满配标定 | 标定板 + 专门位形 + 人工全流程 | Tsai 1989、OpenCV 系 | --- |
| L1 免板、流程完整 | 专门激励运动 + 一次性求解 + 人工确认 | EasyHeC 34(132.7s + 关节空间探索)、LRBO 37、ARC-Calib 38、Kalib 39 | 高 |
| L2 近零流程 | 极少随机位形 + 亚秒级求解 | Hydra 36 (3--9 个随机位形、0.8±0.4s、ROS2 集成) | 低(仍需主动摆位) |
| L3 免板、重优化 | 免专门运动设计但百秒级渲染优化 | EasyHeC++ 35、SurgCalib 41、CalibAll 40 | 中(时间换) |
| L4 标定融入数据管线 | 机器人零额外动作,标定退化为管线副产品 | RobotArena∞ 42(ICLR 2026)、PointWorld 43(CVPR 2026)------正常示范采集中顺带解外参 | 离线在算力侧 |
| L5 运行时后台连续估计器 | 作业进行中在线收敛、免激励、免人工 | 机械臂域:空缺;仅自动驾驶 camera-LiDAR 在线标定做到了 | --- |
三个关键事实:
- EasyHeC 系是"免板≠免流程"宣传 gap 最大的一档(Hydra 论文复测其单次标定 132.7±17.4s 3436);
- "markerless" 一词 2025 年后已被反向稀释 :CalibAll 40 的 v1 标题为 "Stable Offline Hand-Eye Calibration for any Robot with Just One Mark"(2025-11-21 核实) ------"免标记"实际是"只需一个 mark";更值得注意的是其 v2 已彻底改题为 "Unify Robot Actions in Camera Frame"(2026-05-13),整篇论文离开标定叙事转向相机系动作统一------该工作自身的轨迹就是"免标定板"叙事退热的缩影;
- 内参是隐藏前提:该谱系全体假定内参已知(EasyHeC 34 用已知 K 渲染、Hydra 36 用 K 反投影、Kalib 39 的 PnP 需要 K)------"免标定板"只免了外参板;同时免内参的例外是 T-RO 2024/2025 不确定度感知标定一脉 4546;Sefercik 47 则显式针对"运行中漂移重标"。
9. 守恒律:标定信息量不会消失,只会被转移或代价化
9.1 正式表述
把 §2--§8 的全部案例抽象出来:
转移 :标定信息在系统内的去处只有四个------权重 (BC/仿真蒸馏/VLA 5354)、优化器 (VGM-VS 1、免标定板谱系)、训练数据 (CamVLA 3、Krishna 17)、运行时辨识器(T2 家族 27--3051、顺带估计 323318)。转移不消灭债务,只是把债权人换成"权重不可读 / 优化过程不可读 / 数据集不可见 / 激励条件不可控"。
消灭 :真正消灭标定信息只有四种方式,各带价签------放弃度量精度 (图像空间 19)、接受内参+深度前提 (IBVS,§6.1)、绑死物理布置 + sim2real 天花板 (仿真蒸馏 21--23)、用集合有界不确定性替代点估计(Salvato 2025 52,§6.5)。
第二条轴给出补充视角(§3):管线骨架越完整,标定信息的转移越可见、越可审计 ------P1(框架内改造)之所以成为 2021--2026 的收敛方向,正是因为它把转移限制在单一环节内,保留了误差审计通道;P2 的不可审计性不是学习本身的代价,而是中间表示消亡 的代价。严格端到端是 R3 的极致形态------语料即标定(§3.4.2)。
9.2 推论(审计武器)
任何宣称"既免标定、又有度量精度、又不绑布置、又免内参 "的工作,按守恒律必有未披露的去处。审计它就是问一个问题:"标定信息去了哪?" 2025--2026 年新论文在这一问下的表现:VGM-VS 1→优化器(披露);CamVLA 3→训练数据(披露);ViT-VS 10 被二手引用宣传为免标定→未披露(实际需内参+RGB-D);严格端到端 VLA→语料(披露但易被忽略:部署指南要求内参匹配 DROID/OXE 设定)。
9.3 光谱定位
按"标定流程残留"记分,§6 的 T1 路线位于光谱两端:图像空间/IBVS = "流程在问题定义中不存在",仿真蒸馏 = "流程在仿真器里提前发生";T2/T3 居中段;L5(运行时后台连续估计、随作业收敛、零专门激励)无人认领------注意 L5 并非"免标定",它是"标定流程的终极压缩形态",也是该方向尚未闭合的开放问题(§10)。
10. 开放问题(2026-10-09 定稿)
本节原列 10 项"待核实"清单,已于 2026-10-09 逐项关闭:6 项经全文/版本核实解决(Salvato 与 Zhong 全文获取并完成判定、Cheah 引用更正、CalibAll v1/v2 标题核实、VGM-VS 与 CamVLA 开源状态核查),1 项(KOVIS 族仿真边界口径)已在 §2 声明采"真实系统"宽口径。余下 4 项定稿如下:
- 机械臂域 L5 空缺(真开放):运行时后台连续手眼标定(免激励、免人工、随作业收敛)在机械臂域仍无工作。最接近者 Continual HeC 44 需逐场景训练与回放缓冲,不满足定义;旧相近工作(RAL 2020 手术器械交互式标定)仍需刻意交互运动。
- VLA 毫米级精度基准缺失(真开放):不存在以毫米级绝对定位误差为横向指标的 VLA 基准------582 篇规模的 VLA 评测综述 95 与实测经验文 96 均以成功率为核心指标。最接近者为残差自适应方法自报的 sub-1.5mm 放置精度 94,属方法自证而非社区基准。
- VLA 识别能力的预训练归因(真开放,已出现相邻工作):仍无量化归因论文;最接近者为视觉编码器移植诊断 93------系统消融了 SigLIP/DINOv2 等编码器选择对控制 MSE 的排序效应,但未触及语义识别能力的来源分解。
- VGM-VS 消融不完备(论文固有缺陷,非外部核查可解):1 未分离"VGGT-Ω 特征泛化 vs 手眼矩阵学习"的贡献;其无微调消融只证明微调必要。需作者补充消融或第三方复现------截至 2026-10-09,无官方代码、无后续工作(§4)。
参考文献
T2 典型案例
1 Wang S., Zhou Y., Gao J., Sun P., Naguib A. M., Marton Z.-C. VGM-VS: Rethinking Visual Geometry Model for High-Precision Visual Servoing . arXiv:2609.28312, 2026-09. 预印本 v1(2026-10-09 复核仍仅 v1,无官方代码)(Agile Robots SE + TUM).
2 VGGT-Ω. arXiv:2605.15195, 2026.(VGM-VS 所用视觉几何基础模型)
3 Li W., Jiang X., Qian Q., Zhao D., Xu R., Zhang G. CamVLA: From Fixed to Free Cameras --- Calibration-Free View-Robust Vision-Language-Action Model . arXiv:2607.05396, 2026-07. 预印本 v1(项目页 "Code (Coming Soon)" 占位,2026-10-09 核实)(NTU + Alibaba).
4 Physical Intelligence. π0: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164, 2024. RSS 2025.
IBVS 与免标定经典(§6.1)
5 Chaumette F., Hutchinson S. Visual Servo Control, Part I: Basic Approaches ; Part II: Advanced Approaches . IEEE Robotics & Automation Magazine, 13(4):82--90, 2006; 14(1):109--118, 2007.
6 Hosoda K., Asada M. Versatile Visual Servoing without Knowledge of True Jacobian . Proc. IEEE/RSJ IROS, 1994.
7 Jagersand M., Fuentes O., Nelson R. Experimental Evaluation of Uncalibrated Visual Servoing for Precision Manipulation . Proc. IEEE ICRA, 1997.
8 Piepmeier J. A., McMurray G. V., Lipkin H. Uncalibrated Dynamic Visual Servoing . IEEE Trans. Robotics and Automation, 20(1):143--147, 2004.
9 Oquab M. et al. DINOv2: Learning Robust Visual Features without Supervision . arXiv:2304.07193, 2023. T-PAMI 2024.
10 Scherl A., Thalhammer S., Neuberger D., Wöber C. et al. ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing . arXiv:2503.04545, 2025. IROS 2025(UAS Technikum Vienna + Univ. Alicante 等).
11 Scherl A. et al. ART-VS: Adaptive Resolution Tiling for Vision Transformer Visual Servoing . arXiv:2606.19089, 2026-06. 预印本.
12 Meta AI. DINOv3 . arXiv:2508.10104, 2025.
13 Adrian S., Do Q.-T., Pham Q.-C. DFBVS: Deep Feature-Based Visual Servoing . arXiv:2201.08046, 2022. IEEE CASE 2022.
14 Malis E., Chaumette F., Boudet S. 2-1/2-D Visual Servoing . IEEE Trans. Robotics and Automation, 15(2):238--250, 1999.
15 Liu Y.-H., Wang H., Wang C., Lam K. K. Uncalibrated Visual Servoing of Robots Using a Depth-Independent Interaction Matrix . IEEE Trans. Robotics, 22(4):804--817, 2006. DOI:10.1109/TRO.2006.878788.(该术语确切出处,文献中常被误归 Cheah 名下,2026-10-09 经 Crossref 核实)
91 Cheah C. C., Liu C., Slotine J. J. E. Adaptive Jacobian Vision Based Control for Robots with Uncertain Depth Information. Automatica, 46(7):1228--1233, 2010. DOI:10.1016/j.automatica.2010.04.009.
T1 其余路线(§6.2--6.5)
16 Levine S. et al. End-to-End Training of Deep Visuomotor Policies . JMLR 17(39), 2016.
17 Krishna K. et al. Exploring Convolutional Networks for End-to-End Visual Servoing . Proc. IEEE ICRA, 2017. arXiv:1706.03220.
18 Feng 等. EgoRoC: Towards Egocentric Robotic Control via Task-Agnostic Visual Alignment . CVPR 2026.
19 Robot-Relay. Building-Wide, Calibration-Less Visual Servoing . arXiv:2310.15677, 2023. Autonomous Robots, 2026(Oxford).
20 Oxford MRG. Multi-Robot Planning from CCTV Networks . arXiv:2606.06762, 2026-06.
21 KOVIS. Keypoint-based Visual Servoing with Zero-Shot Sim-to-Real . arXiv:2007.13960, 2020. IROS 2020(A*STAR).
22 Chen A., Yu H., Wang Y., Xiong R. CNS: Correspondence Encoded Neural Image Servo Policy . arXiv:2309.09047, 2023. ICRA 2024(浙江大学).
23 Zhang H. et al. Depth-PC: Visual Servoing Framework with Cross-Modal Fusion for Sim2Real . arXiv:2411.17195, 2024. ICRA 2026.
24 Depth Anything V2. arXiv:2406.09414, 2024.
25 MERL. Learning Visual Servoing for Nonholonomic Mobile Robots with Uncalibrated Cameras . TR2025-042, SAC 2025.
26 Bateux E., Marchand E., Chaumette F., Corke P. Training Deep Neural Networks for Visual Servoing . Proc. IEEE ICRA, 2018. arXiv:1705.08940.
52 Salvato E., Blanchini F., Fenu G., Giordano G., Pellegrino F. A. Position-Based Visual Servo Control without Hand-Eye Calibration. Robotics and Autonomous Systems, 193:105045, 2025. DOI:10.1016/j.robot.2025.105045.(全文 2026-10-09 核实:集合基 min-max 鲁棒控制,从不估计手眼矩阵,指数收敛证明,UR10e 真机)
T2 家族与灰色地带(§7)
27 Yu, Chen, Xu ... Xiong(浙江大学). NUVS: Adapting for Calibration Disturbances: A Neural Uncalibrated Visual Servoing Policy . ICRA 2024.(无 arXiv 版)
28 Zeng H. et al. A Novel Uncalibrated Visual Servoing Controller Based on Model-Free Adaptive Control . arXiv:2211.11209, 2022.
29 Geometry-Constrained Learning-Based Visual Servoing . Sensors, 25(8):2514, 2025.(PMC12031260;含 Lyapunov 稳定性证明)
30 Yin 等(DTU). Applications of Uncalibrated IBVS in Micro- and Macroscale Robotics . arXiv:2304.08464, 2023.
31 Valassakis E. et al. Learning Eye-in-Hand Camera Calibration from a Single Image . CoRL 2022, PMLR v164.
32 Automatic Eye-in-Hand Calibration using EKF . arXiv:2211.06881, 2022.
33 Observability-Aware Active Calibration of Multi-Sensor Extrinsics . arXiv:2506.13420, 2025.
51 Zhong X., Zhou Q., Sun Y., Kang S., Hu H.-S. Deep RL-Based Uncalibrated Visual Servoing with FOV Constraints. Applied Sciences, 15(8):4447, 2025. DOI:10.3390/app15084447.(全文 2026-10-09 核实:Kalman 在线估计复合图像雅可比 + DQN 仅作 FOV 约束补偿,T2;UR5 真机 2.5Hz,无 mm 级报告)
免标定板谱系与 L0--L5 光谱(§8)
34 Liu B. et al. EasyHeC: Accurate and Automatic Hand-Eye Calibration via Differentiable Rendering . arXiv:2305.01191, 2023. NeurIPS 2023(浙大 + UCSD).
35 EasyHeC++ . arXiv:2410.09293, 2024. IROS 2024.
36 Hydra: Marker-Free RGB-D Hand-Eye Calibration . arXiv:2504.20584, 2025.
37 LRBO: Look at Robot Base Once . arXiv:2311.01335, 2023.
38 ARC-Calib . arXiv:2503.14701, 2025. IROS 2025.
39 Kalib: Easy Hand-Eye Calibration with Reference Point Tracking . arXiv:2408.10562, 2024.
40 CalibAll . arXiv:2511.17001(v1: "Stable Offline Hand-Eye Calibration for any Robot with Just One Mark", 2025-11-21;v2 改题 "Unify Robot Actions in Camera Frame", 2026-05-13;标题差异 2026-10-09 经 arXiv 页面核实).
41 SurgCalib . arXiv:2603.08983, 2026.
42 RobotArena∞ . arXiv:2510.23571, 2025. ICLR 2026.
43 PointWorld . arXiv:2601.03782, 2026. CVPR 2026.
44 Continual Hand-Eye Calibration for Open-world Robotic Manipulation . arXiv:2604.15814, 2026.
45 Ulrich M., Hillemann M. Uncertainty-Aware Hand-Eye Calibration . IEEE T-RO, 2024.
46 Multiscale and Uncertainty-Aware Targetless Hand-Eye Calibration via Gauss--Helmert Model . IEEE T-RO, 2025. arXiv:2507.23045.
47 Sefercik 等. Learning-based Markerless Depth Camera Calibration . PMLR v205, 2023. arXiv:2212.07567.
48 Hagemann T., Knorr S., Stiller C. Deep Geometry-Aware Camera Self-Calibration from Video (DroidCalib). ICCV 2023, CVF Open Access(无 arXiv 版;博世/KIT).
端到端与混合(§3)
53 Chi C. et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion . arXiv:2303.04137, 2023. RSS 2023; IJRR 2024.
54 Kim M. J. et al. OpenVLA: An Open-Source Vision-Language-Action Model . arXiv:2406.09246, 2024. CoRL 2024.
55 Brohan A. et al. (Google DeepMind). RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control . arXiv:2307.15818, 2023. CoRL 2023.
56 Di Palo N., Johns E. DINOBot: Robot Manipulation via Retrieval and Alignment with Vision Foundation Models . arXiv:2402.13181, 2024. ICRA 2024 / RSS 2024.
57 MASt3R-SLAM. arXiv:2412.12392, 2024. CVPR 2025.
58 Kalashnikov D. et al. (Google). QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation. arXiv:1806.10293, 2018. IJRR.
严格端到端:VLA 接口、空间能力与回摆(§3.4)
59 Yang 等. Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces (VSI-Bench) . arXiv:2412.14171, 2024. CVPR 2025.
60 Fu X. et al. BLINK: Multimodal Large Language Models Can See but Not Perceive . arXiv:2404.12390, 2024. ECCV 2024.
61 Chen B. et al. SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities . arXiv:2401.12168, 2024. CVPR 2024.
62 Yuan Z. et al. RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics . arXiv:2406.10721, 2024. CoRL 2024.
63 Deitke M. et al. Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models . arXiv:2409.17146, 2024. CVPR 2025.
64 Chen J. et al. SpatialRGPT: Grounded Spatial Reasoning in Vision-Language Models . arXiv:2406.01584, 2024. ECCV 2024.
65 Octo. arXiv:2405.12213, 2024(UC Berkeley 等).
66 RDT-1B. arXiv:2410.07864, 2024. ICLR 2025.
67 NVIDIA. GR00T N1 . arXiv:2503.14734, 2025.
68 π0.5 . arXiv:2504.16054, 2025.
69 Khazatsky A. et al. DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset . arXiv:2403.12945, 2024. RSS 2024.
70 Open X-Embodiment Collaboration. Open X-Embodiment: Robotic Learning Datasets and RT-X Models . arXiv:2310.08864, 2023.
71 Liu S. et al. LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning . arXiv:2306.03310, 2023. NeurIPS 2023 D&B.
72 G³VLA. arXiv:2606.24472, 2026. 预印本.
73 OG-VLA. arXiv:2506.01196, 2025. 预印本.
74 3D-VLA. arXiv:2403.09631, 2024. ICML 2024.
75 PointVLA. arXiv:2503.07511, 2025. RA-L 2025.
76 Large VLM-based VLA: Survey . arXiv:2508.13073, 2025. 预印本.
77 Huang W. et al. ReKep: Spatio-Temporal Rekeying for Video-Guided Robotic Manipulation . arXiv:2409.01652, 2024.
78 Huang W. et al. VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models . arXiv:2307.05973, 2023.
79 Liang J. et al. Code as Policies: Language Model Programs for Embodied Control . arXiv:2209.07753, 2022. ICRA 2023.
80 Wen B. et al. FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects . arXiv:2312.08344, 2023. CVPR 2024.
81 Wen B. et al. BundleSDF: Neural 6-DoF Tracking and 3D Reconstruction of Unknown Objects . arXiv:2303.14158, 2023. CVPR 2023.
82 RoCo Challenge(工业装配基准). arXiv:2603.15469, 2026. AAAI 2026.
83 Baik 等. Text-Guided 6D Object Rearrangement via Closed-Loop VLM Agents . arXiv:2604.09781, 2026. ECCV 2026.
84 H-VLA. arXiv:2609.22895, 2026. 预印本.
85 Hong Y. et al. 3D-LLM: Injecting the 3D World into Large Language Models . arXiv:2307.12981, 2023. NeurIPS 2023.
86 Chen Z. et al. LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding, Reasoning, and Planning . arXiv:2311.18651, 2023. CVPR 2024.
87 Agile-VLA. arXiv:2603.22899, 2026. 预印本.
88 SignScene. arXiv:2602.12686, 2026. 预印本.
89 Chen Y. et al. 工业部署视角的 VLA 系统评测 . arXiv:2509.23121, 2025. 预印本.
90 Open6DOR / Open6DOR-GPT. IROS 2024 Oral(无 arXiv 版,OpenReview 可查).
背景方法件
49 FreqPolicy . arXiv:2506.08822, 2025. NeurIPS 2025(真机 93.5Hz).
50 RhinoVLA. arXiv:2606.07383, 2026(端侧 SoC 11.69Hz).
开放问题相关(§10)
93 Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic . arXiv:2606.14153, 2026-06. 预印本.
94 Residual Policy Adaptation for VLA Models in Precision Robotic Assembly . figshare 预印本, 2026-02(自报 sub-1.5mm 放置精度;非社区基准).
95 The Evaluation Bottleneck of Vision-Language-Action Models . preprints.org, 2026-06(582 篇评测综述).
96 Experiences from Benchmarking VLAs. arXiv:2511.11298, 2025-11. 预印本.