26年9月来自慕尼黑工大(TUM)、达姆施塔特工大(TUD)、意大利Trento大学和Ulm大学和的论文"Embedding Physics Priors in Robot Learning: A Survey"。
这篇论文的核心贡献,是用一个统一框架说明:物理知识可以在机器人学习的什么位置发挥作用,以及不同嵌入方式各有什么收益和代价。 它适合用来建立研究地图、理解方法之间的联系;但在"什么条件下哪种方法更好、优势有多大"方面,提供的定量证据仍然有限。
论文研究的出发点,是机器人学习面临的数据、泛化与可靠性问题。 机器人数据往往需要真实硬件、人工监督和安全保障,获取成本高;机器人又存在摩擦、接触、欠驱动、柔性变形等复杂动力学,仅依靠数据拟合,很难确保模型在新环境中仍然有效。另一方面,解析模型虽然具有明确的物理意义,却难以完整描述真实系统。
作者因此主张:把已知的物理规律作为学习过程的"归纳偏置",让模型在有限数据下优先学习符合物理结构的解。这里最关键的前提是:物理先验必须与实际系统相符;错误或过强的先验也可能限制学习。
论文覆盖动力学学习、轨迹规划与预测、控制、状态及参数估计四类任务。机器学习方法包括神经网络、高斯过程、稀疏辨识、符号回归、算子学习,以及扩散模型、视觉---语言---动作模型(VLA)和视频世界模型。强化学习只有在通过本文定义的物理嵌入机制使用先验时才纳入,因此其结论需要放在这一范围内理解。(第2---4页)
"物理先验"在文中的含义很广。 作者将其分为五组,而且允许相互重叠:

这意味着,本文讨论的物理知识既包括基本力学规律,也包括机器人结构、近似模型和运行约束。(第2页)
如图 1 所示在机器人学习中融入物理先验知识的不同层次包括:(a) 物理引导的输入、数据与表征;(b) 物理编码的网络架构;© 物理信息驱动的损失函数。尽管现有研究大多仅侧重于其中某一个层次,但联合采用这些互补的途径或许能更充分地利用物理先验知识,然而目前针对这些方法的系统性比较研究尚显不足。

整篇综述的主线,是按"物理知识嵌入在哪里"划分三条路线。 这是全文最值得掌握的框架。(第5---6页)

三类方法可以组合使用。例如,一个模型可以采用拉格朗日架构,同时加入功率一致性损失,并使用物理设计的激励轨迹采集训练数据。
用机械臂举例:先计算物理特征再交给网络,是物理引导;让网络学习惯性和势能,再由力学方程计算运动,是物理编码;让普通网络预测运动、训练时惩罚违反力学规律的结果,是物理约束损失。
如图 4 所示对融合物理特性的机器人学习方法进行分类的决策流程。仅融入通用数学结构或未应用于机器人系统的方法,因不符合首要标准,故不在本综述的涵盖范围内。这三类方法(物理引导、物理编码、物理知情)并非互斥:通过依次评估各项标准,一种方法可能会被赋予多个标签。

物理编码架构是全文讨论最充分的部分。 它的基本思想是把可靠的结构固定下来,让数据学习其中未知的函数、参数或子系统。(第7---20页)

其中,DeLaN很好地体现了"学习未知部分、保留已知结构"的思路。对适用的机械系统,动力学可以写成:
M(q)... q+c(q, .q)+g(q) = tau
DeLaN学习惯性矩阵 M(q) 和势能 V(q),其余相关项由力学关系导出。通过令
M(q) = L(q)L(q)T
并约束三角因子的对角元素为正,可以在结构上保证惯性矩阵正定。这里保证的是一项明确的物理性质,并不能据此推断整个机器人闭环系统一定稳定或安全。
混合模型则更接近很多实际工程方案,其思想可以概括为:
预测动力学 = 已知物理模型 + 学习得到的修正项
例如,保留车辆刚体动力学,让网络学习复杂轮胎力;或保留机械臂动力学,用学习模块补偿摩擦、传动间隙等误差。论文认为,这类方法在先验知识不完整时具有实用价值,但修正项也可能吸收物理参数误差,使参数解释变得困难。
如图 5 所示嵌入物理特性的机器人学习架构子类别:

物理约束损失的优势,是可以适配多种模型。 其训练目标通常可以概括为:
L = L_数据 + lambda L_物理
第一项要求预测符合观测,第二项要求预测尽量满足动力学、边界条件、能量或其他物理约束。物理残差可以在没有观测标签的配置点上计算,因此有机会降低对标注数据的依赖。(第20---23页)
论文介绍的应用包括:用连续体力学残差学习软体机器人形状;用刚体动力学约束估计无人机参数;学习用于模型预测控制的快速替代模型;通过运动学损失改善VLA生成轨迹的可行性。
这条路线的限制也很明确:
数据项与物理项之间需要合理平衡。
不准确的方程会把模型推向有偏的解。
自动微分和残差计算会增加训练成本。
接触、碰撞等不光滑现象更难处理。
训练残差较小,只说明训练目标被较好满足,不能直接保证所有新状态下都符合物理规律。
物理引导路线主要改变模型看到的数据、采用的表示,或生成结果的修正方式。 它通常较容易接入现有学习系统,是论文讨论生成模型时的重要路线。(第23---26页)
其代表做法包括:
物理特征与数据设计: 将物理模型预测、力、速度等信息作为输入;根据系统特性设计更有辨识力的激励轨迹。
几何表示: 在旋转群、位姿空间等适当空间中表示状态和动作,避免把受约束的量当成任意欧氏向量处理。
物理数据生成: 用仿真、可微渲染或控制器修正生成示范,缓解真实数据不足。
世界模型: 在视频生成中加入占据、物体运动、接触几何或物理参数,使生成结果更有物理依据。
扩散模型推理引导: 在动作采样过程中利用外部运动学或动力学模型提供修正,让生成动作更接近可行解。
这部分一个重要判断是:视觉逼真与动力学有效是两个不同评价维度。 世界模型生成的运动即使看起来自然,也可能存在错误接触、不合理受力或不可执行动作。其物理可信度还取决于外部模型和估计参数的准确性。
从机器人任务看,论文展示了四种主要用途。 学到物理模型只是中间环节,最终收益应体现在具体任务上。

软件部分梳理了结构化建模工具、神经微分方程库、系统辨识工具、PINN框架和可微仿真器,例如NeuroMANCER、nnodely、torchdiffeq、PySINDy、DeepXDE、Brax和Warp。作者指出,工具之间仍较分散,从模型训练到闭环验证、部署和在线适应,需要较多整合工作。(第27---29页)
这篇综述最值得记住的要点,可以归纳为六条。
物理先验是一种有条件的优势。 当先验准确、数据有限时,它尤其可能提高样本效率和泛化;当先验失配时,它也可能造成难以消除的结构偏差。
"嵌入位置"比方法名称更有解释力。 判断一项工作时,应检查物理知识究竟进入数据、架构还是损失,以及推理时是否仍有明确约束。
强先验与表达灵活性之间存在取舍。 能量结构、几何约束等可以限制不合理解,同时也可能排除真实系统中未被假设覆盖的行为。
结构性质、预测准确、可解释性和安全需要分别评价。 惯性矩阵正定、轨迹预测准确、参数有物理名称、闭环安全,分别需要不同证据。
现有证据集中在特定机器人和较低维系统。 按作者统计,机械臂与车辆占所综述工作的约62%,足式机器人约7%;高自由度与复杂接触任务仍缺少充分验证。
融合多条路线是作者强调的发展方向。 按主要嵌入路线统计,架构编码约占71%、物理引导16%、物理损失13%;作者统计的多路线组合工作约占4%。这些数字描述的是该综述收集并分类的文献,不代表整个领域的精确普查。(第31---33页)
作者指出的领域问题,主要集中在以下六个方面。 这些是被综述研究尚未解决的难题,需要与论文自身的不足区分开。(第30---31页)

相应地,作者提出七条未来方向:组合多种嵌入路线、发展物理感知基础模型、构建可微端到端流程、处理复杂接触、自动发现物理架构、扩展到高自由度机器人,以及建设可互操作的软件和统一基准。(第31---33页)
就这篇综述本身而言,以下问题最值得指出:
- 横向比较主要是定性的,尚不足以支持明确的方法优劣排序。
第20页表7明确说明,其比较针对架构性质,而非实测性能。不同论文的数据量、机器人、噪声、任务和计算预算都不同,因此"样本效率更高""泛化更好"多数只能理解为特定实验中的结果。综述还缺少把这些条件统一整理后的证据分层,读者难以判断收益究竟来自物理先验、模型容量,还是训练和数据设计。
- 检索过程有说明,但系统性和可复现性仍可加强。
正文说明使用Google Scholar检索,配套仓库也公布了关键词,并说明结合前后向引文追踪和作者领域知识。这是有用的透明度措施。但正文未完整呈现检索命中、去重、排除、质量评估等流程,也未系统区分预印本与经过同行评审工作的证据强度。因此它更适合作为广泛的分类综述,不能据此判断所有相关工作已被无偏覆盖。
- 分类框架清晰,但部分边界仍偏宽。
作者明确说,单纯的数学结构不能自动算作物理先验;然而第3.8.2节又纳入认知、感知和生物启发结构,使"物理规律""几何结构""领域经验"和"认知启发"的边界变得模糊。此外,同一模块究竟归为输入处理还是整体架构的一部分,也可能取决于观察粒度。更严格的整理应同时标注:先验来源、嵌入位置、约束强度、成立条件和保证范围。
- 覆盖分布限制了结论的外推。
大量证据来自机械臂、车辆和低自由度动力学问题。论文虽然纳入足式机器人、世界模型与VLA,但这些工作的数量和成熟度并不相同。因此,目前的证据尚不足以直接支持对全身人形操作、灵巧手、多物体复杂交互或跨形态通用策略的强结论。这既反映领域现状,也限制了综述能给出的判断。
- 对"可解释参数是否可辨识"的讨论不够深入。
一个网络输出被称为"质量""摩擦"或"势能",并不意味着它恢复了真实物理量。如果观测与激励不足,多组参数可能产生相似运动;混合模型中的残差又可能补偿错误参数。论文承认物理意义可能弱化,但缺少对可辨识性、激励条件、参数耦合及验证方式的集中整理。
- 工程成本的比较还不够具体。
软件表提供了功能和硬件信息,但方法比较缺少统一的训练成本、推理时延、内存、传感器需求,以及在线更新代价。对机器人而言,一个提高预测精度的方法,如果依赖难测的加速度或动量,或者无法满足控制周期,其实际价值就会受到限制。这些条件应更直接地进入方法选择依据。
- 个别技术表述需要收紧,变分积分网络是一个具体例子。
第13页先较谨慎地描述了变分积分器的长期能量性质,随后却把VIN概括为将辛结构、能量和动量守恒都作为硬架构约束。这容易让读者理解为它一般能够严格保持能量。实际上,其引用的VIN原始论文明确区分了几何结构保持与近似能量保持;动量保持也需要相应的离散对称性条件。这里更准确的表述应强调:保持辛结构、在相应条件下保持动量,并具有良好的长期能量误差行为。