自动驾驶端到端训练_开环训练vs闭环训练

一、开环训练(Open-Loop Training)

定义

只用历史数据(静态数据集 )学习策略,训练过程中不能与环境交互

数据集 D = {(s, a, r, s')},由未知行为策略(human / rule / old policy)产生。

关键特征

  • 数据分布不随 policy 改变

  • 训练过程无实时反馈

  • 类似 supervised learning

开环 vs 闭环

开环 闭环
Fixed Dataset / Fixed Env → Train Policy Policy → Env → New Data → Update Policy

工程上大量使用的原因

  • 安全:不探索,不会触发危险行为

  • 稳定:可复现,同一数据多次复现

  • 成本低:复用日志数据

核心问题

🔴 如何在「看不到真实环境反馈」的情况下,学一个不会乱来的 policy?

开环训练的优劣势

✅ 优势 ❌ 劣势 🚗 自动驾驶能/不能解决
可控、稳定、可调试 分布外问题(OOD)------致命缺陷 ✅ 模仿人类策略
同一数据,多次复现 RL 学到的最优动作,数据里可能根本不存在 ✅ 平滑行为
Reward / loss 可对比 Coverage 决定上限:长尾无解 ✅ 风格偏好学习
易于 ablation study 无法纠正自身错误:学错一次→无反馈→永久错 新场景泛化
符合安全要求 交互博弈
无在线探索,合规友好 Corner case

⚠️ 核心矛盾:开环训练数据可控、安全、低成本,但分布外泛化能力弱,无法处理未覆盖状态和交互博弈。


二、闭环训练(Closed-Loop Training)

策略能学到 「我现在的动作,会如何改变未来世界」------这是开环训练做不到的。

形式化表达:,即 action → 改变 state → 影响未来 reward。

闭环训练解决的 3 个「不可替代问题」

① 长期规划 ② 多智能体博弈 ③ 真实鲁棒性
无闭环:horizon > 2 基本失效 无闭环:其他车是「录像」 无闭环:永远在「看起来安全」的轨迹上
有闭环:policy 能自然学到 有闭环:我的 aggressive → 他 brake 有闭环:错一次→进入新状态→学会恢复
🔴 自动驾驶中 90% 的「人类直觉行为」属于这类 🔴 社会性驾驶 = 闭环本质 🔴 工业界最关心:「犯错后怎么办」

三、伪开环训练(Pseudo-Open-Loop)

直观理解

  • 环境是「录像带」:场景固定,交通参与者按预设轨迹运动

  • Agent 在每一步看到状态、选择动作、计算奖励

  • 下一状态不受 Agent 动作影响(仍是录像的下一条)

🔴 Pseudo = 静态环境(Pseudo)+ 动作不影响环境(Open-Loop)

原理(4 步)

  1. 状态来自固定轨迹(非环境反馈)

  2. Agent 选择动作

  3. 奖励函数打分

  4. 下一状态不受影响(仍是录像)

训练的 RL 是「半闭环半开环」:能评分动作,但不能学到真实反馈策略调节能力。
⚠️ 特点:训练数据可控 → 可以安全训练;但不是真正的闭环 RL → 策略对环境变化不鲁棒。


四、IDM:智能驾驶员模型

IDM(Intelligent Driver Model)是经典的基于物理+规则的驾驶员模型,用于描述车辆纵向行为(跟车、刹停、巡航)。

不管:横向换道(那是 MOBIL)、博弈/情绪、意图推理。

IDM 核心公式(加速度模型)

三项组成:自由加速项 (想开多快)+ 跟车减速项 (怕追尾)+ 动态安全距离 s*

公式拆解

① 自由加速项(想开多快)

  • v₀:期望速度

  • v:当前速度

  • 💡 没人挡我,我就奔着期望速度去

② 跟车减速项(怕追尾)

  • s:当前车距

  • s*:安全期望车距

  • 💡 离前车越近,刹得越狠

③ 动态安全距离 s*

  • s₀:最小静止距离

  • vT:速度相关的跟车距离

  • Δv:相对速度(我比前车快多少)

  • b:舒适减速度

  • 💡 前车突然慢,我就拉大距离

IDM 参数含义与调参影响

参数 含义 调大会怎样 典型场景
v₀ 期望速度 更激进 高速巡航
T 期望时距 更保守 安全跟车
a_max 最大加速 起步猛 激进驾驶
b 舒适减速 刹得狠 紧急制动
s₀ 最小间距 贴得近 密集车流

IDM 实际部署方法

  1. 作为 Traffic Vehicle 的纵向控制器(最基础):IDM 实例 + 仿真 step 更新 + 输入(前车速度/距离、当前速度)→ 输出加速度 a

  2. IDM + 规则触发(Rule-based Augmentation):补丁 Emergency Brake / Hard Yield / Gap Reject 等规则,弥补 IDM 不抢道、不对付、不紧急制动的不足

  3. 🔴 IDM 作为 RL 闭环训练的「环境代理」:Ego 用 RL,其他车用 IDM,Ego 行为影响 IDM 输入 → 形成闭环

IDM 算法变种

变种 特点 / 用途
IIDM(推荐) 改善加减速平滑性,消除 cruise 阶段不合理强减速
**IDM+**​ 工程增强版:加速度/jerk 限幅、紧急刹车阈值、参数 clamp、数值稳定
FVDM 速度差驱动,不仅看距离也强烈依赖速度差
E-IDM 增强交互 / 紧急行为
HDM 人类驾驶特性建模
Stochastic IDM 参数或输出加噪声,Domain randomization,防止 RL overfit
Multi-anticipative IDM 多前车预测,考虑更宽视野
Social Force / Game IDM 社会力 / 博弈建模,处理交互场景

FVDM 对比 IDM

FVDM(Full Velocity Difference Model)核心思想:不仅看距离, 也强烈依赖速度差

维度 IDM FVDM
主动 偏被动跟车 更主动响应速度差
反应 对距离敏感 对速度差敏感
稳定性 稳定但保守 更灵活但需调参
适合场景 高速公路巡航 城市复杂交互

随机 IDM

做法:在参数上加噪声或在输出上加噪声。用途:Domain randomization、防止 RL overfit。


五、IDM 优缺点总结

✅ 优点 ❌ 缺点
稳定性极强(最大优势):连续加速度模型,不易数值发散,长时间仿真不炸 → 非常适合大规模仿真 & RL 闭环初期 行为过度理性,缺乏博弈:永远让行、不反击、不抢行 → RL 会学会「欺负世界」
物理合理、可解释:基于车距、速度、相对速度,参数含义清晰 → debug 友好,安全团队能理解 确定性强,易被 exploit:相同状态→相同行为、无随机性 → RL/Planner 容易过拟合
计算代价极低:O(1) 计算,可百万级 vehicle 并行 → 吞吐量是学习模型无法比的 无意图建模:不理解对方要并道,只被动响应距离变化 → 复杂交互场景失真
参数可控,易构造场景:改参数=改驾驶风格 → 仿真&测试极其友好
工程成熟,生态完善:SUMO / CARLA / LGSVL 原生支持

=============================================

相关推荐
冬奇Lab1 小时前
代码库知识库系列(06):把调用图编码进 Embedding——结构增强有效,但不够
人工智能
冬奇Lab2 小时前
开源项目第175期:Buzz — Jack Dorsey 的 Block 用 Nostr 重新定义团队协作,AI Agent 拥有自己的加密身份
人工智能·开源·资讯
AI分享猿2 小时前
游戏原画与建筑灵感:AI图像生成如何服务前期设计
人工智能·游戏
字节跳动视频云技术团队2 小时前
为什么 AI 视频,需要“懂生成”的画质增强
人工智能
后端小肥肠3 小时前
我做了个能一键搭建个人工作台的 Skill,已开源
人工智能·aigc·agent
码云之上3 小时前
AI Agent 工程化总览篇:从 Prompt 到 Harness
前端·人工智能
2501_926978333 小时前
以说明书 DNA 为模板——完整 AGI 的结构图景
前端·人工智能·经验分享·笔记·ai写作
IT_陈寒3 小时前
Vite静态资源引用这个坑我踩得有点疼
前端·人工智能·后端
天天爱吃肉82183 小时前
商用车多体动力学实战笔记|第6篇:动力传动系统(发动机、变速箱、分动器、TCS、LSD限滑差速)
大数据·人工智能·笔记·python·嵌入式硬件·汽车