一、开环训练(Open-Loop Training)
定义
只用历史数据(静态数据集 )学习策略,训练过程中不能与环境交互。
数据集 D = {(s, a, r, s')},由未知行为策略(human / rule / old policy)产生。
关键特征
-
数据分布不随 policy 改变
-
训练过程无实时反馈
-
类似 supervised learning
开环 vs 闭环
| 开环 | 闭环 |
|---|---|
| Fixed Dataset / Fixed Env → Train Policy | Policy → Env → New Data → Update Policy |
工程上大量使用的原因
-
✅ 安全:不探索,不会触发危险行为
-
✅ 稳定:可复现,同一数据多次复现
-
✅ 成本低:复用日志数据
核心问题
🔴 如何在「看不到真实环境反馈」的情况下,学一个不会乱来的 policy?
开环训练的优劣势
| ✅ 优势 | ❌ 劣势 | 🚗 自动驾驶能/不能解决 |
|---|---|---|
| 可控、稳定、可调试 | 分布外问题(OOD)------致命缺陷 | ✅ 模仿人类策略 |
| 同一数据,多次复现 | RL 学到的最优动作,数据里可能根本不存在 | ✅ 平滑行为 |
| Reward / loss 可对比 | Coverage 决定上限:长尾无解 | ✅ 风格偏好学习 |
| 易于 ablation study | 无法纠正自身错误:学错一次→无反馈→永久错 | ❌ 新场景泛化 |
| 符合安全要求 | ❌ 交互博弈 | |
| 无在线探索,合规友好 | ❌ Corner case |
⚠️ 核心矛盾:开环训练数据可控、安全、低成本,但分布外泛化能力弱,无法处理未覆盖状态和交互博弈。
二、闭环训练(Closed-Loop Training)
策略能学到 「我现在的动作,会如何改变未来世界」------这是开环训练做不到的。
形式化表达:
,即 action → 改变 state → 影响未来 reward。
闭环训练解决的 3 个「不可替代问题」
| ① 长期规划 | ② 多智能体博弈 | ③ 真实鲁棒性 |
|---|---|---|
| 无闭环:horizon > 2 基本失效 | 无闭环:其他车是「录像」 | 无闭环:永远在「看起来安全」的轨迹上 |
| 有闭环:policy 能自然学到 | 有闭环:我的 aggressive → 他 brake | 有闭环:错一次→进入新状态→学会恢复 |
| 🔴 自动驾驶中 90% 的「人类直觉行为」属于这类 | 🔴 社会性驾驶 = 闭环本质 | 🔴 工业界最关心:「犯错后怎么办」 |
三、伪开环训练(Pseudo-Open-Loop)
直观理解
-
环境是「录像带」:场景固定,交通参与者按预设轨迹运动
-
Agent 在每一步看到状态、选择动作、计算奖励
-
但下一状态不受 Agent 动作影响(仍是录像的下一条)
🔴 Pseudo = 静态环境(Pseudo)+ 动作不影响环境(Open-Loop)
原理(4 步)
-
状态来自固定轨迹(非环境反馈)
-
Agent 选择动作
-
奖励函数打分
-
下一状态不受影响(仍是录像)
训练的 RL 是「半闭环半开环」:能评分动作,但不能学到真实反馈策略调节能力。
⚠️ 特点:训练数据可控 → 可以安全训练;但不是真正的闭环 RL → 策略对环境变化不鲁棒。
四、IDM:智能驾驶员模型
IDM(Intelligent Driver Model)是经典的基于物理+规则的驾驶员模型,用于描述车辆纵向行为(跟车、刹停、巡航)。
不管:横向换道(那是 MOBIL)、博弈/情绪、意图推理。
IDM 核心公式(加速度模型)

三项组成:自由加速项 (想开多快)+ 跟车减速项 (怕追尾)+ 动态安全距离 s*
公式拆解
① 自由加速项(想开多快)

-
v₀:期望速度
-
v:当前速度
-
💡 没人挡我,我就奔着期望速度去
② 跟车减速项(怕追尾)

-
s:当前车距
-
s*:安全期望车距
-
💡 离前车越近,刹得越狠
③ 动态安全距离 s*

-
s₀:最小静止距离
-
vT:速度相关的跟车距离
-
Δv:相对速度(我比前车快多少)
-
b:舒适减速度
-
💡 前车突然慢,我就拉大距离
IDM 参数含义与调参影响
| 参数 | 含义 | 调大会怎样 | 典型场景 |
|---|---|---|---|
| v₀ | 期望速度 | 更激进 | 高速巡航 |
| T | 期望时距 | 更保守 | 安全跟车 |
| a_max | 最大加速 | 起步猛 | 激进驾驶 |
| b | 舒适减速 | 刹得狠 | 紧急制动 |
| s₀ | 最小间距 | 贴得近 | 密集车流 |
IDM 实际部署方法
-
作为 Traffic Vehicle 的纵向控制器(最基础):IDM 实例 + 仿真 step 更新 + 输入(前车速度/距离、当前速度)→ 输出加速度 a
-
IDM + 规则触发(Rule-based Augmentation):补丁 Emergency Brake / Hard Yield / Gap Reject 等规则,弥补 IDM 不抢道、不对付、不紧急制动的不足
-
🔴 IDM 作为 RL 闭环训练的「环境代理」:Ego 用 RL,其他车用 IDM,Ego 行为影响 IDM 输入 → 形成闭环
IDM 算法变种
| 变种 | 特点 / 用途 |
|---|---|
| IIDM(推荐) | 改善加减速平滑性,消除 cruise 阶段不合理强减速 |
| **IDM+** | 工程增强版:加速度/jerk 限幅、紧急刹车阈值、参数 clamp、数值稳定 |
| FVDM | 速度差驱动,不仅看距离也强烈依赖速度差 |
| E-IDM | 增强交互 / 紧急行为 |
| HDM | 人类驾驶特性建模 |
| Stochastic IDM | 参数或输出加噪声,Domain randomization,防止 RL overfit |
| Multi-anticipative IDM | 多前车预测,考虑更宽视野 |
| Social Force / Game IDM | 社会力 / 博弈建模,处理交互场景 |
FVDM 对比 IDM
FVDM(Full Velocity Difference Model)核心思想:不仅看距离, 也强烈依赖速度差

| 维度 | IDM | FVDM |
|---|---|---|
| 主动 | 偏被动跟车 | 更主动响应速度差 |
| 反应 | 对距离敏感 | 对速度差敏感 |
| 稳定性 | 稳定但保守 | 更灵活但需调参 |
| 适合场景 | 高速公路巡航 | 城市复杂交互 |
随机 IDM

做法:在参数上加噪声或在输出上加噪声。用途:Domain randomization、防止 RL overfit。
五、IDM 优缺点总结
| ✅ 优点 | ❌ 缺点 |
|---|---|
| 稳定性极强(最大优势):连续加速度模型,不易数值发散,长时间仿真不炸 → 非常适合大规模仿真 & RL 闭环初期 | 行为过度理性,缺乏博弈:永远让行、不反击、不抢行 → RL 会学会「欺负世界」 |
| 物理合理、可解释:基于车距、速度、相对速度,参数含义清晰 → debug 友好,安全团队能理解 | 确定性强,易被 exploit:相同状态→相同行为、无随机性 → RL/Planner 容易过拟合 |
| 计算代价极低:O(1) 计算,可百万级 vehicle 并行 → 吞吐量是学习模型无法比的 | 无意图建模:不理解对方要并道,只被动响应距离变化 → 复杂交互场景失真 |
| 参数可控,易构造场景:改参数=改驾驶风格 → 仿真&测试极其友好 | |
| 工程成熟,生态完善:SUMO / CARLA / LGSVL 原生支持 |
=============================================










