第一章_自动驾驶中的社会交互

第一章:自动驾驶中的"社会交互",到底在研究什么?

阅读论文:Wang et al., Social Interactions for Autonomous Driving: A Review and Perspectives, 2022

我开始读社会交互,是因为后面要看 Q-EANet。Q-EANet 把自己描述成一种"隐式社会建模"方法,还借用了锚定效应这样的认知概念。刚看到这些说法时,它们听起来很合理:车辆会观察周围环境,也会根据过去的运动状态判断接下来该怎么走,所以模型自然也应该学习这种过程。

但这里其实有一个很容易被绕过去的问题:模型把周围车辆的信息放进网络了,就等于它学会社会交互了吗?

这篇综述对我最有用的地方,不是罗列了多少种模型,而是迫使我先把"社会交互"这个词想清楚。否则后面无论读 attention、图网络还是认知模型,都很容易把一种网络结构直接当成一种已经成立的交互机制。

图 1:真正值得研究的并不是两辆车同时出现在道路上,而是它们是否会因为预判对方的动作而调整自己的行为。

1. 同一个场景里有很多车,不代表它们正在交互

轨迹预测的数据里经常同时出现很多交通参与者。最直接的做法,是把目标车附近的车辆、行人和道路信息全部编码,再交给 attention 或图网络处理。这样做当然可能提高预测精度,但"使用了邻居信息"和"建模了社会交互"并不是一回事。

我现在比较认同的判断是:

多个交通参与者同时出现在一个场景中,不代表他们真的发生了交互。

例如,两辆车在相邻车道上以稳定速度向前行驶。它们距离不远,都会被模型收入感受野,但两者可能并没有改变对方的决策。相反,在汇入口、无保护左转或狭窄道路会车时,即使参与者数量很少,一方轻微的加速、减速或犹豫,也可能立刻改变另一方的判断。

因此,交互的关键不是"附近有谁",而是"谁真正影响了谁"。综述引用的定义虽然表述不同,但共同强调了几件事:

  • 至少有两个主体;
  • 主体之间存在信息交换;
  • 一方的动作会进入另一方的决策过程;
  • 这个过程是动态的,后续反应还会继续影响前面的主体。

这里的信息交换也不一定依靠语言、灯光或手势。车辆的速度变化、横向偏移、跟车距离,甚至一段短暂的停顿,本身都可能成为信息。我们看到一辆车在路口逐渐减速,往往会推断它可能准备让行;看到它仍在加速,又会调整自己的判断。这就是驾驶中的隐式沟通。

图 2:左侧虽然有多名道路参与者,但各自运动基本独立;右侧两辆车将进入同一冲突区域,它们必须根据对方的动作不断调整自己。

这个区别对后面的实验很重要。如果数据集没有先区分"普通共现"和"真实交互",模型在总体数据上的提升就很难解释。它可能只是更好地学习了道路结构、常见运动模式或目标车自身的惯性,并不一定真的改善了对交互行为的判断。

2. 社会交互不是单向观察,而是一个不断更新的闭环

自动驾驶系统很容易被描述成一个观察者:它看到周围车辆,然后预测它们接下来会怎么走。但真实交通并不是这么单向。

自动驾驶车辆在观察别人的同时,也会通过自己的动作向别人传递信息。它选择减速,可能让对方认为自己准备让行;它保持速度,对方可能判断它不会退让;它提前向车道边缘移动,也可能暴露下一步的运动意图。所以,一辆车既是信息的接收者,也是信息的发送者。

这个过程大致可以理解为:

  1. 我先观察对方当前的运动;
  2. 根据已有经验,形成对对方意图的判断;
  3. 我选择加速、减速、转向或等待;
  4. 我的动作又成为对方的新信息;
  5. 对方做出反应,我再更新自己的判断。

图 3:观察、判断和行动不是一次完成的。每个主体的动作都会变成另一个主体下一轮判断的输入。

这也是我觉得"社会交互"和一般场景建模之间最明显的差别:一般场景建模可以把环境看成固定条件,而社会交互中的其他主体会对我的行为作出反应。预测对象不是一个被动移动的点,而是一个会观察、判断和调整的行动者。

如果模型只预测"别人会怎么走",却没有考虑自车接下来的规划会怎样改变别人,那么它学到的仍然是一个不完整的交互闭环。当然,纯轨迹预测论文不一定必须解决规划问题,但至少应该意识到这种边界,而不是把单向预测直接说成完整的社会理解。

3. 五类方法,其实是在用不同方式回答同一个问题

这篇综述把常见的社会交互建模方法归纳为五类:效用与博弈模型、深度神经网络、图模型、社会场或风险场,以及计算认知模型。

刚开始看时,这五类很像一个方法目录。但读下来以后,我觉得更合适的理解是:它们不是简单的模型排名,而是从不同角度解释"交互为什么会产生"。

方法 它怎样理解交互 我读的时候最关心什么
效用与博弈模型 每个主体都在权衡收益、代价和他人的反应 收益函数是否真的符合驾驶行为,主体是否真的足够理性
深度神经网络 从大量轨迹数据中学习哪些邻居和历史信息与未来运动有关 性能提升来自交互信息,还是来自更强的拟合能力
图模型 把车辆、行人或道路元素作为节点,把影响关系作为边 图中的边是否代表真实影响,还是只代表空间邻近
社会场与风险场 用空间中的吸引、排斥、风险或压力描述主体之间的作用 场的定义能否覆盖复杂意图,而不只是避免碰撞
计算认知模型 从意图、信念、刺激反应和证据积累等过程解释决策 认知概念有没有被转化成可以计算、可以验证的变量

这五种思路各有价值,但也各有自己的假设。

效用与博弈模型的优点是逻辑清楚。我们能够明确说出主体在优化什么,也能分析一方改变策略后另一方如何响应。但真实驾驶者不一定始终理性,收益函数也很难准确写出来。

深度神经网络和图模型更容易适配真实数据。它们能处理大量主体和复杂场景,也往往在预测指标上表现得更好。问题是,网络学到的相关性不一定等于我们口中的社会机制。尤其是 attention 权重或图上的一条边,看起来很像"谁在关注谁",但它未必足以证明主体之间真的存在可解释的相互影响。

社会场和风险场更接近一种连续的空间表达。哪里危险、哪里拥挤、主体之间存在多强的排斥作用,都可以用场来描述。这类方法对避碰和规划很直观,但面对让行、试探、抢行以及驾驶风格差异时,单纯的吸引和排斥可能还不够。

计算认知模型最吸引人的地方,是它试图解释驾驶者如何形成判断。例如,驾驶者可能不断积累证据,推断对方是否准备通过路口,达到某个阈值后再采取行动。这种解释更接近人的决策过程。不过,认知模型常见的困难也很明显:做得太细,很难满足实时计算;做得太简单,又容易只在实验室任务中成立。

所以我不太想把这五类方法理解成"哪一类最好"。更值得问的是:我们到底假设交互来自什么,又准备怎样用实验验证这个假设?

4. 预测得更准,不等于真正理解了社会交互

这是整篇综述里我最想记住的一点。

轨迹预测通常使用 ADE、FDE、Miss Rate 等指标。简单说,它们主要检查预测轨迹和真实轨迹之间的距离。指标变好,能够说明模型输出更接近数据中的真实未来,这是非常重要的结果。

但我认为:

预测误差更低,只能直接说明预测结果更接近标注;它并不自动证明模型学到的相互影响符合真实的社会行为。

一个模型完全可能依靠地图、车道方向和目标车自身的历史惯性获得更低误差。在大量普通直行场景中,这些信息本来就足以得到不错的结果。即使加入邻居模块后总体 ADE 又下降了一点,也仍然不能马上断言社会交互建模更有效。

如果真的要支持这个结论,至少还需要进一步回答:

  • 提升是否主要出现在确实存在交互的场景?
  • 去掉关键邻居以后,预测是否按照合理方向变化?
  • 模型能否区分物理约束与社会影响?
  • 在让行、汇入、抢行、博弈或罕见行为中,模型是否仍然稳定?
  • 预测的改善能否进一步传递到规划安全性和效率?

这些问题不一定都能在一篇论文中解决。但作者至少应该让"提出的交互机制"和"用于证明它的证据"彼此对应。

这也解释了为什么我不希望把 attention 直接翻译成"模型理解了谁更重要"。Attention 首先是一种信息聚合机制。它可以非常有用,却不天然等于人的注意过程;同样,一个模块借用了心理学或认知科学中的名称,也不代表那个认知机制已经被模型实现。

认知概念要真正进入模型,至少应该说清楚四件事:模型观察到了什么,假设了哪些内部状态,如何完成计算,以及实验怎样区分"这个机制成立"和"只是网络容量变大了"。

5. 再回头看 Q-EANet,问题会清楚很多

读完这篇综述以后,再看 Q-EANet 的"隐式社会建模"和"锚定效应",我不会立刻否定这些说法,但也不会只看命名就接受它们。

Q-EANet 的主要想法是:交通参与者先根据自身历史形成一个初始判断,再围绕这个"锚点"查询环境和其他主体的信息,最后生成多条可能轨迹。这个叙事能够把 target encoding、anchor-based query、attention 和多模态预测串起来,工程结构也比较清楚。

但这里仍然要分开看两层贡献。

第一层是工程贡献:这种 query 组织方式是否有效,能不能提高预测性能,模块是否易于复现和替换。这些可以通过主实验、消融和复现来判断。

第二层是解释性主张:模型是否真的对应了人的锚定效应,是否因此更好地理解社会交互。这一层需要更直接的证据。仅仅发现 anchor-based query 比 anchor-free query 好一点,还不能排除额外参数、模态槽位或第二轮 attention 带来的影响。

同样,论文使用拉普拉斯混合分布,并提到它可能更适合描述 U-turn 等低频轨迹。这个动机与长尾预测很接近,但如果实验没有单独划分罕见行为,也没有报告 tail-specific 指标,那么"改善长尾"仍然应该被当成待验证假设,而不是已经得到证明的结论。

因此,我后面复现 Q-EANet 时真正想检查的,不只是能不能把总体指标跑出来,还包括:

  • 地图信息是否掩盖了社会交互模块的真实贡献;
  • anchor-based query 的提升究竟来自"锚定",还是来自网络结构变化;
  • EA-Block 是否真的建模了有意义的交互差异;
  • 拉普拉斯分布是否改善了罕见轨迹,而不只是总体 best-of-K 指标;
  • 模型在强交互和弱交互场景中的表现是否不同。

这些问题目前都不是已经确定的创新点,而是需要通过复现和消融逐步筛选的假设。

6. 这一章最后留下的理解

如果只用一句话概括这篇综述,我会写:

社会交互不是"场景里有很多主体",而是多个主体通过可观察行为交换信息,并在连续反馈中相互改变决策。

对轨迹预测来说,加入周围车辆、地图或 attention 当然有价值。但我们需要区分三件事:模型使用了多主体信息,模型的预测更准确,以及模型真正学到了社会交互。这三者有关联,却不能直接画等号。

这篇综述也没有替我们选出最好的模型。它更像一张问题地图:先识别什么时候发生了交互,再决定怎样表示这种影响,随后考虑用什么证据验证,最后检查预测改善是否真的服务于安全规划。

我现在对后续工作的理解也更明确了。第一步不是急着提出一个更复杂的新模块,而是先复现一个可以工作的 baseline;然后把普通场景和真正的交互场景分开,把总体指标和长尾表现分开,再判断论文中的模块究竟改善了什么。

只有这样,"社会交互"才不会只是论文标题里的一个好听概念。


参考文献

Wang, W., Wang, L., Zhang, C., Liu, C., & Sun, L. (2022). Social Interactions for Autonomous Driving: A Review and Perspectives. Foundations and Trends in Robotics, 10(3-4), 198-376. https://doi.org/10.1561/2300000078

相关推荐
洛阳泰山1 小时前
别再为做 AI 去学 Python 了!MaxKB4j:纯 Java 造的企业级 RAG + 工作流引擎,开箱即用
人工智能·开源·agent
fthux2 小时前
GitZip Pro:给GitHub仓库“瘦身”的魔法剪刀手
人工智能·chrome·ai·语言模型·开源·github·open source
武子康2 小时前
Video VAE 不是末端编解码器:5 维-潜网格-主模型 Token 的“表示合同“
人工智能·llm·agent
Sunlly2 小时前
Transcript 不是 Context:用五组实验拆解 OpenClaw 的上下文生命周期
人工智能
ttwuai2 小时前
AI 生成后台改数据后,操作日志别只记按钮:Go + MySQL 怎么验
数据库·人工智能·mysql·golang
糖果店的幽灵2 小时前
我用 Codex + Remotion,做了一条唐朝纸片分层动画
人工智能
KaMeidebaby2 小时前
卡梅德生物技术快报 | 核酸适配体文库测序:核酸适配体文库测序的技术原理、实验流程与数据解析
前端·网络·数据库·人工智能·算法
阿里云大数据AI技术2 小时前
AI 时代,零售商超如何用多模态数据"看见"每一排货架?
人工智能
一RTOS一3 小时前
【无标题】
人工智能·鸿道实时操作系统·国产嵌入式操作系统选型·智算控一体