COVLM-RL:利用VLM引导强化学习实现自动驾驶的关键面向对象推理

端到端自动驾驶框架在泛化能力、训练效率和可解释性方面长期面临挑战。

现有方法虽利用视觉语言模型通过大规模数据集监督学习来提升推理能力,但在新场景中往往缺乏鲁棒性;而基于强化学习的方法虽增强了适应性,却存在数据效率低下和决策过程不透明的问题。

为突破这些局限,我们提出COVLM-RL------一种融合关键对象导向推理与视觉语言模型引导强化学习的新型端到端驾驶框架。

具体而言,我们设计了一种思维链提示策略,使视觉语言模型能够对关键交通要素进行推理并生成高层次语义决策,从而将多视角视觉输入有效转化为结构化语义决策先验。

这些先验知识能降低输入维度,并将任务相关知识注入强化学习循环,从而加速训练并提升策略可解释性。然而,如何将高层次语义指导与连续的低层次控制相结合仍具挑战。

为此,我们引入一致性损失函数,促使视觉语言模型的语义规划与强化学习智能体的控制输出保持对齐,以此增强可解释性与训练稳定性。

在CARLA模拟器中进行的实验表明,COVLM-RL在已训练驾驶环境中的成功率提升30%,在未遇见过的新环境中成功率提升50%,显著体现了其强大的泛化能力。

相关推荐
TMT星球几秒前
旗舰手机的中场战事:AI为核,影像为王
人工智能·智能手机
霸道流氓气质1 分钟前
AI应用成本优化完全指南:Token压缩、语义缓存与模型路由的Java生产级实战
java·人工智能·缓存
Gu0Qiang2 分钟前
从 0 到 1 打造 AI 提示流编排器:别把大模型当机械拼图!Case #7 字段冻结陷阱与代码回滚复盘(开源系列 15)
人工智能·github
骇客野人2 分钟前
SDD AI-Native(Spec-Driven Development,规约驱动开发,AI 原生研发范式)
人工智能·ai-native
用户547455508123 分钟前
用开源的Toonflow和MiniMax H3一步步复刻万妖
人工智能
RobinDevNotes3 分钟前
JAX 分布式训练,和 PyTorch 有什么不一样
人工智能·深度学习·ajax
奕鼎竜瑆7 分钟前
[新手小白也能学会] 01-PyTorch框架使用(上)
人工智能·pytorch·python
用户8371332007610 分钟前
接口返回文章 ID 后,怎样确认发布真的完成了?
人工智能
Daorigin_com12 分钟前
道本科技携手DeepSeek:以AI重塑合同全生命周期管理
前端·人工智能·科技·网络安全·数据挖掘·前端框架·传媒
guslegend12 分钟前
AutoDebug Agent:用真实反馈做出会修缺陷的 Agent
人工智能