Representation + IL: Policy Contrastive Imitation Learning

ICML 2023
paper

采用对比学习对状态动作联合表征,并基于表征函数实现奖励函数重构

method

对比学习目标函数如下:

问题:最小化该损失函数,第一项少了一个负号

得到表征函数 Φ \Phi Φ,通过计算真是样本与专家样本在表征后的余弦相似度,作为奖励函数(表征越相似,奖励越大):

实践中,由于 Φ 频繁更新,计算期望值可能会很耗时。因此使用随机专家样本来计算奖励。最后基于DrQ-v2算法训练策略

结果

基于表征的奖励函数对比GAIL:

相关推荐
Raas10017 分钟前
AI网关和OpenRouter区别?MAI Gateway(魔芋企业级AI网关)企业级方案对比指南
大数据·开发语言·人工智能·gateway·php·ai网关·mai gateway
zzzzzz31025 分钟前
Claude Code:把 AI 放进终端,真正值得关注的是什么
人工智能·开源·命令行
Raas10028 分钟前
MAI Gateway(魔芋企业级AI网关)技术辨析:AI网关和大模型网关区别?选型必读
大数据·人工智能·大模型·gateway·mai gateway·企业级产品
意图共鸣2 小时前
意图共鸣科技9月7日正式发布《认知智能白皮书2.0:广义具身智能物理宪法》——为一切走进物理世界的AI确立认知底线
人工智能·科技
FII工业富联科技服务7 小时前
Omniverse + Isaac Teleop + 合成数据:工业富联机器人大脑训练+执行落地闭环拆解
大数据·人工智能·深度学习·机器学习·机器人·制造·具身智能
东风破_8 小时前
大模型格式化输出
人工智能
Shockang8 小时前
AI 研究偏好模型
人工智能
ZGIAI8 小时前
律师最贵的不是知识,是时间:哪些工作真的可以先交给 Agent?
人工智能·架构
东风破_8 小时前
讲透 SSE:从流式响应到 LangChain model.stream()
人工智能
phltxy8 小时前
C语言操作符详解
java·c语言·算法