Representation + IL: Policy Contrastive Imitation Learning

ICML 2023
paper

采用对比学习对状态动作联合表征,并基于表征函数实现奖励函数重构

method

对比学习目标函数如下:

问题:最小化该损失函数,第一项少了一个负号

得到表征函数 Φ \Phi Φ,通过计算真是样本与专家样本在表征后的余弦相似度,作为奖励函数(表征越相似,奖励越大):

实践中,由于 Φ 频繁更新,计算期望值可能会很耗时。因此使用随机专家样本来计算奖励。最后基于DrQ-v2算法训练策略

结果

基于表征的奖励函数对比GAIL:

相关推荐
sarasuki2 分钟前
上下文快爆炸了?Agent 的两种压缩手段:微压缩 vs LLM 摘要
人工智能·ai编程
林浩杨_5 分钟前
中科大 × NUS × 美团提出Pigeon:个性化图像生成
论文阅读·人工智能
6Hzlia6 分钟前
【Classic 150 刷题计划】 LeetCode 274. H 指数 | C++ 二分答案法 (单调性降维打击)
c++·算法·leetcode
长谷深风11110 分钟前
AI自动化中的关键闸门:何时必须人工审批?
大数据·人工智能·ai·自动化·ai agent·智能体·hitl
深蓝AI11 分钟前
9B开源干翻30B:NeoHorse-1实测tau²-Bench 90.82,4B消费级显卡可跑
人工智能
TonyLee01711 分钟前
扩散模型初探(二)
人工智能·扩散模型
行者全栈架构师12 分钟前
WorkBuddy 实战:50 份简历 30 分钟筛完,还能自动出评估报告
人工智能·算法·微信
狠活科技14 分钟前
GPT Image 2.5 发布:AI 生图又进化了
人工智能·gpt·ai作画·aigc·image2.5
程xu袁18 分钟前
AI写歌词和AI作曲有什么区别?想做完整歌曲,AI音乐工具怎么选?
人工智能
ACME204421 分钟前
破产财产处置新规落地,管理人如何选聘拍卖机构?
人工智能