Representation + IL: Policy Contrastive Imitation Learning

ICML 2023
paper

采用对比学习对状态动作联合表征,并基于表征函数实现奖励函数重构

method

对比学习目标函数如下:

问题:最小化该损失函数,第一项少了一个负号

得到表征函数 Φ \Phi Φ,通过计算真是样本与专家样本在表征后的余弦相似度,作为奖励函数(表征越相似,奖励越大):

实践中,由于 Φ 频繁更新,计算期望值可能会很耗时。因此使用随机专家样本来计算奖励。最后基于DrQ-v2算法训练策略

结果

基于表征的奖励函数对比GAIL:

相关推荐
aneasystone本尊1 分钟前
学习大模型推理的采样策略
人工智能
橘子汽水1682 分钟前
Leetcode 208,207实现Trie前缀树,课程表
java·数据结构·算法·leetcode
IT_陈寒4 分钟前
SpringBoot自动配置失效时我差点把电脑扔了
前端·人工智能·后端
hanlin036 分钟前
刷题笔记:力扣第169题-多数元素
笔记·算法·leetcode
张小姐的猫7 分钟前
【AI大模型接入SDK】 —— Ollama本地接入Deepseek
java·linux·开发语言·网络·c++·人工智能
美林数据Tempodata8 分钟前
从“开得起来“到“开得下去“:高校AI通识课建设的系统性解法与4E/4S双轨框架拆解
人工智能·产教融合·ai教育·教育改革·通识教育
m0_6145235510 分钟前
平面跟踪为什么中途漂移:按首次异常帧建立排查记录
人工智能·平面·视频编辑
深度学习lover11 分钟前
<数据集>番茄叶片病害识别<目标检测>
人工智能·yolo·目标检测·计算机视觉·数据集·番茄叶片病害识别
hfywmsj13 分钟前
广州餐饮铺位招租数据建模:基于多维评估体系的选址算法设计与实现
人工智能·算法·广州餐饮铺位招租