Representation + IL: Policy Contrastive Imitation Learning

ICML 2023
paper

采用对比学习对状态动作联合表征,并基于表征函数实现奖励函数重构

method

对比学习目标函数如下:

问题:最小化该损失函数,第一项少了一个负号

得到表征函数 Φ \Phi Φ,通过计算真是样本与专家样本在表征后的余弦相似度,作为奖励函数(表征越相似,奖励越大):

实践中,由于 Φ 频繁更新,计算期望值可能会很耗时。因此使用随机专家样本来计算奖励。最后基于DrQ-v2算法训练策略

结果

基于表征的奖励函数对比GAIL:

相关推荐
网易云信9 分钟前
AI 用了两年,我们却成了它的"传话筒"?
人工智能
番茄巴士9 分钟前
手写一个 mini HashMap,彻底搞懂哈希表原理
算法
得物技术13 分钟前
指标平台:从语义底座到智能消费的实践路径|得物技术
数据库·人工智能·ai编程
jsl_jsl_jsl14 分钟前
《桌面端的读写通道:Admin 接口层的设计与安全防线》
人工智能
#卢松松#20 分钟前
用AI做网站,已经到了找BUG阶段了
人工智能·创业创新
ysu_031422 分钟前
PINNs的参数反演——从“正问题”到“逆问题”的工程改造
人工智能·pytorch·深度学习·mcmc·参数反演·逆问题·darcy流
joinwell5222 分钟前
没收到回复,再点一次会启动两个 AI 吗?
人工智能·后端
hzxxxz22 分钟前
2000份投稿里的共性-工具建设可复用的4条原则
人工智能
Bolt23 分钟前
Agent: 将 harness 工程升级到认知工程
人工智能·架构·agent
桃西西呀24 分钟前
限速 30 和限速 80 只差一个数字,卷积网络怎么分得清?
人工智能·深度学习·llm