Representation + IL: Policy Contrastive Imitation Learning

ICML 2023
paper

采用对比学习对状态动作联合表征,并基于表征函数实现奖励函数重构

method

对比学习目标函数如下:

问题:最小化该损失函数,第一项少了一个负号

得到表征函数 Φ \Phi Φ,通过计算真是样本与专家样本在表征后的余弦相似度,作为奖励函数(表征越相似,奖励越大):

实践中,由于 Φ 频繁更新,计算期望值可能会很耗时。因此使用随机专家样本来计算奖励。最后基于DrQ-v2算法训练策略

结果

基于表征的奖励函数对比GAIL:

相关推荐
浩风祭月2 小时前
ChatGPT o3将在8月26日退出:Plus、Pro用户现在该迁移什么
人工智能·chatgpt·openai o3·模型迁移
布列瑟农的星空2 小时前
Milvus内部机制浅入浅出
人工智能·agent
东离与糖宝2 小时前
WorkBuddy记忆机制拆解:别再反复交代需求
人工智能
ZHOU_WUYI2 小时前
7. fastwam 模型 _predict_action_noise_with_cache部分
人工智能·pytorch·深度学习
Sagittarius_A*2 小时前
后量子密码|通识认知 03|量子威胁辟谣:Grover 算法对对称密码的影响与误区
算法·信息安全·密码学·量子计算·pqc·后量子密码
测试者家园2 小时前
AI如何发现测试人员看不到的问题?
人工智能·职场和发展·agent·智能化测试·幻觉检测·行为漂移
WoooChi3 小时前
DailyTech-20260807
人工智能·科技·业界资讯
新知图书3 小时前
12.1 技术文档与表达优化
人工智能·ai助手·千问
华清远见成都中心3 小时前
卷积神经网络(CNN)为什么能够识别图像?
人工智能·深度学习·cnn
派拉软件4 小时前
派拉AIGS应用场景解析:在客户实际环境中,AI Agent如何做到“可控、可管、可审“
大数据·人工智能