Representation + IL: Policy Contrastive Imitation Learning

ICML 2023
paper

采用对比学习对状态动作联合表征,并基于表征函数实现奖励函数重构

method

对比学习目标函数如下:

问题:最小化该损失函数,第一项少了一个负号

得到表征函数 Φ \Phi Φ,通过计算真是样本与专家样本在表征后的余弦相似度,作为奖励函数(表征越相似,奖励越大):

实践中,由于 Φ 频繁更新,计算期望值可能会很耗时。因此使用随机专家样本来计算奖励。最后基于DrQ-v2算法训练策略

结果

基于表征的奖励函数对比GAIL:

相关推荐
阳明山水3 分钟前
校准分位数驱动智能库存决策
人工智能·深度学习·算法·机器学习·架构
zhangfeng11339 分钟前
ATK(华为算子测试平台)详细介绍 CANN(Compute Architecture for Neural Networks,神经网络计算架构
人工智能·华为·ai编程·npu·cann
吉安特尔雅10 分钟前
业务级招聘自动化落地实践:桌面端 AI 招聘组件的部署、集成与风险管控要点
人工智能·ai招聘哪家靠谱
老王以为11 分钟前
走进 AI Agent 第四篇(上):知识获取管道——RAG 基础
前端·人工智能·全栈
唐璜Taro11 分钟前
Agent Harness 系列 · 第 1 篇|Agent 不只是换一个更强的模型
人工智能·python
海宇大数据21 分钟前
零信任架构实战:基于海宇学历证书核验构建自动化教育资质网关
人工智能·ai·工具分享
xx_xxxxx_24 分钟前
论文阅读-Search-R1
人工智能·深度学习·机器学习·强化学习
代码方舟29 分钟前
零信任架构实战:基于天远二手车VIN估值构建自动化车险承保网关
人工智能·ai·工具分享
灵海之森35 分钟前
大模型时代对话意图识别全景实践:从80个细粒度小类到生产级架构演进
人工智能
jimmyleeee36 分钟前
大模型安全之二十二:AI 安全实践:真实案例研究与经验教训
人工智能·安全