机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
Canace8 小时前
用 AI 写了一天代码,为什么反而更累了?
前端·人工智能·ai编程
动物园猫8 小时前
课堂行为目标检测数据集:6类别、2,000张图像 | 目标检测
人工智能·目标检测·计算机视觉
半兽先生8 小时前
MinerU + LibreOffice 混合架构:搞定 .doc/.ppt 旧格式文档解析与切片
人工智能·python·机器学习·ai·架构
崖边看雾8 小时前
机器学习——K-Means(啤酒数据集挖掘)
人工智能·机器学习·kmeans
听你说328 小时前
常青课堂同步HR系统考勤休假二百余项升级 万古科技智能排班系统赋能用户精细化用工
大数据·人工智能·科技
小趴蔡ha8 小时前
03 NumPy 入门:机器学习中的数组和矩阵
python·线性代数·机器学习·numpy
小白说大模型8 小时前
从0开始学计算机网络:HTTP 协议的进化史
人工智能·网络协议·计算机网络·http
triplemeng8 小时前
AI正在改变“真实”的含义:从《黑客帝国》、鲍德里亚到生成式人工智能
人工智能·深度学习·神经网络·生成式·黑客帝国·鲍德里亚·后真相
创世宇图8 小时前
从 Cantus 看 AI Coding 新趋势:当模型不再追求“通用榜单第一”
人工智能
bittersuite8 小时前
文本预处理,语言模型
人工智能·深度学习·机器学习