机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
明朝百晓生1 分钟前
Deep RL learning[2026/8]
开发语言·javascript·人工智能
具身智能进化论20 分钟前
国产协作机器人品牌如何选择,企业长期使用更看重什么
大数据·人工智能·机器人·工厂方法模式
AKAMAI20 分钟前
2026年Gartner Peer Insights 边缘分布平台客户之声将Akamai评为客户之选
人工智能·云计算
pjj1985435 分钟前
opencv-轮廓特征和轮廓近似
人工智能·opencv·计算机视觉
大金SEO1 小时前
GEO优化资源配置:起步阶段的人力和时间投入预估
人工智能
其美杰布-富贵-李1 小时前
08 进阶评估指标与算法特定指标
人工智能·算法
2601_950760791 小时前
Caspase-3/7在肠道炎症与肿瘤中的双重功能及其高灵敏度检测应用
人工智能·蛋白
IvorySQL1 小时前
PostgreSQL 日报|PG18.5 回归测试崩溃问题(8 月 12 日)
大数据·数据库·人工智能·postgresql
泰迪智能科技011 小时前
职业技术证书推荐:机器学习工程师证书
人工智能·机器学习
冬奇Lab1 小时前
企业知识库系列(01):为什么 RAG 只是起点
人工智能