机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
2501_930472446 分钟前
实战-腾讯云AI助手逆向导出Terraform-存量资源代码化
人工智能·腾讯云·terraform
小沈同学呀7 分钟前
【Agent开发第七期】记忆系统:让 Agent 跨会话也记得你
人工智能·agent·长期记忆·记忆系统
我有满天星辰9 分钟前
Token 到底是什么?为什么 AI 应用离不开 Token?
人工智能
AI智图坊13 分钟前
甩手图省事的技术原理:如何用“商品锁定”机制解决AI作图的一致性难题
大数据·人工智能·计算机视觉·ai作画·aigc·ai写作
m0_5474866614 分钟前
《深度学习理论及实践》全套PPT课件(北京邮电大学)
人工智能·深度学习
夫唯不争,故无尤也20 分钟前
RL强化学习常见问题
强化学习·rl
V哥AI增长23 分钟前
旅游行业AI搜索机制:从SEM到GEO引用源迁移实证
人工智能·旅游
Bruce_Liuxiaowei25 分钟前
驴滑块拼图游戏:从19世纪的纸片谜题到数学博弈论
人工智能·算法
MartinYeung528 分钟前
[论文学习]MAC:多智能体宪章学习
人工智能·学习·macos
hopsky32 分钟前
《大模型应用开发 动手做 AI Agent》核心内容详细解读
人工智能