机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
曲鸟几秒前
体验完鸿蒙AI后的几点感受
人工智能·华为·harmonyos
新知图书4 分钟前
6.3 美食烹饪
人工智能·提示词·美食·提示词工程
IT古董5 分钟前
《FDE前沿部署工程师实战教程》27 - Enterprise AI Gateway实战:统一路由、限流、降级与成本控制
人工智能
云安全助手9 分钟前
自建接入VS聚合平台:企业 AI 调用的选型思路与迁移成本拆解
java·大数据·数据库·人工智能·ai大模型
小小张说故事9 分钟前
SHAP 可解释性入门:模型为什么这么判?Python 实战 + 4 个最常见的误读
后端·python·机器学习
Gu_WenYun11 分钟前
从全面普涨到双轨分化,如何用基金布局存储芯片?
大数据·人工智能·业界资讯
skywalk816313 分钟前
deepseekharness在对话中,有四种模式,分别是极简、PTC、创造和标准模式,每种模式下挂载的插件、skill等数量不一样
前端·人工智能·实践
richard_yuu18 分钟前
Hopfield 网络:联想记忆的「鼻祖」,为什么它能「回忆」?
深度学习·神经网络·yolo·机器学习
陈工大模型19 分钟前
GEO监测工具技术选型:2026年9月AI可见性十强评测
大数据·人工智能·科技
bing.shao20 分钟前
当模型也会越狱:英伟达 Open Agent Safety Platform 与「双层带外」全栈智能体安全架构深度解析
人工智能·安全·安全架构