机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
LaughingZhu几秒前
Product Hunt 每日热榜 | 2026-08-03
人工智能·经验分享·深度学习·神经网络·产品运营
大龄码农有梦想1 分钟前
AI Agent 目前最大的瓶颈是什么?
人工智能·机器学习·ai agent·智能体·ai工作流·智能体平台
m4Rk_6 分钟前
【论文阅读】Agent 记忆机制(28):MEM1——将记忆压缩融入推理,实现近似恒定上下文的长程智能体
论文阅读·人工智能·学习·开源·github
光锥智能8 分钟前
荣耀将阿莱电影工作流融入机器人手机
人工智能·智能手机·机器人
云端漫步19879 分钟前
HarmonyOS NEXT AI 智能生活助手:创建企业级 AI 工程与目录结构
人工智能·生活·harmonyos
2501_9467361620 分钟前
在线考试平台如何选型?从功能、优势与应用场景角度详解
大数据·人工智能·算法
厚皮龙25 分钟前
OpenCV 版本导致 AprilTag 检测数量不同
人工智能·opencv·webpack
SomeB1oody28 分钟前
【RustyML入门】2.0. 经典机器学习
开发语言·后端·机器学习·rust·教程
苦猿的大模型日记30 分钟前
Day44|Agent 可观测性与调试:它没报错,但它做错了
人工智能
天辛大师36 分钟前
天心大师:不确定中锚定自我,AI生活的哲学命题
人工智能·算法·决策树·机器学习·生活·启发式算法