机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
万物智能信息科技6 小时前
PWM散热风扇设置—【万物智能之开源鸿蒙OpenHarmony系统实战开发系列教程】
人工智能·华为·开源·harmonyos·鸿蒙
catcatuncle6 小时前
读了一个开源 AI Agent 的源码后,我重新思考了"文件验收"这件事
人工智能
二川bro6 小时前
Agent安全执行命令:命令分级+Hook+读写锁
人工智能
AI天行健6 小时前
AI视频热缓存命中率89%:无限画布Vera1.1调参方案与数据验证
人工智能·ai
Fang_YuanAI6 小时前
AIGC原生IP到底应该怎么做?
人工智能·ai·aigc·mcn·ai短剧·ip孵化·aigc创作
IamZJT_6 小时前
01|先跑起来:用大模型和一个查询工具处理文字工单
人工智能
星火10246 小时前
【从 0 到 1 动手造 Agent】(组件篇)06、向量库:让 Agent 按「意思」找东西
人工智能·agent
IamZJT_6 小时前
Agent 系统工程 03|工具执行成功但回执丢了,重试还是不重试?
人工智能
IamZJT_6 小时前
拆开 DeepSeek Harness 03|模型已经回答完了,Agent 为什么还没结束?
人工智能
AI创界者6 小时前
【Python进阶】重构经典设计模式:单例、工厂、观察者在现代 Python (3.10+) 中的最佳演进
人工智能·aigc