机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
也非非也25 分钟前
免费用户第一次拿到“思考“按钮:OpenAI用一次更新,重新定义了AI的“基础版“
人工智能·chatgpt
ms365copilot30 分钟前
想开店?用Copilot研究助手快速做完项目可行性评估
人工智能·copilot
器灵科技44 分钟前
Seedance2.5 VS MiniMax H3 同日上线:AI短剧创作者该怎么选?
java·人工智能·阿里云·prompt·aigc
关于作业的二三事1 小时前
图像处理技术(图像围绕中心旋转)
图像处理·人工智能·opencv
weixin_446260851 小时前
我们该打字还是语音与LLM智能体交互?——语音与键盘输入扰动全面研究
人工智能
≮傷£≯√1 小时前
opencv 图片缩放旋转
人工智能·opencv·计算机视觉
wangxin2081 小时前
别让模型猜:语言解压——把压缩的关系与言外之意变成可计算的分叉
人工智能·多智能体·大模型训练·语言学·coordclaw·语义解压
2501_909509101 小时前
DAY 41 从 MLP 到 CNN 的进化之路
人工智能·神经网络·cnn
武子康1 小时前
从生成一张图到交付一套资产:怎样验收 AI 图片的连续可编辑性
人工智能·llm·agent
爱吃土豆的马铃薯ㅤㅤㅤㅤㅤㅤㅤㅤㅤ2 小时前
Spring‑AI Document 对象 JSON 字段详解
人工智能·spring·json