机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
武子康几秒前
一次 Agent 失败后,到底该改模型、Prompt 还是 Router?
人工智能·llm·agent
小K讲AI营销几秒前
固态电池战局拆解:机器人为何先于汽车吃到红利
大数据·人工智能·区块链
beiju几秒前
别急着埋 SaaS:Agent 时代真正被压缩的是人工胶水层
人工智能
让学习成为一种生活方式1 分钟前
黄花蒿LHC基因家族的串联重复驱动扩张及其UV-B胁迫适应性--BMC Plant Biology
人工智能·算法·机器学习
小小测试开发2 分钟前
RAG应用评测:从指标体系到LLM-as-a-Judge的自动化落地
android·运维·人工智能·自动化
神经星星3 分钟前
「TVM教程」理解 Relax 抽象层
人工智能·深度学习
阿拉斯攀登7 分钟前
垂钓助手-四种漂相识别:下顿顶漂黑漂点漂的状态机设计
人工智能
ECT-OS-JiuHuaShan9 分钟前
共轭互逆链路论,彻底打击庸俗辩证法和不可知论
数据库·人工智能·算法·机器学习·数学建模
m4Rk_11 分钟前
【论文阅读】Agent 记忆机制(52):Cognitive Scaffold——面向 DeepResearch Agent 的结晶化记忆框架
论文阅读·人工智能·学习·开源·github
薛定e的猫咪11 分钟前
【大模型量化】使用 llama.cpp 完成量化、本地推理与服务化部署
人工智能·深度学习·算法·llama