机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
晚风醉蝶几秒前
DeepSeek 大模型落地应用与场景实践指南
大数据·人工智能
武子康23 分钟前
把生产 Agent 事故 Trace 变成可重放的回归测试集
人工智能·llm·agent
xierui12312329 分钟前
Midjourney V8.2Edit 更新:如何设计可编辑、可追溯的 AI图片生产流水线
人工智能·midjourney
9000AI38 分钟前
AI真正重构的,是企业市场能力的生产关系:9000AI创始人李家旺谈组织智能、关键结果节点与流量产能
人工智能
心易行者39 分钟前
从零搭建完整Web应用:7步走完全流程,配合web应用托管零门槛上线
人工智能·python·ai编程
一个处女座的程序猿1 小时前
Agent之Human-Agent Teaming:Cumora(面向人类与 AI Agent 协作的聊天应用)的简介、安装和使用方法、案例应用之详细攻略
人工智能·agent·cumora
β添砖java1 小时前
深度学习26转置卷积
人工智能·深度学习
小柯南敲键盘1 小时前
跨境电商图片翻译工具,批量处理视频字幕与抠图
人工智能·python·音视频
Mr数据杨1 小时前
结构化数据价格预测实战入门 从 Kaggle 回归赛题理解建模与落地
人工智能·数据分析·kaggle竞赛
JoannaJuanCV1 小时前
VLM学习-SFT(监督微调)
深度学习·学习·机器学习·大模型·视觉大模型·vlm·视觉编码器