机器学习——PPO补充

On-policy vs Off-policy

  • 今天跟环境互动,并学习是on-policy

  • 只是在旁边看,就是Off-policy

  • 从p中选q个重要的,需要加一个weight p(x)/q(x)

  • p和q不能相差太多

  • 采样数太少导致分布差很多,导致weight发生变化

On-Policy -> Off-Policy


得到新的loss函数

PPO

  • 衡量 θ \theta θ和 θ ′ \theta' θ′之间的kl散度,衡量二者行为上的相似性,而不是参数上的相似性
  • Adaptive KL Penalty
  • 绿色的线是第一项,蓝色是第二项
相关推荐
秦先生在广东几秒前
gstack 深度解析:AI 驱动的单人虚拟工程团队与端到端自动化
人工智能
Yyyyyy~1 分钟前
【Anaconda】安装
人工智能·python
golang学习记3 分钟前
VSCode AI新特性:HydraFusion来了:系统会自己组队干活
ide·人工智能·vscode
EatFan7 分钟前
从“框架混战“到“运行时收敛“:2026 年 AI Agent 开发框架的三条路线之争
java·数据库·人工智能·多智能体·ai agent·mcp·agent 框架
秦先生在广东11 分钟前
解析 Marketingskills 项目:构建 AI 代理营销技能库的技术与实践
人工智能
秦先生在广东12 分钟前
标准化技能栈的跨框架移植与路由机制解析
人工智能
xianghongtao011622 分钟前
麦肯锡2026技术趋势03_科学发现与工程AI_研究解读
大数据·人工智能
能源革命29 分钟前
AI 日报 · 2026-10-04
人工智能
远方的狮1 小时前
机器人越来越多以后,谁来把它们组织起来?
人工智能
IT_陈寒1 小时前
Vite静态资源导入这个坑我帮你们踩过了
前端·人工智能·后端