PPO和GRPO面经

这个写的不错,记录一下

相关推荐
夫唯不争,故无尤也17 小时前
RL强化学习常见问题
强化学习·rl
深圳市爱派派智能科技有限公司18 小时前
从英伟达 GPU 到 RK3566 实机:Microduck 25 厘米强化学习机器人部署手记
机器人·边缘计算·强化学习·rk3566·机器人英伟达
爱听歌的周童鞋20 小时前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 3 | Part 1 | 贝尔曼最优公式(例子-如何改进策略)
强化学习·贝尔曼最优公式·optimal policy·action value
爱听歌的周童鞋1 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 3 | Part 2 | 贝尔曼最优公式(最优策略和公式推导)
强化学习·贝尔曼最优公式·optimal policy·action value·maximization
夫唯不争,故无尤也2 天前
On-Policy Distillation(OPD)和reinforcement (RL)结合
llm·agent·强化学习·rl·opd
夫唯不争,故无尤也2 天前
Agentic Search + RL :打通从RL原理到实际训练全流程
人工智能·深度学习·机器学习·强化学习·rl
云和数据.ChenGuang3 天前
git revert回退问题
java·服务器·人工智能·git·fastapi·强化学习
魔术师Grace3 天前
Agent总出错,什么时候才该训练模型?
llm·agent·强化学习
爱听歌的周童鞋4 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 2 | Part 4 | 贝尔曼公式(公式向量形式与求解)
强化学习·贝尔曼公式·matrix-vector·closed-form·iterative
海天一色y4 天前
强化学习工具函数详解:从经验回放到优势函数计算
人工智能·python·强化学习