技术栈
agentic-rl
林间码客
5 小时前
sft
·
强化学习
·
grpo
·
agentic-rl
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”
本章将深入探讨Agentic-RL(基于强化学习的智能体训练)这一让智能体实现“自主进化”的关键技术。从LLM训练的基础流程出发,解析监督微调(SFT)与群组相对策略优化(GRPO)的训练流程,对比PPO、DPO、GRPO、RLVR等核心算法的演进逻辑,并介绍HelloAgents框架中Agentic RL的四层架构设计与GSM8K数学推理数据集上的训练实践,帮助读者理解如何通过强化学习让智能体学会推理与工具使用。
我是有底线的