1. 引言
大语言模型(LLM)的预训练阶段为模型注入了海量的世界知识与语言能力,但要让模型真正成为能够自主规划、调用工具、与环境交互并完成复杂任务的智能体(Agent),仅靠预训练与监督微调(SFT)远远不够。近年来,研究者开始将深度强化学习(Deep Reinforcement Learning,DRL)引入 Agent 的后训练阶段,让模型在与环境交互的试错过程中持续优化策略,从而显著提升其推理、决策与工具使用能力。
本文将从原理、实践与学习路线三个维度,系统梳理深度强化学习在 Agent 后训练中的研究热点,并给出相关的参考文献与开源项目,帮助读者快速建立该方向的知识框架。
2. 原理:为什么用强化学习做 Agent 后训练
2.1 从 SFT 到 RL 的范式转变
监督微调(SFT)的本质是让模型模仿人类标注的"标准答案",其优化目标是最大化给定输入下输出序列的似然。然而,Agent 任务的核心是序贯决策------模型需要在多步交互中根据环境反馈不断调整策略,最终达成目标。SFT 无法直接优化这类长期回报,而强化学习天然适合这一场景:
- 奖励信号:环境(如代码执行器、网页、游戏、API)返回的反馈可作为奖励;
- 探索与利用:模型在训练中主动尝试新策略,而非仅复现标注数据;
- 长期回报:优化的是整条轨迹的累积收益,而非单步的似然。
2.2 核心算法框架
当前 Agent 后训练主要采用以下三类强化学习范式:
(1)策略梯度与 PPO
PPO(Proximal Policy Optimization)是目前最主流的在线强化学习算法。其核心思想是在每次更新时限制策略变化的幅度,保证训练的稳定性。对于 Agent 任务,通常将模型的完整交互轨迹视为一个 episode,奖励由环境反馈(如任务是否成功、代码是否通过测试)构成。
(2)基于偏好的优化:DPO 及其变体
DPO(Direct Preference Optimization)绕过了显式的奖励模型,直接利用偏好对(preference pairs)优化策略。在 Agent 场景中,偏好对可以来自"成功轨迹 vs 失败轨迹"或"人类对多条轨迹的排序"。DPO 训练成本低、稳定性好,特别适合数据规模有限的场景。
(3)可验证奖励与过程监督
对于代码生成、数学推理等可自动验证的任务,研究者倾向于使用可验证奖励 (verifiable rewards),即直接以测试用例是否通过作为奖励信号,避免训练奖励模型带来的偏差。进一步地,过程监督(process supervision)在每一步推理或工具调用后给予细粒度反馈,比仅对最终结果打分更有效。
2.3 关键挑战
- 奖励稀疏:多数 Agent 任务只有最终成功才有正奖励,中间步骤无信号;
- 信用分配:长轨迹中难以判断哪一步决策导致了最终成败;
- 探索效率:动作空间巨大(工具调用、参数组合),随机探索成本高;
- 分布漂移:策略更新后模型输出分布变化,可能导致环境反馈不再稳定。
3. 实践:从零搭建 Agent 强化学习训练流程
3.1 整体流程
一个典型的 Agent 后训练流程包含以下环节:
text
环境构建 → 轨迹采样 → 奖励计算 → 策略更新 → 评估与迭代
3.2 环境构建
环境是强化学习的基石。对于代码 Agent,可使用沙箱执行环境(如 Docker 容器)运行模型生成的代码,并以测试用例通过率作为奖励;对于网页 Agent,可使用浏览器自动化框架模拟真实用户操作。
3.3 轨迹采样与奖励计算
以代码生成 Agent 为例,采样流程如下:
python
import gymnasium as gym
from agent_env import CodeAgentEnv
env = CodeAgentEnv(task="实现一个快速排序函数")
obs, info = env.reset()
trajectory = []
for step in range(max_steps):
action = policy.generate_action(obs) # 模型生成下一步动作
obs, reward, terminated, truncated, info = env.step(action)
trajectory.append((obs, action, reward))
if terminated or truncated:
break
# 计算折扣累积回报
returns = compute_returns(trajectory, gamma=0.99)
3.4 策略更新(PPO 核心代码)
python
import torch
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("your-base-model")
optimizer = torch.optim.AdamW(model.parameters(), lr=1e-6)
for epoch in range(num_epochs):
for batch in dataloader:
# 计算新旧策略的比率
log_probs = model(batch["input_ids"]).log_probs
ratio = torch.exp(log_probs - batch["old_log_probs"])
# PPO 裁剪目标
clipped_ratio = torch.clamp(ratio, 1 - eps, 1 + eps)
policy_loss = -torch.min(ratio * batch["advantages"],
clipped_ratio * batch["advantages"]).mean()
optimizer.zero_grad()
policy_loss.backward()
optimizer.step()
3.5 训练技巧
- 奖励归一化:对奖励做标准化,避免量纲差异影响训练;
- GAE 优势估计:使用广义优势估计(GAE)降低方差;
- 混合训练:将 RL 数据与 SFT 数据混合,防止策略遗忘基础能力;
- 课程学习:从简单任务逐步过渡到复杂任务,提升探索效率。
4. 研究热点与前沿方向
4.1 可扩展的在线强化学习
以 DeepSeek-R1 为代表的工作证明了纯强化学习(不依赖 SFT 冷启动)可以激发模型的推理能力。当前热点在于如何将这一范式从数学推理扩展到通用 Agent 任务,包括工具调用、多轮对话与多模态交互。
4.2 基于规则的奖励与过程监督
研究者正探索如何为 Agent 的中间步骤设计细粒度奖励,例如对"工具调用是否合理""子目标是否达成"进行过程级打分,以缓解奖励稀疏问题。
4.3 多智能体强化学习
在多个 Agent 协作的场景中,每个 Agent 的策略更新会影响其他 Agent 的收益,这引入了多智能体强化学习(MARL)的挑战。如何设计通信协议与协同策略是当前活跃的研究方向。
4.4 离线强化学习与数据复用
为避免在线采样的高成本,离线强化学习(Offline RL)利用已有轨迹数据训练策略。结合 DPO 等偏好优化方法,可以在不与环境交互的情况下提升 Agent 能力。
5. 学习路线、参考文献与开源项目
5.1 学习路线
- 基础阶段:掌握强化学习核心概念(MDP、策略梯度、PPO、DPO),建议阅读 Sutton 的《Reinforcement Learning: An Introduction》;
- 进阶阶段:学习 LLM 对齐技术(RLHF、DPO),理解语言模型与强化学习的结合方式;
- 实践阶段:复现 DeepSeek-R1 的 GRPO 训练流程,或基于开源框架(如 TRL、verl)搭建 Agent 训练流水线;
- 前沿阶段:跟踪 arXiv 最新论文,关注 Agent 强化学习在工具使用、多模态、多智能体等方向的进展。
5.2 参考文献
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948, 2025.
- Schulman J, et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347, 2017.
- Rafailov R, et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. NeurIPS 2023.
- Ouyang L, et al. Training language models to follow instructions with human feedback. NeurIPS 2022.
- Shinn N, et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023.
- Yao S, et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023.
5.3 开源项目
- TRL(Hugging Face):提供 PPO、DPO 等训练接口,支持自定义奖励函数;
- verl(Volcano Engine):高性能 RL 训练框架,支持大规模并行采样;
- OpenRL:面向 LLM 的强化学习框架,支持多智能体扩展;
- AgentGym:Agent 训练与评估环境集合,覆盖代码、网页、游戏等任务;
- gymnasium:标准强化学习环境接口库,便于自定义 Agent 环境。
6. 总结
深度强化学习正在成为 Agent 后训练的核心技术范式。从 PPO 到 DPO,从可验证奖励到过程监督,研究者不断探索更高效、更稳定的训练方法。对于初学者,建议从复现经典算法入手,逐步深入前沿方向;对于研究者,多智能体协同、离线强化学习与可扩展在线训练是值得重点关注的方向。希望本文能为你的学习与研究提供清晰的路线图。