这是最近比较感兴趣的方向。搜索了一些论文,准备读一下。
背景:据观察,现在各家 LLM 普遍存在"输出越来越长"的情况。甚至,有些 Agent 在解决实际问题时,如 coding 场景,会出现"雷霆大思考":一直 thinking,迟迟不进行真正的输出,导致任务进度停滞,并且浪费用户的 token。这可能与 RL 训练有关:RL 训练过程会鼓励 Agent 思考得更详尽、周密、考虑到各种 Corner case,某种程度上促使 Agent 反复思考、深度思考、以非常长的长度思考;甚至有些场景下,性能指标和长度存在微妙的正相关关系。
以下论文阅读,试图探寻 RL、Behavior Reward Model 和 Agent 输出长度之间的张力,以及思考可能性:我们可否"反其道而行之",探寻 Agent 输出过长的深层原因,以 Behavior RM 的形式由 RL 加以惩罚,从而通过 RL 抑制 LLM 输出长度增长?
强相关文章
(还没读,判断不一定可靠)
When Agents go Astray: Course-Correcting SWE Agents with PRMs
- arXiv:https://arxiv.org/abs/2509.02360
- PDF:https://arxiv.org/pdf/2509.02360
- HTML:https://arxiv.org/html/2509.02360
- 内容概括(还没有读):针对 SWE Agent 无效探索、重复循环、完成任务后仍不停止等 bad behavior,提出基于行为分类体系的 PRM(Process Reward Model),在推理过程中提供纠偏反馈。无需修改底层模型,属于 inference-time intervention。gpt 建议重点关注 bad-pattern taxonomy 和检测方法。
Think Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient Reasoning
- arXiv:https://arxiv.org/abs/2602.02099
- PDF:https://arxiv.org/pdf/2602.02099
- HTML:https://arxiv.org/html/2602.02099
- GitHub:https://github.com/alphadl/DDCA
- 内容概括(还没有读):指出简单的 RL length penalty 会出现两个问题:错误轨迹影响长度 baseline,以及固定 penalty 无法适应题目难度。提出 DDCA,只在正确答案组内部计算长度 advantage,并依据组内通过率动态调整惩罚强度。可以作为现有 trajectory-level length penalty 的改进 baseline。
Do LLMs Really Need 10+ Thoughts for "Find the Time 1000 Days Later"? Towards Structural Understanding of LLM Overthinking
- arXiv:https://arxiv.org/abs/2510.07880
- PDF:https://arxiv.org/pdf/2510.07880
- HTML:https://arxiv.org/html/2510.07880
- Google DeepMind:https://deepmind.google/research/publications/203490/
- Project:https://web.eecs.umich.edu/~xlfzhang/projects/TRACE/
- 内容概括(还没有读):提出名为 TRACE 的思考结构分析工具,将 CoT 拆分为 sub-thought,构造 thought progression graph,发现 Explorer 和 Late Landing 等典型模式,认为过度探索和过度验证是 overthinking 的重要来源。进一步提出超越 token length 的 utility-based overthinking 定义。gpt 建议参考方法,用来寻找"又长又没有信息量"的 bad pattern。
SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling
- arXiv:https://arxiv.org/abs/2604.14820
- PDF:https://arxiv.org/pdf/2604.14820
- HTML:https://arxiv.org/html/2604.14820
- 内容概括(还没有读):提出一套 SWE Agent 优化框架:构造高效 SFT 轨迹、利用 rubric-based PRM 为 RL 提供更细粒度的过程反馈,并在推理时利用 PRM 评估和剪枝候选动作。gpt 建议关注如何提高成功率、降低 token 消耗和推理延迟。
弱相关文章
(还没读,判断不一定可靠)
Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning
- arXiv:https://arxiv.org/abs/2508.02178
- PDF:https://arxiv.org/pdf/2508.02178
- HTML:https://arxiv.org/html/2508.02178
- 内容概括(还没有读):将 overthinking 区分为 internal redundancy(首次正确答案出现前,缺乏信息增益的推理)和 external redundancy(得到正确答案后仍继续推理)。提出双重 RL penalty:通过滑动窗口语义相似度惩罚内部冗余,通过长度比例惩罚外部冗余。感觉这篇会有些旧了(?)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
- arXiv:https://arxiv.org/abs/2511.08325
- PDF:https://arxiv.org/pdf/2511.08325
- HTML:https://arxiv.org/html/2511.08325
- 内容概括(还没有读):认为 Agent 的每一步不能简单用正确/错误衡量,而应该同时考虑 promise(对未来成功的潜在价值)和 progress(实际推进程度)。使用 TD estimation 和 GAE 构建 PRM,实验涉及 WebShop、BabyAI 等多轮 Agent 任务,也探索了 RL 应用。
TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
- arXiv:https://arxiv.org/abs/2607.13988
- PDF:https://arxiv.org/pdf/2607.13988
- HTML:https://arxiv.org/html/2607.13988
- GitHub:https://github.com/MSR-Orchard/trace
- 内容概括(还没有读):解决长轨迹 Agent RL 中的 credit assignment 问题。利用 frozen reference model 估计每次工具调用前后的状态价值变化,通过 TD difference 生成 turn-level reward,不需要额外训练 critic 或 PRM。主要实验是搜索 Agent。重点关注其局部 reward 如何接入 RL。