RAO 深度解读:当 Agent 学会递归调用自己——推理时扩展的新范式论文: Recursive Agent Optimization 来源: arXiv:2605.06639 [cs.LG] · 2026-05-07 作者: Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig 一句话: 用 RL 训练 Agent 学会递归 spawn 自己的子实例——不靠增大模型,靠递归结构实现 inference-time scaling。