【读论文系列】AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS翻译+解读

一、先给结论:这篇论文真正做了什么

arXiv v1 原名 Online Process Reward Learning(OPRL) ,最终 ICLR 2026 版本改名为 Agentic Reinforcement Learning with Implicit Step Rewards(iStar) 。以下以 arXiv v3ICLR 2026 camera-ready 为准,并用 ICLR slides 补充作者想强调的直觉。

一句话概括:

iStar 用轨迹级 outcome preference 在线训练一个 DPO 型隐式 PRM,再把 PRM 相对于旧 policy 的 action-level log-ratio 当成 step reward,最后将 step-level advantage 与 trajectory-level advantage 相加,送入 GRPO、RLOO 或 PPO 类目标更新 policy。

它不是新的 policy-gradient 骨架,而是一个 credit signal generator + advantage fusion module。因此它理论上可以挂在 GRPO、RLOO、REINFORCE++、DAPO 等外面。

完整闭环是:
#mermaid-svg-gu6FotyWO9JpgfBf{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-gu6FotyWO9JpgfBf .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-gu6FotyWO9JpgfBf .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-gu6FotyWO9JpgfBf .error-icon{fill:#552222;}#mermaid-svg-gu6FotyWO9JpgfBf .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-gu6FotyWO9JpgfBf .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-gu6FotyWO9JpgfBf .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-gu6FotyWO9JpgfBf .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-gu6FotyWO9JpgfBf .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-gu6FotyWO9JpgfBf .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-gu6FotyWO9JpgfBf .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-gu6FotyWO9JpgfBf .marker{fill:#333333;stroke:#333333;}#mermaid-svg-gu6FotyWO9JpgfBf .marker.cross{stroke:#333333;}#mermaid-svg-gu6FotyWO9JpgfBf svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-gu6FotyWO9JpgfBf p{margin:0;}#mermaid-svg-gu6FotyWO9JpgfBf .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-gu6FotyWO9JpgfBf .cluster-label text{fill:#333;}#mermaid-svg-gu6FotyWO9JpgfBf .cluster-label span{color:#333;}#mermaid-svg-gu6FotyWO9JpgfBf .cluster-label span p{background-color:transparent;}#mermaid-svg-gu6FotyWO9JpgfBf .label text,#mermaid-svg-gu6FotyWO9JpgfBf span{fill:#333;color:#333;}#mermaid-svg-gu6FotyWO9JpgfBf .node rect,#mermaid-svg-gu6FotyWO9JpgfBf .node circle,#mermaid-svg-gu6FotyWO9JpgfBf .node ellipse,#mermaid-svg-gu6FotyWO9JpgfBf .node polygon,#mermaid-svg-gu6FotyWO9JpgfBf .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-gu6FotyWO9JpgfBf .rough-node .label text,#mermaid-svg-gu6FotyWO9JpgfBf .node .label text,#mermaid-svg-gu6FotyWO9JpgfBf .image-shape .label,#mermaid-svg-gu6FotyWO9JpgfBf .icon-shape .label{text-anchor:middle;}#mermaid-svg-gu6FotyWO9JpgfBf .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-gu6FotyWO9JpgfBf .rough-node .label,#mermaid-svg-gu6FotyWO9JpgfBf .node .label,#mermaid-svg-gu6FotyWO9JpgfBf .image-shape .label,#mermaid-svg-gu6FotyWO9JpgfBf .icon-shape .label{text-align:center;}#mermaid-svg-gu6FotyWO9JpgfBf .node.clickable{cursor:pointer;}#mermaid-svg-gu6FotyWO9JpgfBf .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-gu6FotyWO9JpgfBf .arrowheadPath{fill:#333333;}#mermaid-svg-gu6FotyWO9JpgfBf .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-gu6FotyWO9JpgfBf .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-gu6FotyWO9JpgfBf .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-gu6FotyWO9JpgfBf .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-gu6FotyWO9JpgfBf .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-gu6FotyWO9JpgfBf .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-gu6FotyWO9JpgfBf .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-gu6FotyWO9JpgfBf .cluster text{fill:#333;}#mermaid-svg-gu6FotyWO9JpgfBf .cluster span{color:#333;}#mermaid-svg-gu6FotyWO9JpgfBf div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-gu6FotyWO9JpgfBf .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-gu6FotyWO9JpgfBf rect.text{fill:none;stroke-width:0;}#mermaid-svg-gu6FotyWO9JpgfBf .icon-shape,#mermaid-svg-gu6FotyWO9JpgfBf .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-gu6FotyWO9JpgfBf .icon-shape p,#mermaid-svg-gu6FotyWO9JpgfBf .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-gu6FotyWO9JpgfBf .icon-shape rect,#mermaid-svg-gu6FotyWO9JpgfBf .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-gu6FotyWO9JpgfBf .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-gu6FotyWO9JpgfBf .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-gu6FotyWO9JpgfBf :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 旧策略生成多条轨迹
Outcome verifier 排序
DPO 更新隐式 PRM
计算每个 action 的隐式 step reward
Step advantage + Episode advantage
PPO / GRPO / RLOO 更新策略

需要先钉死两个概念。

第一,论文里的一个 step 不是 token,也不一定是环境里的原子动作,而是一次完整的:

a t = reasoning tokens + executable action tokens . a_t=\text{reasoning tokens}+\text{executable action tokens}. at=reasoning tokens+executable action tokens.

所以它更准确地说是 turn-level / segment-level reward

第二,这个 reward 不是环境奖励,也不是因果意义上的"这一步为最终成功贡献了多少",而是:

preference-trained PRM 相对于旧策略,提高或降低了这个 action 的相对概率多少。

它首先是一个 density-ratio score,然后才被作者解释为 credit。


二、问题背景:为什么普通 trajectory reward 不够

论文把 Agentic RL 与 single-turn RL 的区别总结为三点。

一是 reward sparse and delayed。数学题可能整段 response 完成后给一个 0/1,Agent 则可能执行十几次搜索、点击、工具调用,到最后才知道成功还是失败。如果把最终 reward R ( τ ) R(\tau) R(τ) 同样广播给所有步骤,那么一条成功轨迹中的错误搜索、无效重试和绕路都会被一起强化。

二是作者称轨迹在 token level 上"non-Markovian"。严格来说,这个措辞并不严谨:如果把完整历史 h t = ( x , o 1 : t , a 1 : t − 1 ) h_t=(x,o_{1:t},a_{1:t-1}) ht=(x,o1:t,a1:t−1) 当成状态,过程可以重新表示为 Markov;作者真正想说的是,单个 token 或短 token prefix 不能构成充分状态,而且 environment observation 与 action segment 之间存在更自然的决策边界。因此 token-level credit 往往比 action-level credit 更噪。

三是部分环境 reward "unverifiable"。这不等于没有 reward。SOTOPIA 依然用 GPT-4o judge 打分,只不过它不是像数学答案或 Sokoban 成功状态那样程序可验证。所以更准确的术语是 model-evaluated outcome reward,不是 reward-free learning。

作者讨论了四类现有做法:

  • 人工 step label:昂贵、主观,并可能诱发 reward hacking。
  • LLM-as-judge/Generative Reward Model:能标步骤,但跨领域校准不稳定。
  • PRIME 型 token-level implicit reward:太细,长轨迹中噪声和方差容易累积。
  • GiGPO 型 same-state grouping:需要不同轨迹重新到达完全相同的状态,在语言、网页和对话环境里很难满足。

iStar 试图找到中间点:不标步骤,不额外 branch rollout,不要求相同中间状态,但把粒度从 trajectory 缩小到 action segment。


三、全部数学公式逐项拆解

0. 前置公式:token-level implicit reward

论文先回顾 PRIME、Implicit PRM 一脉的公式:

r ϕ ( y t ) = β log ⁡ π ϕ ( y t ∣ y < t ) π r e f ( y t ∣ y < t ) . r_\phi(y_t) =\beta \log \frac{\pi_\phi(y_t\mid y_{<t})} {\pi_{\mathrm{ref}}(y_t\mid y_{<t})}. rϕ(yt)=βlogπref(yt∣y<t)πϕ(yt∣y<t).

直觉是:如果 preference-trained model π ϕ \pi_\phi πϕ 比 reference model 更愿意生成 token y t y_t yt,该 token 得到正奖励;反之得到负奖励。

这继承自 DPO 的核心解释:DPO policy 本身可以被重新解释成一个隐式 reward model。原始 DPO 用固定 reference policy,将 response preference 直接转换为 policy 的 log-ratio 分类目标。DPO 原论文

iStar 做的第一项改变,就是把 token y t y_t yt 换成一次完整 action a t a_t at。


1. 隐式 step reward

r ϕ ( o 1 : t , a t ) = β log ⁡ π ϕ ( a t ∣ o 1 : t , x ) π θ o l d ( a t ∣ o 1 : t , x ) (1) r_\phi(o_{1:t},a_t)=\beta\log\frac{\pi_\phi(a_t\mid o_{1:t},x)}{\pi_{\theta_{\mathrm{old}}}(a_t\mid o_{1:t},x)}\qquad\text{(1)} rϕ(o1:t,at)=βlogπθold(at∣o1:t,x)πϕ(at∣o1:t,x)(1)

令完整历史为 h t = ( x , o 1 : t , a 1 : t − 1 ) h_t=(x,o_{1:t},a_{1:t-1}) ht=(x,o1:t,a1:t−1),可以简写为:

r ϕ ( h t , a t ) = β log ⁡ π ϕ ( a t ∣ h t ) − log ⁡ π o l d ( a t ∣ h t ) r_\phi(h_t,a_t)=\beta\left\\log\\pi_\\phi(a_t\\mid h_t)-\\log\\pi_{\\mathrm{old}}(a_t\\mid h_t)\\right rϕ(ht,at)=βlogπϕ(at∣ht)−logπold(at∣ht)

其中:

  • π θ o l d \pi_{\theta_{\mathrm{old}}} πθold:生成当前训练数据的旧 policy,也是移动 reference。
  • π ϕ \pi_\phi πϕ:通过轨迹偏好训练出的隐式 PRM,但结构上仍然是一个生成式 LM。
  • β \beta β:DPO temperature,论文默认 0.05 0.05 0.05。

假设 action 本身包含 L t L_t Lt 个 token:

a t = ( y t , 1 , ... , y t , L t ) , a_t=(y_{t,1},\ldots,y_{t,L_t}), at=(yt,1,...,yt,Lt),

那么 action log-probability 实际上是:

log ⁡ π ϕ ( a t ∣ h t ) = ∑ ℓ = 1 L t log ⁡ π ϕ ( y t , ℓ ∣ h t , y t , < ℓ ) . \log \pi_\phi(a_t\mid h_t) =\sum_{\ell=1}^{L_t} \log\pi_\phi \left( y_{t,\ell} \mid h_t,y_{t,<\ell} \right). logπϕ(at∣ht)=ℓ=1∑Ltlogπϕ(yt,ℓ∣ht,yt,<ℓ).

因此式(1)真正计算的是整个 reasoning-and-action segment 的 token log-ratio 之和。

正值意味着 PRM 相对于旧 policy 更偏爱这个动作;负值意味着 PRM 降低了它的相对概率。

但不要把它直接说成"正值证明这个动作导致了成功"。它只证明该动作在更优轨迹里更受 preference-trained PRM 偏爱。它可能捕获真正的有效搜索,也可能捕获长度、表达方式、格式、常见措辞等 spurious correlation。

另一个实现风险是长度效应:

r ϕ ( a t ) = β ∑ ℓ = 1 L t Δ log ⁡ p t , ℓ . r_\phi(a_t) =\beta\sum_{\ell=1}^{L_t}\Delta\log p_{t,\ell}. rϕ(at)=βℓ=1∑LtΔlogpt,ℓ.

长 action 累积更多 log-ratio,其方差天然更大。论文没有说明是否做 token-length normalization;如果严格按公式实现,这是一个明显的 reproducibility hole。


2. Multi-turn DPO 训练 PRM

J P R M ( ϕ ) = − E x ∼ p ( X ) ,   ( τ + , τ − ) ∼ π θ o l d log ⁡ σ ( β log ⁡ π ϕ ( τ + ∣ x ) π o l d ( τ + ∣ x ) − β log ⁡ π ϕ ( τ − ∣ x ) π o l d ( τ − ∣ x ) ) (2) \mathcal{J}{\mathrm{PRM}}(\phi)=-\mathbb{E}{x\sim p(X),\,(\tau^+,\tau^-)\sim\pi_{\theta_{\mathrm{old}}}}\left\\log\\sigma\\left(\\beta\\log\\frac{\\pi_\\phi(\\tau\^+\\mid x)}{\\pi_{\\mathrm{old}}(\\tau\^+\\mid x)}-\\beta\\log\\frac{\\pi_\\phi(\\tau\^-\\mid x)}{\\pi_{\\mathrm{old}}(\\tau\^-\\mid x)}\\right)\\right\qquad\text{(2)} JPRM(ϕ)=−Ex∼p(X),(τ+,τ−)∼πθoldlogσ(βlogπold(τ+∣x)πϕ(τ+∣x)−βlogπold(τ−∣x)πϕ(τ−∣x))(2)

它与普通 DPO 形式一样,但有两个区别:

  1. 普通 DPO 比较两条 single-turn response;这里比较完整 multi-turn trajectory。
  2. 普通 DPO 通常使用固定 reference;这里 reference 是不断更新的上一版 policy。

轨迹概率定义为:

π ( τ ∣ x ) = ∏ t = 1 T π ( a t ∣ o 1 : t , x ) , \pi(\tau\mid x) =\prod_{t=1}^{T} \pi(a_t\mid o_{1:t},x), π(τ∣x)=t=1∏Tπ(at∣o1:t,x),

注意这里只乘 agent-controlled action 的概率,不包含 environment observation。论文明确说明 environment-generated tokens 必须 mask 掉,否则模型会被要求对网页返回、工具 observation 或对手话语负责,这是严重的 observation loss-mask bug。

式(2)的 DPO logit 可以展开为:

z = β log ⁡ π ϕ ( τ + ) π o l d ( τ + ) − β log ⁡ π ϕ ( τ − ) π o l d ( τ − ) z=\beta\log\frac{\pi_\phi(\tau^+)}{\pi_{\mathrm{old}}(\tau^+)}-\beta\log\frac{\pi_\phi(\tau^-)}{\pi_{\mathrm{old}}(\tau^-)} z=βlogπold(τ+)πϕ(τ+)−βlogπold(τ−)πϕ(τ−)

利用轨迹概率的逐步分解,又可以写成:

z = ∑ t r ϕ ( h t + , a t + ) − ∑ t r ϕ ( h t − , a t − ) z=\sum_t r_\phi(h_t^+,a_t^+)-\sum_t r_\phi(h_t^-,a_t^-) z=t∑rϕ(ht+,at+)−t∑rϕ(ht−,at−)

因此 DPO loss 为:

L D P O = − log ⁡ σ ( z ) \mathcal{L}_{\mathrm{DPO}}=-\log\sigma(z) LDPO=−logσ(z)

当 preferred trajectory 的累计隐式 reward 还不够高时,梯度会推动 π ϕ \pi_\phi πϕ 增加 preferred trajectory 的相对概率,并压低 rejected trajectory。

实验里偏好标签的构造相当粗糙:

  • WebShop、VisualSokoban:成功轨迹为 positive,失败为 negative。
  • SOTOPIA:goal completion > 6 >6 >6 为 positive。

这意味着 SOTOPIA 原本 0--10 的连续分数又被阈值二值化了。理论上 pairwise DPO 可以直接比较 8.5 与 7.2,但论文实现丢掉了相当多 magnitude/ranking information。

移动 reference 的好处是 PRM 永远围绕当前 policy 的 data distribution 学习,减少离线 PRM 的 distribution shift;坏处是 reward semantics 每轮都在变化:

r ϕ ( k ) = β log ⁡ π ϕ ( k ) π o l d ( k ) . r_\phi^{(k)} =\beta\log \frac{\pi_\phi^{(k)}}{\pi_{\mathrm{old}}^{(k)}}. rϕ(k)=βlogπold(k)πϕ(k).

第 20 步的 (0.1) 与第 150 步的 (0.1) 不一定具有同一含义。论文后面直接绘制跨训练步的平均 implicit reward,因此那些曲线只能解释为相对趋势,不能当作固定 reward scale 下的严格比较。


3. Episode-level advantage

A E ( τ i ) = r o ( τ i ) − mean ⁡ ( R o ) std ⁡ ( R o ) . (3) A^E(\tau_i) =\frac{ r_o(\tau_i)-\operatorname{mean}(R_o) }{ \operatorname{std}(R_o) }. \tag{3} AE(τi)=std(Ro)ro(τi)−mean(Ro).(3)

其中:

R o = { r o ( τ 1 ) , ... , r o ( τ N ) } . R_o=\{r_o(\tau_1),\ldots,r_o(\tau_N)\}. Ro={ro(τ1),...,ro(τN)}.

这就是 GRPO 风格的 group-relative advantage:对同一个 task prompt 采样 N = 8 N=8 N=8 条轨迹,然后用组内 outcome reward 的均值和标准差归一化。

例如四条轨迹 outcome 为:

R o = 1 , 1 , 0 , 0 . R_o=1,1,0,0. Ro=1,1,0,0.

那么忽略数值细节,两条成功轨迹获得正 A E A^E AE,失败轨迹获得负 A E A^E AE。

但若:

R o = 0 , 0 , 0 , 0 或 R o = 1 , 1 , 1 , 1 . R_o=0,0,0,0 \quad\text{或}\quad R_o=1,1,1,1. Ro=0,0,0,0或Ro=1,1,1,1.

则标准差为零,episode advantage collapse。论文没有在公式里写 ϵ \epsilon ϵ,真实实现必须使用:

$$

\operatorname{std}_\epsilon(R_o)

\max(\operatorname{std}(R_o),\epsilon).

或者像 DAPO dynamic sampling 那样过滤 all-correct/all-wrong group。 iStar 能在 A E = 0 A\^E=0 AE=0 时继续依靠已有 PRM 提供 A S A\^S AS,所以它确实部分缓解 group collapse;但如果长期没有正负 trajectory pair,PRM 本身也无法继续学。它不是彻底解决了 zero-variance problem。 *** ** * ** *** ### 4. Step-level advantage ##

AS(a_ti)

\frac{

r_\phi(a_t^i)-\operatorname{mean}(R_s)

}{

\operatorname{std}(R_s)

}.

\tag{4}

其中: ##

R_s

{r_\phi(a_t^i):i=1,\ldots,N,\ t=1,\ldots,T_i}.

也就是把同一 prompt 下所有 trajectory 的全部 step reward 放在一个池子里做 z-score。 作者声称多条轨迹从同一初始状态出发,可以形成 counterfactual scenarios,进而产生更稳定的 state-value baseline。这个说法明显偏强:轨迹经过第一步就进入不同状态,式(4)并没有计算 V ( h t ) = E \[ R ∣ h t \] . V(h_t)=\\mathbb E\[R\\mid h_t\]. V(ht)=E\[R∣ht\]. 而只是计算 batch-wide mean。它把不同深度、不同历史、不同 action 长度的 step 放在一起比较。因此: > A S A\^S AS 是 group-normalized action score,不是严格的 state-conditioned advantage。 这与 GiGPO 的差异非常清楚:GiGPO 只比较从相同中间状态出发的动作,因此局部 counterfactual 更干净;iStar 放弃 exact-state matching,用 PRM 的泛化能力换取开放环境中的可扩展性。 还有一个容易忽略的数学事实:因为式(4)会 z-score,如果 β \> 0 \\beta\>0 β\>0 只作为式(1)的整体乘数,那么: ##

\frac{\beta q-\beta\bar q}{\beta\sigma_q}

\frac{q-\bar q}{\sigma_q}.

所以 β \\beta β 对最终 A S A\^S AS 的直接缩放作用会被归一化抵消。它真正影响的是 DPO loss 的 margin、梯度饱和程度以及 PRM 学出来的分布,而不是简单地"控制 step reward 在总 advantage 中有多大";那个职责主要属于 α \\alpha α。 *** ** * ** *** ### 5. 两级 advantage 融合 ##

A(a_t^i)

A^E(\tau_i)

\alpha AS(a_ti).

\tag{5}

这一步是整篇论文对 policy learning 最实用的贡献。 假设一条成功轨迹里有三个动作: A E ( τ ) = 1.0 , A S = \[ 0.8 , − 1.4 , 0.2 \] , α = 1. A\^E(\\tau)=1.0, \\qquad A\^S=\[0.8,-1.4,0.2\], \\qquad \\alpha=1. AE(τ)=1.0,AS=\[0.8,−1.4,0.2\],α=1. 那么最终: A = \[ 1.8 , − 0.4 , 1.2 \] . A=\[1.8,-0.4,1.2\]. A=\[1.8,−0.4,1.2\]. 于是同一条成功轨迹中: * 第一步被明显强化; * 第二步即使属于成功轨迹,也会被压制; * 第三步得到较温和强化。 反过来,一条失败轨迹中的某个好步骤,也可能因正 A S A\^S AS 而不被彻底否定。 但论文说它能 "gate credit by final success" 并不准确,因为这只是加法: A = A E + α A S . A=A\^E+\\alpha A\^S. A=AE+αAS. 如果失败轨迹 A E = − 0.5 A\^E=-0.5 AE=−0.5,但某一步 α A S = 1.5 \\alpha A\^S=1.5 αAS=1.5,最终仍是 A = 1.0 A=1.0 A=1.0。这不是 hard gate,而是 soft fusion。真正的 gated reward 应类似: A = A E + 1 \[ r o \> δ \] α A S . A=A\^E+\\mathbf 1\[r_o\>\\delta\]\\alpha A\^S. A=AE+1\[ro\>δ\]αAS. 或用 outcome-dependent coefficient。论文没有这样做。 实验表明 α = 1 \\alpha=1 α=1 最好,但这只能解释成:在两个信号都已标准化的情况下,equal standardized weighting 在 WebShop 上效果最好。它不是普遍理论常数。 *** ** * ** *** ### 6. Policy surrogate objective ##

\mathcal J_{\mathrm{policy}}(\theta)

\mathbb E

\left[

\frac{1}{NT}

\sum_{i=1}^{N}

\sum_{t=1}^{T_i}

\min

\left(

\rho_\theta(a_ti)A(a_ti),

\operatorname{clip}

(\rho_\theta(a_t^i),1-\epsilon,1+\epsilon)

A(a_t^i)

\right)

\right].

\tag{6}

其中: ##

\rho_\theta(a_t^i)

\frac{

\pi_\theta(a_t^i\mid h_t^i)

}{

\pi_{\mathrm{old}}(a_t^i\mid h_t^i)

}.

这就是 PPO clipped surrogate,只不过 importance ratio 是 action-segment level,不是经典环境的单个离散动作,也不是通常 LLM GRPO 的逐 token ratio。[PPO 原论文](https://arxiv.org/abs/1707.06347) 当 A \> 0 A\>0 A\>0 时,ratio 增大到 1 + ϵ 1+\\epsilon 1+ϵ 后停止继续奖励;当 A \< 0 A\<0 A\<0 时,ratio 降到 1 − ϵ 1-\\epsilon 1−ϵ 后停止继续推动。clip 的目的仍然是限制单批旧数据上的 policy drift。 但若 action 有很多 token: ##

\rho_\theta(a_t)

\exp

\left[

\sum_{\ell=1}^{L_t}

\left(

\log p_\theta(y_\ell)-\log p_{\mathrm{old}}(y_\ell)

\right)

\right].

长度越长,这个 ratio 越容易极端化并被 clip 饱和。这就是为什么 GSPO 类方法会认真处理 sequence-level ratio 的长度归一化。论文只说它与 step reward "aligns well",却没有交代 action ratio 是否按 token 数平均,这是另一个实现缺口。 公式里的 1 / ( N T ) 1/(NT) 1/(NT) 也有记号问题,因为每条轨迹的 T i T_i Ti 不同;实际实现应除以有效 action 总数: ##

N_{\mathrm{valid}}

\sum_i T_i.

论文不加 policy KL penalty,并在 Table 7 中显示 WebShop 上去掉 KL 效果更好。这个结论只适用于受限 action space 和短期 task-specific RL;不能外推为"Agent RL 都应该去掉 KL",否则 general language ability、格式稳定性与安全边界都可能漂移。 *** ** * ** *** ### 7--8. 理论分析:到底证明了什么 论文考虑两条从相同 prompt 出发的轨迹: τ 1 = { ( o t 1 , a t 1 ) } t = 1 T 1 , τ 2 = { ( o t 2 , a t 2 ) } t = 1 T 2 . \\tau_1=\\{(o_t\^1,a_t\^1)\\}_{t=1}\^{T_1}, \\qquad \\tau_2=\\{(o_t\^2,a_t\^2)\\}_{t=1}\^{T_2}. τ1={(ot1,at1)}t=1T1,τ2={(ot2,at2)}t=1T2. 因为 trajectory probability 可以按 action factorize: π ϕ ( τ ∣ x ) = ∏ t π ϕ ( a t ∣ h t ) . \\pi_\\phi(\\tau\\mid x) =\\prod_t\\pi_\\phi(a_t\\mid h_t). πϕ(τ∣x)=t∏πϕ(at∣ht). 所以: ###

\begin{aligned}
P(\tau_1\succ\tau_2)
&=\sigma\Bigg(
\sum_{t=1}^{T_1}
\beta\log
\frac{
\pi_\phi*(a_t1\mid h_t^1)
}{
\pi_{\mathrm{old}}(a_t^1\mid h_t^1)
}

\sum_{t=1}^{T_2}

\beta\log
\frac{
\pi_\phi*(a_t2\mid h_t^2)
}{
\pi_{\mathrm{old}}(a_t^2\mid h_t^2)
}
\Bigg)
\
&=
\sigma\left(
\sum_t r_\phi*(h_t1,a_t^1)

\sum_t r_\phi*(h_t2,a_t^2)

\right).

\end{aligned}

\tag{7}

其中: r ϕ ∗ ( h t , a t ) = β log ⁡ π ϕ ∗ ( a t ∣ h t ) π o l d ( a t ∣ h t ) . (8) r_\\phi\^\*(h_t,a_t) =\\beta \\log \\frac{ \\pi_\\phi\^\*(a_t\\mid h_t) }{ \\pi_{\\mathrm{old}}(a_t\\mid h_t) }. \\tag{8} rϕ∗(ht,at)=βlogπold(at∣ht)πϕ∗(at∣ht).(8) 因此 trajectory DPO 的 Bradley--Terry score 可以写成 step score 之和。 这个结论是成立的,但本质上主要来自: log ⁡ ∏ t p t = ∑ t log ⁡ p t . \\log\\prod_t p_t=\\sum_t\\log p_t. logt∏pt=t∑logpt. 它证明的是: > DPO trajectory score 拥有一个由 action log-ratio 构成的 additive decomposition。 它没有证明: 1. 每个 r ϕ ( h t , a t ) r_\\phi(h_t,a_t) rϕ(ht,at) 是 action 的因果贡献; 2. 它等于传统 Q ( h t , a t ) − V ( h t ) Q(h_t,a_t)-V(h_t) Q(ht,at)−V(ht); 3. 它是 unbiased credit; 4. 它满足 Bellman equation; 5. 它能区分真正必要步骤与只是在成功轨迹里经常出现的相关步骤。 从 trajectory preference 只能约束 step reward 的总和。多种局部分配都可能得到相同的 trajectory score;具体分到哪一步,是由 LM parameterization、训练数据相关性和 inductive bias 决定的,而不是 preference label 唯一识别出来的。 所以最准确的评价是: > iStar 实现了 preference-consistent step-score decomposition,但没有完成 causal temporal credit assignment。 *** ** * ** *** ## 四、一个很重要的版本变化:v1 的强定理为什么被删了 [arXiv v1](https://arxiv.org/html/2509.19199v1) 曾经声称: * step reward 是 action contribution 的 unbiased estimator; * 它构成 potential-based reward shaping; * policy gradient uniformly bounded; * 因而保证稳定训练。 这些内容在 [最终 ICLR 版本](https://proceedings.iclr.cc/paper_files/paper/2026/file/d1e6739f319be4ba8e748cc05f23bba1-Paper-Conference.pdf) 中全部消失,slides 也只保留 Bradley--Terry additive decomposition。我们不能知道作者删除的具体原因,但原证明至少存在以下明显问题。 首先,经典 potential-based shaping 要求 shaping term 具有: F ( s t , a t , s t + 1 ) = γ Φ ( s t + 1 ) − Φ ( s t ) . F(s_t,a_t,s_{t+1}) =\\gamma\\Phi(s_{t+1})-\\Phi(s_t). F(st,at,st+1)=γΦ(st+1)−Φ(st). 这样沿轨迹 telescoping 后才保证 optimal policy invariance。[经典 reward shaping 论文](https://www.cs.utexas.edu/~shivaram/readings/b2hd-NgHR1999.html) 而 v1 只是证明或声称: ∑ t r ϕ ( h t , a t ) = R ∗ ( τ ) + other terms . \\sum_t r_\\phi(h_t,a_t) =R\^\*(\\tau)+\\text{other terms}. t∑rϕ(ht,at)=R∗(τ)+other terms. 却没有构造满足上述形式的 state potential Φ \\Phi Φ。"轨迹总和能对应 utility"不等价于"每步 reward 是 potential difference"。 其次,v1 给出: ∣ r ϕ ( h t , a t ) ∣ ≤ β log ⁡ ( 1 / ε ) . \\lvert r_\\phi(h_t,a_t)\\rvert \\le \\beta\\log(1/\\varepsilon). ∣rϕ(ht,at)∣≤βlog(1/ε). 只假设: π o l d ( a t ∣ h t ) ≥ ε . \\pi_{\\mathrm{old}}(a_t\\mid h_t)\\ge\\varepsilon. πold(at∣ht)≥ε. 这最多能控制正方向,因为 π ϕ ≤ 1 \\pi_\\phi\\le1 πϕ≤1;但当: π ϕ ( a t ∣ h t ) → 0. \\pi_\\phi(a_t\\mid h_t)\\rightarrow0. πϕ(at∣ht)→0. 就有: r ϕ = β ( log ⁡ π ϕ − log ⁡ π o l d ) → − ∞ . r_\\phi =\\beta(\\log\\pi_\\phi-\\log\\pi_{\\mathrm{old}}) \\rightarrow-\\infty. rϕ=β(logπϕ−logπold)→−∞. 因此没有对 π ϕ \\pi_\\phi πϕ 的正下界时,绝对值 boundedness 并不成立。 第三,v1 将目标解释成: − β KL ⁡ ( π θ ∥ π ϕ ) . -\\beta\\operatorname{KL} (\\pi_\\theta\\Vert\\pi_\\phi). −βKL(πθ∥πϕ). 但在多步 MDP 中,state/history visitation distribution 本身依赖 θ \\theta θ。直接把每个状态当作固定分布,会漏掉 policy 改变带来的状态分布变化。 最终版删除这些强结论是正确的。你面试时不要说"论文理论证明了 unbiased causal credit 和 potential-based shaping";现在能站得住的只有: > Multi-turn DPO trajectory log-ratio can be algebraically decomposed into additive action-level implicit rewards. *** ** * ** *** ## 五、每一张图逐一分析 以下图号均对应 ICLR camera-ready。 | 图 | 图中内容 | 正确解读与盲点 | |-------------|-------------------------------------------------------------------------------------------------|---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------| | Figure 1 | Policy rollout → outcome verifier → trajectory DPO 更新 PRM → implicit step reward → RL 更新 policy | 最重要的是两条反馈路径:outcome reward 直接形成 episode advantage,同时又间接训练 PRM。它不是纯 process RL,terminal objective 一直保留。图里没有清楚表现"当前 batch 用更新前还是更新后的 PRM 打分",正文与算法更接近使用上一轮 PRM,存在一轮滞后。 | | Figure 2 | 同一初始状态产生 N N N 条轨迹,每条有一个 A E A\^E AE,每一步有一个 A S A\^S AS,最后相加 | 成功轨迹中的坏动作可以得到负最终 advantage,失败轨迹里的好动作也可能被保留,这是核心直觉。但图把所有步骤画得像可直接横向比较,实际上它们通常处在不同状态。 | | Figure 3 | iStar 分别挂在 RLOO、REINFORCE++、GRPO 上 | 说明方法确实不是绑定某一种 baseline。单 seed 下,RLOO+iStar 增益最大:WebShop score 84.2→94.7、success 76.6→89.1,VisualSokoban 85.9→93.0;GRPO+iStar 增益较小但仍为正。只有一个 seed,不能据此判断哪个底座"最适合"iStar。 | | Figure 4(a) | WebShop validation score 随训练步变化 | iStar 前期上升最快;PRIME 前期也快,但约 80--130 步出现明显下降后恢复。作者用它支持 token-level reward 在长轨迹上不稳定,但仅靠一条训练曲线不能排除学习率、reward scale 或实现差异。 | | Figure 4(b) | WebShop success rate | iStar 后期最高且较平滑;PRIME 中期下降更明显。它支持 sample efficiency,但所有曲线最终差距缩小,说明主要收益之一是更快学到有效策略,而不只是更高 asymptotic ceiling。 | | Figure 4© | VisualSokoban success rate | iStar 从约 50--75 step 开始领先,最终约 85--90%;GiGPO 后期下降,RLOO 次之。由于 Sokoban 错误具有不可逆性,这里最能体现局部 credit 的价值,也是论文最有说服力的实验。 | | Figure 5(a) | WebShop episode reward 与 implicit step reward | 两条线几乎同步上升,step reward 是否真正领先并不明显。双 y 轴尺度可以产生视觉上的强相关,不构成"step reward 导致 episode reward 上升"的因果证据。 | | Figure 5(b) | VisualSokoban 两类 reward | step reward 很早从负值接近 0,episode reward 在约 60 步后才明显上升,这比 WebShop 更支持"先学局部动作启发,再组合成长轨迹"的解释。不过 moving reference 导致不同 iteration 的 reward scale 不完全可比。 | | Figure 5© | WebShop episode length | iStar 最快降到约 5 步;其他方法多在 6--7 步。结合 success 上升,说明不只是提前退出。但更严谨的实验应分别报告成功轨迹长度与失败轨迹长度,否则无法排除 early-stop bias。 | | Figure 5(d) | VisualSokoban episode length | 所有方法都从约 15 降到 5--6,iStar 较早完成下降。增益存在,但没有 Figure 4© 那么巨大。 | | Figure 6 | WebShop prompt template | Prompt 显式提供 admissible actions、当前 observation 和截断历史,因此 action space 已被 harness 强约束,不是完全开放网页操作。`history_length` 未披露,可能显著影响 long-horizon 难度。 | | Figure 7 | VisualSokoban prompt template | Prompt 已写入规则、陷阱提示、图像元素解释,并强制一次只输出一个方向动作。这使评测更接近 constrained planning。更大的复现疑问是:policy 是 Qwen2.5-VL-7B,而 PRM 是纯文本 Qwen2.5-7B,论文没有解释文本 PRM 如何完整条件化于视觉 observation。 | | Figure 8 | SOTOPIA prompt template | Agent 能看到自己的 private goal,被要求兼顾角色一致性与对话自然性,也可以退出。但训练 preference 只依据 goal completion \> 6 \>6 \>6,没有联合优化 believability、social rules、relationship 等维度,存在单一目标 overoptimization 风险。 | | Figure 9 | 1.5B 模型的 episode/step reward dynamics | 1.5B 模型上 step reward 也比 episode reward 更早改善,说明机制不完全依赖强 base model。但 Table 5 和 Figure 9 都只有一个 seed,证据强度有限。 | | Figure 10 | 将训练延长到 300 step | WebShop 上 PRIME 和 vanilla baseline 后期出现波动;VisualSokoban 上 GiGPO 在约 220--270 step 明显退化,iStar 相对稳定。它支持 longer training stability,但仍缺多 seed confidence band。 | | Figure 11 | iStar+GRPO 与 vanilla GRPO | WebShop 增益中等,VisualSokoban 的学习速度和最终性能增益明显。说明即便不用 RLOO,step signal 仍然有效。 | | Figure 12 | 以 GPU hours 而非 training step 为横轴 | iStar 虽多训练一个 7B PRM,在同 GPU hours 下依然领先,说明 rollout 成本确实占大头、短轨迹能抵消部分 PRM 开销。但论文没有给显存峰值、tokens/s、PRM update 占比,因此不能据此说额外计算"很小"。两个完整 7B 模型及 optimizer state 对显存绝不便宜。 | Slides 共八页,没有新增实验:第 2 页把问题浓缩为 sparse/delayed、token-level non-Markovian、open-ended/unverifiable;第 3 页列出现有 process supervision 的四类缺陷;第 4 页突出 self-reinforcing loop;第 5 页只保留 trajectory DPO、BT decomposition 和两级 advantage;第 6、7 页展示主结果与训练曲线;第 8 页给出代码入口。最值得注意的是 slides 完全没有再提 v1 的 potential shaping、unbiased estimator 和 bounded gradient,这与最终论文收缩理论主张一致。 *** ** * ** *** ## 六、全部表格与实验结果怎么读 ### Table 1:WebShop 与 VisualSokoban 主结果 7B iStar 达到: * WebShop success: 86.5 ± 2.8 86.5\\pm2.8 86.5±2.8 * WebShop score: 93.6 ± 1.0 93.6\\pm1.0 93.6±1.0 * VisualSokoban success: 91.7 ± 1.2 91.7\\pm1.2 91.7±1.2 与最强 vanilla RL 相比: * WebShop success:GRPO 80.1 → 86.5,+6.4 个百分点; * WebShop score:GRPO 89.3 → 93.6,+4.3; * VisualSokoban:RLOO 86.3 → 91.7,+5.4。 与 GiGPO 相比: * WebShop success:84.1 → 86.5; * WebShop score:91.2 → 93.6; * VisualSokoban:85.9 → 91.7。 WebShop 上误差区间有明显重叠,因此"SOTA"没有表面数字那么决定性;VisualSokoban 的提升更可信。论文把经过 task-specific RL 的 7B 与纯 prompting 的 GPT-5、Claude 等比较,也不能被解读为"7B iStar 超越 GPT-5 的通用 Agent 能力",它只说明专门训练在这两个 benchmark 上极其有效。[实验表与配置](https://proceedings.iclr.cc/paper_files/paper/2026/file/d1e6739f319be4ba8e748cc05f23bba1-Paper-Conference.pdf) ### Table 2:SOTOPIA 以 Llama3.1-8B 为例: * Self-chat hard:GRPO 7.92 → iStar 8.06; * GPT-4o partner hard:6.68 → 7.16。 论文把它们称作提升 14% 和 48%,这是不规范甚至具有误导性的口径: 8.06 − 7.92 = 0.14 , 7.16 − 6.68 = 0.48. 8.06-7.92=0.14, \\qquad 7.16-6.68=0.48. 8.06−7.92=0.14,7.16−6.68=0.48. 由于量表是 0--10: * 前者是 +1.4 个满分归一化百分点,relative improvement 为 0.14 / 7.92 = 1.77 % 0.14/7.92=1.77\\% 0.14/7.92=1.77%; * 后者是 +4.8 个满分归一化百分点,relative improvement 为 0.48 / 6.68 = 7.19 % 0.48/6.68=7.19\\% 0.48/6.68=7.19%。 不能说成常规意义的 +14% 与 +48%。 此外,Llama+iStar 在 self-chat 上超过 GPT-5 prompting,但在 GPT-4o-partner setting 中仍低于 GPT-5。这不是跨所有设置的全面 SOTA。 ### Table 3:核心消融 VisualSokoban: * RLOO:85.9 * 加环境原始 process reward:87.5 * 直接 merge outcome 与 implicit reward:88.3 * token-level implicit reward:89.1 * 完整 iStar:93.0 这支持三个判断: 1. 有 dense reward 不等于做好 credit assignment; 2. step-level 比 token-level 更适合多轮 Agent; 3. 分别标准化 A E A\^E AE、 A S A\^S AS 后再融合,优于先把 reward 粗暴相加。 但它只用一个 seed,而且 merged-reward baseline 的具体尺度处理没有充分交代,所以"advantage-level fusion 必然最优"还只是经验结论。 ### Table 4: α , β \\alpha,\\beta α,β 敏感性 固定 β = 0.05 \\beta=0.05 β=0.05: * α = 0.5 \\alpha=0.5 α=0.5:79.7 * α = 0.8 \\alpha=0.8 α=0.8:84.4 * α = 1.0 \\alpha=1.0 α=1.0:89.1 * α = 1.2 \\alpha=1.2 α=1.2:85.9 * α = 2.0 \\alpha=2.0 α=2.0:78.1 这是典型的"PRM signal 有用,但不可过度相信"。 α \\alpha α 太大时,模型会为了局部 PRM score 牺牲最终任务成功,即 proxy overoptimization。 固定 α = 1 \\alpha=1 α=1 时, β = 0.05 \\beta=0.05 β=0.05 最好;但 β = 0.5 \\beta=0.5 β=0.5 的 WebShop score 同样为 94.7、success 较低,说明 β \\beta β 也会改变 success/partial-credit 的权衡,而不是简单单调关系。 ### Table 5:1.5B 模型 Qwen2.5-1.5B: * RLOO:71.9 * GiGPO:72.7 * PRIME:74.2 * iStar:80.5 说明弱模型生成的早期轨迹质量较低时,已有 PRM 仍可能提供非零信号。不过只有一个 seed。 ### Table 6:DPO 与 online RL SOTOPIA self-chat: * SFT + offline DPO:6.40 * SFT + online DPO:6.68 * GRPO:7.92 * GRPO+iStar:8.06 它说明"直接用 multi-turn DPO 训练 policy"不等于"用 DPO 训练 PRM,再由 RL 更新 policy"。后者同时保留在线探索和 outcome objective。但 DPO baseline 额外经过 SFT,训练起点与预算并不完全一致,所以不是非常干净的 apples-to-apples comparison。 ### Table 7:去掉 policy KL * iStar without KL:89.1 / 94.7 * iStar with KL:82.8 / 92.0 WebShop 上去掉 KL 有利于脱离初始 LM、探索任务特定行为。但只有一个任务、没有通用能力回归评测,也没有 safety/format drift 测试。把这个结论移植到企业 Agent 或医疗 Agent 时必须保守。 *** ** * ** *** ## 七、与经典算法的本质比较 | 方法 | Credit/advantage 来源 | 粒度 | 是否需要额外模型 | 主要优点 | 主要问题 | |-----------|------------------------------------------|-------------------------------:|----------:|--------------------------------------------|------------------------------------------------| | REINFORCE | Monte-Carlo return G t G_t Gt | trajectory/step return | 否 | 简单、无 critic | 方差极高,成功轨迹中的所有动作容易一起强化 | | PPO + GAE | V ( s ) V(s) V(s)、TD residual、GAE | environment step | 需要 critic | 有真实 temporal propagation,bias--variance 可调 | critic 成本高,长语言状态下 value learning 困难 | | GRPO | 同 prompt 多个 response 的组内 reward baseline | 通常 trajectory reward 广播到 token | 否 | critic-free、实现简单 | all-correct/all-wrong group advantage collapse | | RLOO | leave-one-out reward baseline | trajectory | 否 | baseline 对单个样本污染更小 | 仍没有局部 step credit | | DPO | chosen/rejected response log-ratio | response/trajectory | 否 | 偏好学习稳定,不需要 RL rollout | 通常是离线直接改 policy,不能自然处理在线探索 | | PRIME | outcome label 训练 implicit PRM | token | 需要 PRM | 不要人工 process labels | token signal 在长 Agent trajectory 中可能过细、过噪 | | GiGPO | 相同中间状态下的局部 group comparison | step | 否 | 局部 counterfactual 更干净,开销低 | 依赖 exact state overlap,开放语言环境很难 | | iStar | trajectory DPO 学到的 PRM log-ratio | action/turn | 需要完整 PRM | 不要求 step label、相同状态或额外 branch rollout | 不是因果 credit,额外模型昂贵,依赖 outcome preference 质量 | REINFORCE 的经典梯度为: ∇ θ J = E τ \[ ∑ t ∇ θ log ⁡ π θ ( a t ∣ s t ) G t \] . \\nabla_\\theta J =\\mathbb E_\\tau \\left\[ \\sum_t \\nabla_\\theta\\log\\pi_\\theta(a_t\\mid s_t) G_t \\right\]. ∇θJ=Eτ\[t∑∇θlogπθ(at∣st)Gt\]. iStar 相当于把权重换成: A t = A E ( τ ) + α A S ( a t ) . A_t =A\^E(\\tau)+\\alpha A\^S(a_t). At=AE(τ)+αAS(at). PPO+GAE 则会构造: δ t = r t + γ V ( s t + 1 ) − V ( s t ) . \\delta_t =r_t+\\gamma V(s_{t+1})-V(s_t). δt=rt+γV(st+1)−V(st). A t G A E = ∑ ℓ = 0 ∞ ( γ λ ) ℓ δ t + ℓ . A_t\^{\\mathrm{GAE}} =\\sum_{\\ell=0}\^{\\infty} (\\gamma\\lambda)\^\\ell\\delta_{t+\\ell}. AtGAE=ℓ=0∑∞(γλ)ℓδt+ℓ. GAE 明确传播未来 reward,并通过 λ \\lambda λ 控制 bias--variance;iStar 没有这种 Bellman/temporal-return 结构,它依赖 PRM 从整体轨迹偏好中隐式学出"哪些局部模式与好结果相关"。[GAE 原论文](https://arxiv.org/abs/1506.02438) GRPO 取消 critic,用同 prompt 的 group reward 建 baseline;iStar 保留这一宏观 advantage,再叠加局部 PRM advantage。[GRPO/DeepSeekMath](https://arxiv.org/abs/2402.03300) RLOO 使用: ##

A_i^{\mathrm{RLOO}}

r_i-\frac{1}{N-1}\sum_{j\ne i}r_j.

$$

而不是让样本自己的 reward 参与自己的 baseline。论文默认 WebShop/Sokoban 用 RLOO,但为了通用表达,式(3)主要写成了 GRPO 风格。RLOO 原论文

PRIME 与 iStar 都来自 DPO implicit reward,但 PRIME 强调 token-level process reinforcement;iStar 把 action segment 当成决策单位,并把 binary CE 改成 trajectory pairwise DPO。PRIME 原论文

GiGPO 的 micro advantage 来自相同 anchor state 的局部动作组,是真正更接近 counterfactual comparison 的方法;iStar 的优势是跨开放状态泛化,不要求 state collision。GiGPO 原论文

DAPO 与 iStar基本正交:DAPO 解决 clip、动态采样、token-level loss、过长轨迹等优化问题;iStar解决 credit signal。理论上可以:

iStar step advantage + DAPO policy objective . \text{iStar step advantage} + \text{DAPO policy objective}. iStar step advantage+DAPO policy objective.


八、训练配置与复现时必须知道的细节

论文配置为:

  • Policy LR: 5 × 10 − 7 5\times10^{-7} 5×10−7
  • PRM LR: 10 − 6 10^{-6} 10−6
  • Batch size:64
  • Micro-batch:8
  • Rollout group size:8
  • α = 1.0 \alpha=1.0 α=1.0
  • β = 0.05 \beta=0.05 β=0.05
  • 8×A100
  • WebShop:16 groups,共 128 environments
  • VisualSokoban:32 groups,共 256 environments
  • WebShop/Sokoban:200 training steps
  • SOTOPIA:800 steps
  • WebShop prompt length 4096,Sokoban 1024,SOTOPIA 6144
  • Response length分别为 512、512、2048
  • Rollout temperature:前两者 1.0,SOTOPIA 0.7
  • Validation temperature:0.4
  • Invalid action penalty: − 0.1 -0.1 −0.1

现实成本不能被"critic-free"三个字迷惑:虽然 base RL 用 RLOO/GRPO 没有 critic,但 iStar 引入了一个完整 PRM。对于 7B 模型,全参数训练时 PRM 的参数、梯度和 optimizer state 仍是显著开销。它只是把 value model 换成 preference model,不是消灭了额外模型。


九、论文级伪代码

下面先严格按照最终论文的 one-iteration-lag 逻辑:当前 batch 用上一轮已经训练好的 PRM 产生 step reward,然后用当前 preference pairs 更新 PRM,供下一轮使用。

text 复制代码
Algorithm: iStar with a GRPO/PPO-style policy objective

Input:
    task distribution p(X)
    initial policy πθ_init
    outcome verifier r_o
    rollout group size N
    step-weight α
    DPO temperature β
    PPO clip ε
    training iterations M

Initialize:
    πθ      ← πθ_init
    πold    ← πθ_init
    πφ      ← πθ_init          # implicit PRM

for iteration = 1 ... M:

    # 1. Collect grouped multi-turn trajectories
    sample prompts x_b ~ p(X)
    for each prompt x_b:
        initialize N identical environments

        for each environment i = 1 ... N:
            repeat until terminal or max_steps:
                sample reasoning-action segment
                    a_t^i ~ πold(. | history_t^i, x_b)
                execute a_t^i
                receive environment observation o_{t+1}^i

            store trajectory τ_i

    # 2. Obtain outcome rewards and preferences
    for each trajectory τ_i:
        R_i ← r_o(τ_i)

    construct preferred/rejected pairs (τ+, τ−)
        using R+ > R− or an environment-specific threshold

    # 3. Score steps with the current/lagged PRM
    for every agent-controlled action segment a_t^i:
        logp_prm ← log πφ(a_t^i | history_t^i, x_b)
        logp_old ← log πold(a_t^i | history_t^i, x_b)

        r_step[t, i] ← β * (logp_prm - logp_old)

    # Environment/tool observation tokens are masked out.

    # 4. Update implicit PRM with trajectory-level DPO
    for each pair (τ+, τ−):
        s_pos ← β * [log πφ(τ+ | x) - log πold(τ+ | x)]
        s_neg ← β * [log πφ(τ− | x) - log πold(τ− | x)]

    L_PRM ← mean[-log sigmoid(s_pos - s_neg)]
    φ ← optimizer_PRM.step(∇φ L_PRM)

    # 5. Compute two-level advantages
    for each prompt group:
        A_episode[i] ← zscore({R_1, ..., R_N})[i]

        all_step_rewards ← {r_step[t, i] for all valid i,t}
        A_step[t, i] ← zscore(all_step_rewards)[t, i]

        A_final[t, i] ← A_episode[i] + α * A_step[t, i]

    # 6. Update policy
    for every valid action segment a_t^i:
        ratio[t, i] ←
            πθ(a_t^i | history_t^i, x_b)
            / πold(a_t^i | history_t^i, x_b)

        unclipped ← ratio[t, i] * A_final[t, i]
        clipped   ← clip(ratio[t, i], 1-ε, 1+ε) * A_final[t, i]

    L_policy ← -mean(min(unclipped, clipped))
    θ ← optimizer_policy.step(∇θ L_policy)

    # 7. Refresh rollout/reference policy
    θold ← θ

return πθ, πφ

一个最小的 PyTorch 风格核心实现可以写成:

python 复制代码
import torch
import torch.nn.functional as F


def masked_zscore(x: torch.Tensor,
                  mask: torch.Tensor,
                  eps: float = 1e-6) -> torch.Tensor:
    """Z-score only over valid trajectory/action positions."""
    valid = x[mask]
    mean = valid.mean()
    std = valid.std(unbiased=False).clamp_min(eps)

    out = torch.zeros_like(x)
    out[mask] = (valid - mean) / std
    return out


def trajectory_dpo_loss(
    prm_logp_pos: torch.Tensor,
    old_logp_pos: torch.Tensor,
    prm_logp_neg: torch.Tensor,
    old_logp_neg: torch.Tensor,
    beta: float,
) -> torch.Tensor:
    pos_score = beta * (prm_logp_pos - old_logp_pos)
    neg_score = beta * (prm_logp_neg - old_logp_neg)
    return -F.logsigmoid(pos_score - neg_score).mean()


def istar_policy_loss(
    new_action_logp: torch.Tensor,
    old_action_logp: torch.Tensor,
    episode_reward: torch.Tensor,
    implicit_step_reward: torch.Tensor,
    action_mask: torch.Tensor,
    alpha: float = 1.0,
    clip_eps: float = 0.2,
) -> torch.Tensor:
    # episode_reward: [group]
    episode_adv = (
        episode_reward - episode_reward.mean()
    ) / episode_reward.std(unbiased=False).clamp_min(1e-6)

    # Broadcast each trajectory advantage to its valid actions.
    episode_adv = episode_adv[:, None].expand_as(implicit_step_reward)

    step_adv = masked_zscore(
        implicit_step_reward,
        action_mask,
    )

    advantage = (episode_adv + alpha * step_adv).detach()

    # Action/segment-level importance ratio.
    ratio = torch.exp(new_action_logp - old_action_logp)

    unclipped = ratio * advantage
    clipped = torch.clamp(
        ratio,
        1.0 - clip_eps,
        1.0 + clip_eps,
    ) * advantage

    objective = torch.minimum(unclipped, clipped)
    return -objective[action_mask].mean()

真实实现还有四个不能省略的保护:

python 复制代码
# 1. observation/tool-return tokens must not enter policy/PRM log-prob sums
loss_mask = assistant_action_mask & ~environment_token_mask

# 2. skip or specially handle zero-variance outcome groups
if episode_reward.std(unbiased=False) < 1e-6:
    episode_adv.zero_()

# 3. cache PRM scores before updating PRM if following the paper's lagged design
step_reward = compute_step_reward(prm, old_policy).detach()
update_prm_with_dpo(...)

# 4. monitor action-token length because summed log-ratio is length-sensitive
segment_log_ratio = token_log_ratio.masked_fill(~loss_mask, 0).sum(-1)

这篇论文最值得学的不是"DPO 又有一个新公式",而是以下工程思想:

不要求昂贵 step labels,也不做额外 branching rollout,而是把在线 outcome preference 压缩进一个会随 policy 一起演化的 PRM;再把 PRM 的 action-level relative preference 当作局部 shaping signal,与全局 outcome advantage 同时使用。

它的核心创新是真实的,尤其适合开放语言 Agent 中 exact-state grouping 几乎不可能的场景;VisualSokoban 的实验也相当有说服力。但论文没有真正解决 causal credit assignment,理论贡献主要是 log-probability factorization;SOTOPIA 的百分比表述明显夸大;one-seed ablation、移动 reward scale、action-length bias、跨模态 PRM 条件化、额外显存成本以及 judge noise 都没有被充分解决。


具有隐式步骤奖励的智能体强化学习

  • 英文原题: Agentic Reinforcement Learning with Implicit Step Rewards
  • 方法名称: iStar
  • 作者: Xiaoqian Liu、Ke Wang、Yuchuan Wu、Fei Huang、Yongbin Li、Junge Zhang、Jianbin Jiao
  • 单位: 中国科学院大学;通义实验室;中国科学院自动化研究所
  • 原文版本: arXiv:2509.19199v3,2025 年 9 月 28 日
  • 联系邮箱: liuxiaoqian23@mails.ucas.ac.cn;{wk258730, shengxiu.wyc, shuide.lyb}@alibaba-inc.com

译稿说明。 本文档按照原论文的章节顺序进行完整中文翻译,保留公式编号、表格数值、算法步骤、图号、脚注和引用。PRM、DPO、GRPO、RLOO 等常用缩写保留英文,并在首次出现时给出中文释义。为保证检索准确性,参考文献的作者、论文名、会议与链接保留原始语言;图中英文标签在图后另列中文对照。本译稿仅在明确标记为"译者注"时加入补充说明,其余内容均对应作者原文。

摘要

大语言模型(Large Language Models,LLMs)正越来越多地通过强化学习被开发为自主智能体,即智能体强化学习(agentic reinforcement learning,agentic RL);这些智能体能够在交互式环境中进行推理并采取行动。然而,奖励信号稀疏、而且有时无法被客观验证,这使得以 LLM 智能体作为策略进行训练时的信用分配(credit assignment)异常困难。近期工作尝试把过程监督引入强化学习,但仍受到多方面限制:人工标注带来的偏差、奖励黑客(reward hacking)、过细粒度奖励导致的高方差,以及在状态重合十分罕见时方法失效等。为此,我们提出用于智能体强化学习的隐式步骤奖励方法 iStar。它是一种通用的信用分配策略,无需额外 rollout,也不依赖显式步骤标签,并且能够无缝集成到标准强化学习算法中。具体而言,我们让一个隐式过程奖励模型(Process Reward Model,PRM)与策略模型交替优化,并使用基于轨迹的 DPO(Direct Preference Optimization,直接偏好优化)目标生成隐式步骤奖励。理论分析表明,这一学习目标能够产生逐步骤奖励函数。随后,我们利用隐式步骤奖励计算步骤级优势,并将其与轨迹级(或回合级)优势结合起来更新策略,由此形成一个自我强化的训练闭环。我们在三个具有挑战性的智能体基准上评估了该方法,包括 WebShop、VisualSokoban,以及 SOTOPIA 中带有不可验证奖励的开放式社会交互任务。关键结果表明,iStar 在多个领域都优于前沿 LLM 和强强化学习基线,并以更高的样本效率和训练稳定性取得了当前最优结果。进一步分析还表明,iStar 在步骤级和回合级奖励同时提高的情况下,能够以更少的步骤完成任务,从而实现更高效的探索。代码将于近期发布。

1 引言

LLM 正迅速从被动的文本生成器演化为能够在长时间跨度内推理、行动并调整策略的自主智能体,其应用包括搜索智能体(Jin et al., 2025;OpenAI, 2025a)、移动端与网页导航智能体(Furuta et al., 2024;Bai et al., 2024)、软件工程助手(Yang et al., 2025;Wei et al., 2025a),以及社会智能或具身智能系统(Liu et al., 2025;Lu et al., 2025)。传统的 LLM 强化学习后训练通常面对静态、单轮任务(Ouyang et al., 2022;Shao et al., 2024),而在交互式环境中训练 LLM 智能体会遇到一些特有困难。第一,奖励通常稀疏且延迟出现,因此难以判断中间动作应当获得多少信用。第二,轨迹很长,而且在 token 层面并不满足简单的马尔可夫性质;每一步通常同时包含一段思维链(Chain-of-Thought,CoT)(Wei et al., 2022)和一个可执行动作,如果把信用进一步分摊到每个 token,估计方差就会显著放大。第三,环境和交互对手具有非平稳性与开放性,而且常常只提供不可验证的奖励,例如对话任务中的评分。因此,只使用单一结果奖励进行轨迹级优化(Wang et al., 2025;Wei et al., 2025b)会遭遇严重的信用分配问题,最终造成策略学习方差过高、探索过程脆弱,并限制强化学习在智能体任务上的收益。

近期研究主要尝试通过强化学习中的过程监督解决上述问题。例如,Zeng et al.(2025)、Zou et al.(2025)和 Zhang et al.(2025b)在中间步骤提供更密集的反馈,但需要人工设计或标注步骤标签;这种做法成本高、带有偏差,也容易受到奖励黑客攻击。生成式奖励模型(Generative Reward Models,GRMs),例如 LLM-as-a-Judge(Liu et al., 2025;Zha et al., 2025),通过预测每一步的关键性或正确性降低了标注负担,但其判断可能存在噪声,而且跨领域一致性较差。隐式 PRM(Yuan et al., 2025;Cui et al., 2025)在单轮任务中具有帮助,但 token 级过程奖励对于智能体训练往往过于细碎;随着轨迹增长,它会放大方差并破坏训练稳定性。另一些方法(Feng et al., 2025;Choudhury, 2025)通过把完全相同状态下的样本分组来计算步骤级优势,但在开放式语言环境中,状态精确重合非常少见,因此这一假设通常不成立。综合来看,这些限制引出了智能体强化学习中的一个核心问题:能否设计一种既节省步骤标签、又训练稳定的信用分配策略,使其能够扩展到多轮交互,并且在开放环境中对可验证和不可验证的奖励都保持稳健与泛化能力?

为解决这一问题,我们提出用于智能体强化学习的隐式步骤奖励方法 iStar。iStar 使用在线采集的轨迹联合训练隐式 PRM 与策略模型,也就是 LLM 智能体。在每一个训练步骤中,策略模型首先生成若干 rollout;结果奖励验证器或结果奖励模型根据最终表现对这些轨迹排序,由此构造正、负轨迹对。随后,隐式 PRM 使用基于轨迹的 DPO 目标在这些轨迹对上进行优化。更新后的 PRM 通过比较某个动作在 PRM 与上一版策略快照中的相对偏好,为每一个动作生成隐式步骤奖励。因为奖励按步骤计算,所以它能够提供密集反馈来引导探索,同时又没有细化到 token 级,从而有助于控制方差。在训练策略模型时,我们结合两种互补的优势:一种是由结果奖励计算的回合级优势,另一种是由隐式步骤奖励计算的步骤级优势;前者反映全局任务是否成功,后者刻画单个动作的贡献。iStar 可以兼容 GRPO(Shao et al., 2024)、RLOO(Ahmadian et al., 2024)、DAPO(Yu et al., 2025)等多种现有强化学习算法,而且不需要人工标注步骤,也不需要额外 rollout。

与已有工作相比,我们的方法从几个方面缓解了先前方法的限制。第一,iStar 不需要人工步骤标签,而是通过基于轨迹的 DPO 目标学习隐式奖励,从而提供步骤级信用;该目标能够被证明等价于从轨迹偏好中学习一个逐步骤奖励函数,详见第 3.2 节。第二,与 token 级隐式奖励(Cui et al., 2025)相比,iStar 在步骤级学习隐式奖励,因此能够提升多轮强化学习的稳定性。第三,iStar 只依赖轨迹偏好,而轨迹偏好既可以由可验证的结果奖励产生,也可以由不可验证的结果评分模型产生;因此,它能够在不同领域中提供统一的信用分配方案。

三个高难度智能体基准上的实验表明,iStar 优于前沿 LLM 与强强化学习基线,并在 WebShop 和 VisualSokoban 上取得当前最优结果。在包含不可验证奖励的开放式社会交互环境 SOTOPIA 中,iStar 在 self-chat 设置下使目标完成度最高提升 14%,在与 GPT-4o 交互时最高提升 48%(OpenAI, 2024)。该方法还可以插接到不同的强化学习算法中并改善其性能。进一步分析显示,与原始强化学习方法和 token 级 PRM 基线(Cui et al., 2025)相比,iStar 具有更高的样本效率和训练稳定性;与此同时,它能同时提高步骤级奖励与回合级奖励,并以更少步骤实现目标,体现出更高的探索效率。

2 预备知识

任务形式化

我们把 LLM 智能体任务视为一个多步骤决策过程。给定任务提示 x ∈ p ( X ) x\in p(X) x∈p(X),智能体需要通过连续决策与环境交互,以实现一个长期目标。在时间步 t t t,智能体从环境接收观测 o t o_{t} ot,并生成一个文本动作 a t ∈ V L a_{t}\in\mathcal{V}^{L} at∈VL;其中, V \mathcal{V} V 表示 token 词表, L L L 表示最大生成长度。环境随后返回标量奖励 r t r_{t} rt 并转移到下一个状态。直到最后一个时间步 T T T,完整回合构成轨迹

τ = { ( o 1 , a 1 , r 1 ) , ... , ( o T , a T , r T ) } \tau=\{(o_1,a_1,r_1),\ldots,(o_T,a_T,r_T)\} τ={(o1,a1,r1),...,(oT,aT,rT)}

不过,在现实任务中,奖励可能既稀疏又延迟,例如只在整条轨迹结束时提供反馈。

脚注 1。 本文通过提示要求 LLM 智能体在执行动作之前先生成推理过程,因此每个时间步中的 a t a_{t} at 指由"推理文本 + 实际动作"共同构成的完整序列。

面向 LLM 的强化学习

强化学习通过优化 LLM 智能体策略 π θ ( a t ∣ o 1 : t , x ) \pi_{\theta}(a_{t}\mid o_{1:t},x) πθ(at∣o1:t,x) 来解决上述任务,其目标是在多轮交互期间最大化期望累计奖励。实践中通常使用策略梯度方法,例如 PPO(Schulman et al., 2017)、GRPO(Shao et al., 2024)、RLOO(Ahmadian et al., 2024)和 REINFORCE++(Hu et al., 2025)。这些强化学习算法的主要差异在于如何估计策略更新所需的优势。PPO 使用学习得到的价值函数,并通过广义优势估计(Generalized Advantage Estimation,GAE)计算优势。GRPO 和 RLOO 不训练 critic,而是针对同一个输入提示生成一组 N N N 个响应,并在组内构造相对优势。GRPO 使用组均值对每个奖励进行中心化,通常还会进行归一化;RLOO 则使用 leave-one-out,即排除当前样本后的组均值。REINFORCE++ 使用批量归一化后的奖励作为基线奖励。

图 1:iStar 总体框架。 在每一个训练步骤中,LLM 智能体与环境交互并生成多步骤 rollout。结果奖励验证器或模型对这些 rollout 排序,以构造正、负轨迹对。系统利用这些轨迹对,通过基于轨迹的 DPO 目标训练隐式 PRM;隐式 PRM 随后为智能体生成的每一个动作提供隐式步骤奖励。最后,利用隐式步骤奖励计算步骤级优势,利用结果奖励计算回合级优势,并通过强化学习优化 LLM 智能体,也就是策略模型。

图内术语对照: Environment=环境;Observations=观测;Actions=动作;LLM Agent / Policy Model=LLM 智能体 / 策略模型;Multi-Step Rollouts=多步骤 rollout;Outcome Reward Verifier/Model=结果奖励验证器/模型;Implicit Process Reward Model=隐式过程奖励模型;Implicit Step Rewards=隐式步骤奖励;Trajectory-based DPO Update=基于轨迹的 DPO 更新;RL Update=强化学习更新。

隐式奖励建模

隐式奖励使模型无需显式奖励标签即可推断奖励,已被证明能够有效用于 LLM 对齐中的奖励建模(Ethayarajh et al., 2024;Wu et al., 2025;Zhang et al., 2025a)。此类隐式奖励可用于评价模型输出的质量,DPO 就是一个典型例子(Rafailov et al., 2024b)。进一步地,Rafailov et al.(2024a)证明 DPO 能够自动学习一个 Q 函数。除了把隐式模型当作奖励模型或 Q 函数之外,近期研究还把 token 级隐式奖励用于测试时重排序(Yuan et al., 2025)或单轮强化学习(Cui et al., 2025):

r ϕ ( y t ) : = β log ⁡ π ϕ ( y t ∣ y < t ) π r e f ( y t ∣ y < t ) r_\phi(y_t):=\beta\log\frac{\pi_\phi(y_t\mid y_{<t})}{\pi_{\mathrm{ref}}(y_t\mid y_{<t})} rϕ(yt):=βlogπref(yt∣y<t)πϕ(yt∣y<t)

其中, π ϕ \pi_{\phi} πϕ 表示 token 级奖励模型, π r e f \pi_{\mathrm{ref}} πref 表示参考模型, y t y_{t} yt 表示响应 y y y 中的第 t t t 个 token。

3 方法

本节首先概述方法,并定义用于智能体强化学习的隐式步骤奖励;随后给出理论分析,说明 iStar 中隐式 PRM 的学习目标为什么能够产生逐步骤奖励函数。

3.1 方法概述

iStar 中包含一个与策略模型(LLM 智能体)交替优化的隐式 PRM。它把"更偏好较优动作"的倾向转换为密集的步骤奖励,从而引导智能体进行探索并持续改进。图 1 展示了完整训练流程。隐式 PRM 与策略模型之间的交替优化构成一个自我强化训练闭环,使二者能够迭代地相互促进。下面先定义隐式步骤奖励,再分别说明隐式 PRM 和策略模型的训练过程。iStar 的详细算法见附录 A。

图 2:iStar 的信用分配策略。 在本方法中,回合级优势 A E ( τ ) A^{E}(\tau) AE(τ) 由结果奖励 r o ( τ ) r_{o}(\tau) ro(τ) 计算;步骤级优势 A S ( a ) A^{S}(a) AS(a) 则由隐式 PRM 产生的隐式步骤奖励 r ϕ ( a ) r_{\phi}(a) rϕ(a) 计算。策略更新使用的最终优势是这两个层级优势的组合。

图内术语对照: Step 1 ... Step T=步骤 1 至步骤 T;Add=相加;三行分别表示从同一初始状态采样得到的不同轨迹;每个轨迹先得到各步骤的 r ϕ ( a ) r_{\phi}(a) rϕ(a) 和整条轨迹的 r o ( τ ) r_{o}(\tau) ro(τ),再分别转换为 A S ( a ) A^{S}(a) AS(a) 与 A E ( τ ) A^{E}(\tau) AE(τ)。

隐式步骤奖励

设 τ = ( o 1 , a 1 , ... , o T , a T ) \tau=(o_{1},a_{1},\ldots,o_{T},a_{T}) τ=(o1,a1,...,oT,aT) 是由使用策略 π θ \pi_{\theta} πθ 的 LLM 智能体生成的一条轨迹。对于轨迹中时间步 t t t 的动作 a t a_{t} at,其隐式步骤奖励定义为

r ϕ ( o 1 : t , a t ) = β log ⁡ π ϕ ( a t ∣ o 1 : t , x ) π θ o l d ( a t ∣ o 1 : t , x ) (1) r_\phi(o_{1:t},a_t)=\beta\log\frac{\pi_\phi(a_t\mid o_{1:t},x)}{\pi_{\theta_{\mathrm{old}}}(a_t\mid o_{1:t},x)}\qquad\text{(1)} rϕ(o1:t,at)=βlogπθold(at∣o1:t,x)πϕ(at∣o1:t,x)(1)

其中, π ϕ \pi_{\phi} πϕ 表示隐式 PRM, π θ o l d \pi_{\theta_{\mathrm{old}}} πθold 表示策略 π θ \pi_{\theta} πθ 的上一版快照, β ∈ 0 , 1 \beta\in0,1 β∈0,1 是用于缩放奖励的温度系数。隐式步骤奖励衡量的是:相对于旧策略,刚刚学习得到的 PRM 认为当前动作的概率提高了多少。正值表示 π ϕ \pi_{\phi} πϕ 认为该动作应当为近期性能提升承担正向贡献;负值则标识应当抑制的动作。

通过基于轨迹的 DPO 优化隐式 PRM

为了实现可扩展的在线强化学习,我们使用由策略 π θ \pi_{\theta} πθ 采样得到的正、负轨迹对训练隐式 PRM π ϕ \pi_{\phi} πϕ,并构造如下基于轨迹的 DPO 目标:

J P R M ( ϕ ) = − E x ∼ p ( X ) ,   ( τ + , τ − ) ∼ π θ o l d log ⁡ σ ( β log ⁡ π ϕ ( τ + ∣ x ) π θ o l d ( τ + ∣ x ) − β log ⁡ π ϕ ( τ − ∣ x ) π θ o l d ( τ − ∣ x ) ) (2) \mathcal{J}{\mathrm{PRM}}(\phi)=-\mathbb{E}{x\sim p(X),\,(\tau^+,\tau^-)\sim\pi_{\theta_{\mathrm{old}}}}\left\\log\\sigma\\left(\\beta\\log\\frac{\\pi_\\phi(\\tau\^+\\mid x)}{\\pi_{\\theta_{\\mathrm{old}}}(\\tau\^+\\mid x)}-\\beta\\log\\frac{\\pi_\\phi(\\tau\^-\\mid x)}{\\pi_{\\theta_{\\mathrm{old}}}(\\tau\^-\\mid x)}\\right)\\right\qquad\text{(2)} JPRM(ϕ)=−Ex∼p(X),(τ+,τ−)∼πθoldlogσ(βlogπθold(τ+∣x)πϕ(τ+∣x)−βlogπθold(τ−∣x)πϕ(τ−∣x))(2)

其中, σ \sigma σ 是 logistic sigmoid 函数, π ϕ \pi_{\phi} πϕ、 π θ o l d \pi_{\theta_{\mathrm{old}}} πθold 和 β \beta β 的含义与公式(1)一致。 τ + \tau^{+} τ+ 是相对于负轨迹 τ − \tau^{-} τ− 更受偏好的正轨迹,二者的标签由结果奖励验证器或结果奖励模型给出。特别地,公式(2)与原始 DPO 目标(Rafailov et al., 2024b)有两个主要区别。第一,我们把上一版策略快照 π θ o l d \pi_{\theta_{\mathrm{old}}} πθold 用作参考模型;该参考模型的参数会在训练过程中变化,而不是始终使用冻结的初始策略。第二,我们学习的是成对轨迹之间的偏好,而不是单次响应之间的偏好。第 3.2 节将说明,公式(2)等价于一个以逐步骤函数为奖励函数的 Bradley-Terry(BT)模型。

脚注 2。 在 WebShop 和 VisualSokoban 实验中,成功率大于 0 的轨迹被视为正轨迹;在 SOTOPIA 中,目标完成得分高于 6 的轨迹被视为正轨迹。

使用隐式步骤奖励学习策略

尽管本文方法兼容多种强化学习算法(Ahmadian et al., 2024;Hu et al., 2025;Yu et al., 2025;Zheng et al., 2025),这里使用 GRPO(Shao et al., 2024)说明如何把隐式步骤奖励整合进策略学习。如图 2 所示,对于每个任务提示 x x x,我们从当前策略 π θ \pi_{\theta} πθ 采样一组 N N N 条轨迹 { τ 1 , ... , τ N } \{\tau_{1},\ldots,\tau_{N}\} {τ1,...,τN},并通过结果奖励验证器或模型得到相应的结果奖励 { r o ( τ 1 ) , ... , r o ( τ N ) } \{r_{o}(\tau_{1}),\ldots,r_{o}(\tau_{N})\} {ro(τ1),...,ro(τN)}。然后,对这组轨迹计算回合级优势:

A E ( τ i ) = r o ( τ i ) − mean ⁡ ( R o ) std ⁡ ( R o ) , R o = { r o ( τ i ) } i = 1 N (3) A^E(\tau_i)=\frac{r_o(\tau_i)-\operatorname{mean}(R_o)}{\operatorname{std}(R_o)},\quad R_o=\{r_o(\tau_i)\}_{i=1}^{N}\qquad\text{(3)} AE(τi)=std(Ro)ro(τi)−mean(Ro),Ro={ro(τi)}i=1N(3)

接下来,使用上一训练步骤更新得到的最新隐式 PRM π ϕ \pi_{\phi} πϕ,按照公式(1)获得每个动作 a t i a_{t}^{i} ati 的隐式步骤奖励,并计算步骤级优势:

A S ( a t i ) = r ϕ ( a t i ) − mean ⁡ ( R s ) std ⁡ ( R s ) , R s = ⋃ i , t { r ϕ ( a t i ) } (4) A^S(a_t^i)=\frac{r_\phi(a_t^i)-\operatorname{mean}(R_s)}{\operatorname{std}(R_s)},\quad R_s=\bigcup_{i,t}\{r_\phi(a_t^i)\}\qquad\text{(4)} AS(ati)=std(Rs)rϕ(ati)−mean(Rs),Rs=i,t⋃{rϕ(ati)}(4)

R s R_{s} Rs 表示这 N N N 条轨迹中全部步骤奖励构成的集合。特别地,当一组轨迹从同一个初始状态,也就是同一个任务提示出发时,我们可以得到多种反事实情形。这有助于更准确、稳定地估计状态价值基线,进而更好地衡量动作 a t i a_{t}^{i} ati 的优势。反过来,在单条轨迹中,不同动作发生在不同状态下,而且会受到智能体所用策略带来的特定噪声影响,因此优势估计具有较高方差。

得到回合级优势和步骤级优势后,我们把二者结合起来更新策略:

A ( a t i ) = A E ( τ i ) + α A S ( a t i ) (5) A(a_t^i)=A^E(\tau_i)+\alpha A^S(a_t^i)\qquad\text{(5)} A(ati)=AE(τi)+αAS(ati)(5)

其中, α \alpha α 是平衡两个层级优势的超参数。最终优势不仅能区分有利轨迹与不利轨迹,还能在从同一初始状态出发的一组轨迹内部,区分有益步骤与有害步骤,从而为长时程策略学习提供更密集的奖励。

最终,给定优势 A ( a t i ) A(a_{t}^{i}) A(ati),使用 Schulman et al.(2017)和 Shao et al.(2024)中广泛采用、但不包含 KL 散度惩罚的代理目标训练策略模型 π θ \pi_{\theta} πθ:

J p o l i c y ( θ ) = E x ∼ p ( X ) ,   { τ i } i = 1 N ∼ π θ o l d 1 N T ∑ i = 1 N ∑ t = 1 T min ⁡ ( ρ θ ( a t i ) A ( a t i ) , clip ⁡ ( ρ θ ( a t i ) , 1 − ϵ , 1 + ϵ ) A ( a t i ) ) (6) \mathcal{J}{\mathrm{policy}}(\theta)=\mathbb{E}{x\sim p(X),\,\{\tau_i\}{i=1}^{N}\sim\pi{\theta_{\mathrm{old}}}}\left\\frac{1}{NT}\\sum_{i=1}\^{N}\\sum_{t=1}\^{T}\\min\\left(\\rho_\\theta(a_t\^i)A(a_t\^i),\\operatorname{clip}(\\rho_\\theta(a_t\^i),1-\\epsilon,1+\\epsilon)A(a_t\^i)\\right)\\right\qquad\text{(6)} Jpolicy(θ)=Ex∼p(X),{τi}i=1N∼πθoldNT1i=1∑Nt=1∑Tmin(ρθ(ati)A(ati),clip(ρθ(ati),1−ϵ,1+ϵ)A(ati))(6)

其中,

ρ θ ( a t i ) = π θ ( a t i ∣ o 1 : t i , x ) π θ o l d ( a t i ∣ o 1 : t i , x ) \rho_\theta(a_t^i)=\frac{\pi_\theta(a_t^i\mid o_{1:t}^i,x)}{\pi_{\theta_{\mathrm{old}}}(a_t^i\mid o_{1:t}^i,x)} ρθ(ati)=πθold(ati∣o1:ti,x)πθ(ati∣o1:ti,x)

是在步骤层面计算的重要性采样比, ϵ \epsilon ϵ 是控制重要性采样裁剪范围的超参数。步骤级重要性采样比与本文的隐式步骤奖励天然对齐,有助于降低多步骤 rollout 训练中的噪声方差,这一点与 Zheng et al.(2025)相似。

说明

隐式 PRM 与策略模型之间的交替优化建立了一个能够增强稳定性并加速收敛的训练闭环。具体来说,使用当前策略产生的 rollout 同时训练两个模型,可以使二者面对的数据分布大致一致,从而减小离策略偏差与协变量偏移。这样的分布一致性使隐式步骤奖励始终能够针对智能体当前行为完成校准,进而给出密集、低方差的信用信号,并防止隐式 PRM 过拟合或欠拟合,以保证训练稳定。最终形成的闭环是:更好的策略生成更高质量的偏好数据,偏好数据进一步改进隐式 PRM,而改进后的 PRM 又产生更准确的隐式步骤奖励来指导策略。

3.2 理论分析

下面说明公式(2)中的隐式 PRM 学习目标等价于一个使用逐步骤奖励函数的 BT 模型。形式化地说,对于任意轨迹对

{ τ i = { ( o t i , a t i ) } t = 1 T } i = 1 2 \{\tau_i=\{(o_t^i,a_t^i)\}{t=1}^{T}\}{i=1}^{2} {τi={(oti,ati)}t=1T}i=12

若二者满足 o 1 1 = o 1 2 o_{1}^{1}=o_{1}^{2} o11=o12,即具有相同任务提示 x x x,则有

P ( τ 1 ≻ τ 2 ) = σ ( ∑ t = 1 T β log ⁡ π ϕ ∗ ( a t 1 ∣ o 1 : t 1 , x ) π θ o l d ( a t 1 ∣ o 1 : t 1 , x ) − ∑ t = 1 T β log ⁡ π ϕ ∗ ( a t 2 ∣ o 1 : t 2 , x ) π θ o l d ( a t 2 ∣ o 1 : t 2 , x ) ) P(\tau_1\succ\tau_2)=\sigma\left(\sum_{t=1}^{T}\beta\log\frac{\pi_{\phi^*}(a_t^1\mid o_{1:t}^1,x)}{\pi_{\theta_{\mathrm{old}}}(a_t^1\mid o_{1:t}^1,x)}-\sum_{t=1}^{T}\beta\log\frac{\pi_{\phi^*}(a_t^2\mid o_{1:t}^2,x)}{\pi_{\theta_{\mathrm{old}}}(a_t^2\mid o_{1:t}^2,x)}\right) P(τ1≻τ2)=σ(t=1∑Tβlogπθold(at1∣o1:t1,x)πϕ∗(at1∣o1:t1,x)−t=1∑Tβlogπθold(at2∣o1:t2,x)πϕ∗(at2∣o1:t2,x))

P ( τ 1 ≻ τ 2 ) = σ ( ∑ t = 1 T r ϕ ∗ ( o 1 : t 1 , a t 1 ) − ∑ t = 1 T r ϕ ∗ ( o 1 : t 2 , a t 2 ) ) (7) P(\tau_1\succ\tau_2)=\sigma\left(\sum_{t=1}^{T}r_{\phi^*}(o_{1:t}^1,a_t^1)-\sum_{t=1}^{T}r_{\phi^*}(o_{1:t}^2,a_t^2)\right)\qquad\text{(7)} P(τ1≻τ2)=σ(t=1∑Trϕ∗(o1:t1,at1)−t=1∑Trϕ∗(o1:t2,at2))(7)

其中, π ϕ ∗ \pi_{\phi^{*}} πϕ∗ 表示最优隐式 PRM。由策略的自回归性质可知,公式(7)与 DPO(Rafailov et al., 2024b)的学习目标一致,只是参考模型换成了 π θ o l d \pi_{\theta_{\mathrm{old}}} πθold。Zhong et al.(2025)证明,在 token 级设置中,DPO 学习目标等价于使用 token 级奖励函数

r ∗ ( x , y ) = β log ⁡ π ϕ ∗ ( y t ∣ x , y 1 : t − 1 ) π r e f ( y t ∣ x , y 1 : t − 1 ) r^*(x,y)=\beta\log\frac{\pi_{\phi^*}(y_t\mid x,y_{1:t-1})}{\pi_{\mathrm{ref}}(y_t\mid x,y_{1:t-1})} r∗(x,y)=βlogπref(yt∣x,y1:t−1)πϕ∗(yt∣x,y1:t−1)

的 BT 模型。类似地,公式(7)说明公式(2)中的学习目标等价于一个使用如下逐步骤奖励函数的 BT 模型:

r ϕ ∗ ( o 1 : t , a t ) = β log ⁡ π ϕ ∗ ( a t ∣ o 1 : t , x ) π θ o l d ( a t ∣ o 1 : t , x ) (8) r_{\phi^*}(o_{1:t},a_t)=\beta\log\frac{\pi_{\phi^*}(a_t\mid o_{1:t},x)}{\pi_{\theta_{\mathrm{old}}}(a_t\mid o_{1:t},x)}\qquad\text{(8)} rϕ∗(o1:t,at)=βlogπθold(at∣o1:t,x)πϕ∗(at∣o1:t,x)(8)

本质上,这可以视为 Zhong et al.(2025)方法的一种变体:一个动作序列内部各 token 的值会在每个时间步先求和,再取平均。证明细节参见 Zhong et al.(2025)。

4 实验

我们在多种智能体任务上评估 iStar,以验证以下四点:第一,它能够有效训练进行长时程推理与行动的 LLM 智能体;第二,隐式步骤奖励能够带来较高的样本效率和训练稳定性;第三,奖励提高且所需步骤减少能够证明其探索效率得到改善;第四,iStar 的核心组成部分确实能够改善智能体强化学习中的信用分配。训练细节见附录 C.1。

基准环境

我们在三个具有挑战性的环境中评估 LLM 智能体。

  1. WebShop(Yao et al., 2022)是一个基于文本的网页环境。给定用户指令后,智能体需要与一个基于 HTML 的网站交互,完成搜索、导航并购买商品,因此要求智能体进行多步骤决策。
  2. VisualSokoban (Schrader, 2018)使用 6 × 6 6\times6 6×6 的推箱子棋盘。智能体必须把所有箱子推到目标位置,因此需要同时针对视觉输入和文本输入进行空间推理与长期规划。
  3. SOTOPIA (Zhou et al., 2024)是一个开放式社会交互环境。给定社会场景、角色档案和私有目标后,智能体需要与另一个 LLM 智能体交互,并针对对方实时变化的策略进行推理。训练时使用 SOTOPIA- π \pi π(Wang et al., 2024b)中的场景。环境的更多细节见附录 B。

基线

我们把 iStar 与多类具有竞争力的基线进行比较。第一类是擅长通用推理的前沿 LLM,包括 GPT-5(OpenAI, 2025b)、Gemini-2.5-Pro(Google, 2024)、DeepSeek-R1(Guo et al., 2025)和 Claude-Sonnet-4-Thinking(Anthropic, 2025)。第二类是仅使用结果奖励的原始强化学习方法,包括 PPO(Schulman et al., 2017)、GRPO(Shao et al., 2024)、RLOO(Ahmadian et al., 2024)和 REINFORCE++(Hu et al., 2025)。第三类是近期提出的单轮强化学习方法 PRIME(Cui et al., 2025),它为策略学习引入 token 级过程奖励。第四类是近期提出的智能体强化学习算法 GiGPO(Feng et al., 2025),它通过对相同状态进行分组来计算步骤级优势。

评估方式

对于 WebShop 和 VisualSokoban,我们沿用 Feng et al.(2025)的设置,以成功率(Success Rate)作为评估指标,并额外报告 WebShop 的 Score。两个指标都在验证实例上计算,比较时选取训练过程中达到的最佳分数。对于 SOTOPIA,我们报告范围为 0 到 10 的目标完成得分;沿用 Zhou et al.(2024)的做法,使用 GPT-4o 作为人类判断的代理评估器,并把 LLM judge 的温度设为 0。各环境的评估提示词见附录 C.2。

表 1:WebShop 与 VisualSokoban 上的性能。 WebShop 使用 Qwen2.5-7B-Instruct 作为基础模型,VisualSokoban 使用 Qwen2.5-VL-7B-Instruct。需要注意,DeepSeek-R1 和 PPO 训练目前不支持多模态场景,而 PRIME 只适用于具有二值结果奖励的任务。结果为三个随机种子的平均值。

方法 WebShop 成功率 WebShop Score VisualSokoban 成功率
直接提示前沿 LLM(ReAct)
GPT-5 37.5 66.1 16.6
Gemini-2.5-Pro 30.5 38.4 16.0
DeepSeek-R1 29.3 39.8 -
Claude-Sonnet-4-Thinking 35.2 62.0 19.1
基础模型(ReAct) 21.5 47.3 14.1
+ PPO 78.2 ± 4.5 86.6 ± 1.1 -
+ GRPO 80.1 ± 1.7 89.3 ± 2.8 85.6 ± 2.8
+ RLOO 77.4 ± 1.1 87.6 ± 4.7 86.3 ± 0.6
+ REINFORCE++ 77.0 ± 3.9 85.8 ± 0.1 81.4 ± 8.8
+ PRIME(Cui et al., 2025) 81.5 ± 1.8 91.3 ± 0.6 -
+ GiGPO(Feng et al., 2025) 84.1 ± 3.9 91.2 ± 1.5 85.9 ± 2.6
+ RLOO w/ iStar 86.5 ± 2.8 93.6 ± 1.0 91.7 ± 1.2

表 2:SOTOPIA 上的性能。 Self-Chat 表示被评估模型与自身交互;GPT-4o-as-Partner 表示被评估模型与 GPT-4o 交互。"Goal"表示目标完成得分,范围为 0 到 10;"Hard"表示需要高级推理能力的困难场景子集;"All"表示 SOTOPIA 中的全部社会场景。结果为三个随机种子的平均值。

方法 Self-Chat(Hard) Self-Chat(All) GPT-4o 搭档(Hard) GPT-4o 搭档(All)
直接提示前沿 LLM(ReAct)
GPT-5 7.21 8.95 7.70 8.90
Gemini-2.5-Pro 6.74 8.27 7.43 8.41
DeepSeek-R1 6.98 8.56 7.30 8.44
Claude-Sonnet-4-Thinking 6.39 8.64 7.02 8.62
Qwen2.5-7B-Instruct(ReAct) 5.56 6.77 5.51 7.30
+ PPO 6.63 ± 0.24 8.25 ± 0.09 6.27 ± 0.14 8.07 ± 0.08
+ GRPO 6.97 ± 0.24 8.31 ± 0.06 6.42 ± 0.31 7.84 ± 0.06
+ RLOO 5.70 ± 0.16 7.13 ± 0.02 6.09 ± 0.13 7.77 ± 0.03
+ REINFORCE++ 6.17 ± 0.30 7.87 ± 0.09 6.38 ± 0.05 7.93 ± 0.09
+ GRPO w/ iStar 7.11 ± 0.19 8.42 ± 0.03 6.76 ± 0.18 8.36 ± 0.03
Llama3.1-8B-Instruct(ReAct) 5.89 6.95 5.82 7.43
+ PPO 7.76 ± 0.14 9.05 ± 0.03 6.64 ± 0.03 8.14 ± 0.01
+ GRPO 7.92 ± 0.08 9.12 ± 0.02 6.68 ± 0.03 8.14 ± 0.02
+ RLOO 6.48 ± 0.15 8.33 ± 0.03 6.51 ± 0.14 8.02 ± 0.06
+ REINFORCE++ 7.84 ± 0.14 9.06 ± 0.04 6.38 ± 0.23 7.99 ± 0.10
+ GRPO w/ iStar 8.06 ± 0.11 9.20 ± 0.03 7.16 ± 0.14 8.45 ± 0.03

4.1 主要结果

基准性能

表 1 展示了 iStar 在 WebShop 和 VisualSokoban 上相对于基线的优越性能。在后一个环境中,性能提升尤其明显;VisualSokoban 中的错误往往不可逆,而且强化学习算法的前瞻能力有限,因此该任务尤其困难。表 4 表明,使用小得多的基础模型时也能观察到类似趋势。具体来说,我们的方法取得了当前最优性能,并超过近期的多轮强化学习基线 GiGPO(Feng et al., 2025)。原因是 iStar 能够进行更细粒度的信用分配:它在每个步骤使用隐式奖励区分好动作与坏动作,而不是依赖相同状态分组。本文方法也优于近期的单轮强化学习基线 PRIME(Cui et al., 2025)。PRIME 使用 token 级过程奖励,这种过细粒度奖励会让多轮强化学习中的策略训练更加复杂并产生高方差,见图 4(a)-(b)。在 SOTOPIA 中,由于状态空间开放而且奖励不可验证,GiGPO 和 PRIME 都不适用;即便如此,表 2 仍然显示 iStar 取得了当前最优性能。特别是与原始强化学习基线相比,本文方法在困难社会场景中的目标完成度,在 self-chat 设置下提高 14%(7.92 → 8.06),在与 GPT-4o 交互时最高提高 48%(6.68 → 7.16)。这些结果说明本文方法能够泛化到多种不同的交互式环境。

iStar 与不同原始强化学习算法结合

由于本文方法可以兼容多种强化学习方法,我们还分别把它与 RLOO(Ahmadian et al., 2024)、REINFORCE++(Hu et al., 2025)和 GRPO(Shao et al., 2024)结合,并将每一种组合与只使用结果奖励的原始版本比较。如图 3 所示,通过把隐式步骤奖励整合进多轮强化学习,iStar 能够改善长时程信用分配,并持续提升各种原始强化学习方法。例如,在 WebShop 和 VisualSokoban 上,iStar 与 RLOO 结合后,成功率都获得了 6.3% 的显著提升。REINFORCE++ 和 GRPO 上也出现相似趋势,说明本文方法对不同强化学习算法与不同环境都具有稳健性。

图 3:iStar 与不同原始强化学习算法的性能比较。 WebShop 使用 Qwen2.5-7B-Instruct 作为基础模型,VisualSokoban 使用 Qwen2.5-VL-7B-Instruct。结果使用一个随机种子报告。三幅柱状图从左到右分别为 WebShop Score、WebShop 成功率和 VisualSokoban 成功率;每组对比 RLOO、REINFORCE++、GRPO 的原始版本与其 iStar 增强版本。

4.2 深入分析

样本效率与训练稳定性

图 4 表明,与基线相比,iStar 在强化学习训练期间能够更快提高验证指标,并取得更高的最终性能,体现出更高的样本效率。在图 4(a) 中,本文方法只用 105 个训练步骤,就达到原始 RLOO 在 WebShop 上的最终 Score,训练效率大约提高为原来的 2 倍。到第 165 个步骤时,iStar 达到最高 94.7% 的 Score,在效率与性能两方面都获得显著改善。值得注意的是,虽然 PRIME 在 WebShop 训练早期表现相近,但随后增长停滞,并出现剧烈波动。这是因为 token 级过程奖励过于细碎,会使多轮交互中的策略学习复杂化;多轮任务的序列通常远长于单轮任务。相比之下,iStar 能够持续、稳定地改善,这说明隐式步骤奖励既能为探索提供密集反馈,又保持足够粗的粒度以降低方差,从而实现稳定训练。

图 4:WebShop 与 VisualSokoban 多轮强化学习期间的验证性能。 (a) WebShop Score 随训练步骤的变化;(b) WebShop 成功率随训练步骤的变化;© VisualSokoban 成功率随训练步骤的变化。需要注意,PRIME 只能应用于具有二值结果奖励的任务。

探索效率

为了证明隐式步骤奖励能够为策略学习提供有用指导,我们在图 5(a) 和图 5(b) 中可视化了步骤级奖励和回合级奖励的变化。特别是,隐式步骤奖励在训练很早期就开始改善,在 VisualSokoban 中尤其明显,随后回合奖励才开始提高。这表明本文方法首先捕获了良好的局部动作启发式,随后再把这些局部能力组合成具有更高回报的轨迹。因此,iStar 还能减少多轮交互中的不必要动作,从而缩短回合长度。如图 5© 和图 5(d) 所示,在回合奖励持续提高,也就是任务成功不受损害的情况下,回合长度不断缩短。

图 5:iStar 在 WebShop 与 VisualSokoban 中的训练动态。 左侧两图展示本文方法训练期间回合奖励与隐式步骤奖励的变化;右侧两图比较本文方法与基线在不同训练步骤上的回合长度。图例中的 Episode Reward=回合奖励,Implicit Step Reward=隐式步骤奖励,Episode Length=回合长度,Step=训练步骤。

4.3 消融实验

表 3:iStar 核心组件的消融实验。 "RLOO"表示仅使用结果奖励计算策略更新的优势;"w/ ground-truth process rewards"表示直接使用 VisualSokoban 提供的真实步骤奖励计算步骤级优势;"w/ merged rewards"表示在计算优势之前,直接把隐式步骤奖励加到结果奖励中;"w/ token-level process rewards"表示在 token 层面而非步骤层面计算隐式步骤奖励。结果使用一个随机种子报告。

方法 WebShop 成功率 WebShop Score VisualSokoban 成功率
RLOO 76.6 84.2 85.9
w/ ground-truth process rewards - - 87.5
w/ merged rewards 81.3 90.7 88.3
w/ token-level process rewards 82.0 90.0 89.1
w/ iStar 89.1 94.7 93.0

表 3 给出了消融实验结果,用于验证本文方法的关键组成部分是否是实现有效信用分配所必需的。第一,直接使用 VisualSokoban 提供的原始步骤惩罚,相对于原始强化学习只能带来有限提升;这说明 iStar 学习得到的隐式步骤奖励是更优的策略学习信用信号。第二,把隐式步骤奖励合并进回合奖励虽然能够超过原始强化学习,但相对于本文完整方法提升较小。这表明,我们不仅需要奖励中间动作,还需要由最终任务是否成功来约束信用,从而避免智能体利用推测性的中间奖励。因此,在优势层面组合两个信号,是解决长时程信用分配的关键。第三,学习 token 级过程奖励在多轮强化学习中并非最优,这说明过细粒度奖励可能引入噪声,并提高策略学习难度。

5 相关工作

PRM 已被广泛研究并应用于单轮任务,例如数学推理和单次代码生成。在这些设置中,PRM 可以为中间步骤打分,用于测试时搜索或重排序(Lightman et al., 2024;Wang et al., 2024a;Mahan et al., 2024),也可以用于在线强化学习(Dou et al., 2024;Setlur et al., 2025;Zha et al., 2025)。当任务扩展到动态交互场景时,过程奖励通常有三种构造方式:第一,为工具执行(Zeng et al., 2025)或元推理标签(Zhang et al., 2025b)人工设计步骤奖励;第二,使用 GRM(Liu et al., 2025;Zou et al., 2025)标注步骤质量;第三,使用隐式 PRM(Yuan et al., 2025)生成 token 级过程奖励。然而,人工设计或 judge 生成的步骤标签成本高且存在偏差,容易受到奖励黑客影响。学习步骤 Q 值(Choudhury, 2025)可以降低这种偏差,但固定 PRM 在推理阶段可能无法准确估计未见动作的 Q 值。

PRIME(Cui et al., 2025)通过联合训练隐式 PRM 与生成模型,部分缓解了上述问题。不过,它采用过细粒度的 token 级奖励,会在多轮强化学习中引入噪声并破坏训练稳定性。PRIME 的另一个问题是,它使用交叉熵损失优化隐式 PRM,因此只适用于具有二值结果奖励的任务。Feng et al.(2025)没有学习 PRM,而是通过对相同状态进行分组来计算步骤级优势,以此处理信用分配。该方法在有限状态-动作空间的任务中有效,但它依赖精确的状态重合,因而无法泛化到同一状态极少重复的开放式语言环境。相比之下,本文方法通过轨迹级 DPO 目标在步骤层面学习隐式奖励,以较低方差提供不依赖步骤标签的信用信号;即使在开放环境中,它对于可验证和不可验证奖励也表现出稳健性与泛化能力。

6 结论

我们提出了用于 LLM 智能体的通用信用分配策略 iStar。具体而言,我们交替优化隐式 PRM 与策略模型;隐式 PRM 为策略学习提供隐式步骤奖励,并由此形成一个自我强化的训练闭环。为了优化隐式 PRM,我们提出轨迹级 DPO 目标,并证明它等价于一个使用逐步骤奖励函数的 BT 模型。在实际应用中,本文方法能够插接到多种强化学习算法中,而且即使面对开放环境中的可验证或不可验证奖励,也具有泛化能力。实验结果表明,iStar 在 WebShop 上平均达到 86.5% 的成功率和 93.6% 的 Score,在 VisualSokoban 上达到 91.7% 的成功率。在 SOTOPIA 的困难场景中,本文方法在 self-chat 设置下使目标完成度最高提升 14%,在与 GPT-4o 交互时最高提升 48%。

未来可以在数学问题或代码生成任务上验证本文方法,为中间 CoT 步骤提供隐式步骤奖励;它也可以用于测试时扩展(test-time scaling),以指导搜索。本文方法目前的局限是:训练期间,隐式 PRM 与策略模型被实现为彼此分离的两个模型。未来可以把二者统一为同一个模型,并使用不同目标进行训练,以降低计算与显存开销,同时可能改善表征共享。此外,在 SOTOPIA 中,隐式 PRM 目前只学习预测目标完成度偏好;未来可以进一步扩展为多目标隐式 PRM。

附录

附录 A:算法

iStar 的算法流程详见算法 1。

算法 1:使用 iStar 训练 LLM 智能体(以 GRPO 为例)

输入: 任务分布 p ( X ) p(X) p(X);语言模型 π θ i n i t \pi_{\theta_{init}} πθinit;结果奖励验证器或模型 r o r_{o} ro;训练步数 M M M;rollout 数量 N N N;混合权重 α \alpha α。

输出: 优化后的策略 π θ \pi_{\theta} πθ 与 PRM π ϕ \pi_{\phi} πϕ。

  1. 初始化策略模型: π θ a r r o w π θ i n i t \pi_{\theta} arrow \pi_{\theta_{init}} πθarrowπθinit;初始化旧策略: π θ o l d a r r o w π θ i n i t \pi_{\theta_{\mathrm{old}}} arrow \pi_{\theta_{init}} πθoldarrowπθinit;初始化 PRM: π ϕ a r r o w π θ i n i t \pi_{\phi} arrow \pi_{\theta_{init}} πϕarrowπθinit。
  2. 对迭代轮次 m = 1 , ... , M m=1,\ldots,M m=1,...,M,重复执行以下步骤。
  3. 采集多步骤 rollout。 从任务分布采样 x ∼ p ( X ) x\sim p(X) x∼p(X),并初始化 N N N 个完全相同的环境。
  4. 对时间步 t = 1 , ... , T t=1,\ldots,T t=1,...,T:
    1. 从策略采样动作 { a t i ∼ π θ ( o 1 : t i , x ) } i = 1 N \{a_{t}^{i}\sim\pi_{\theta}(o_{1:t}^{i},x)\}_{i=1}^{N} {ati∼πθ(o1:ti,x)}i=1N;
    2. 执行动作并观察下一时刻观测 { o t + 1 i } i = 1 N \{o_{t+1}^{i}\}_{i=1}^{N} {ot+1i}i=1N。
  5. 训练 PRM。
    1. 计算 N N N 条轨迹的结果奖励 r o ( τ 1 : N ) r_{o}(\tau_{1:N}) ro(τ1:N);
    2. 根据轨迹偏好对 π ϕ \pi_{\phi} πϕ 进行前向计算,按照公式(1)得到步骤奖励 r ϕ ( a t i ) r_{\phi}(a_{t}^{i}) rϕ(ati);
    3. 使用公式(2)中的 DPO 风格目标,在轨迹上更新 PRM π ϕ \pi_{\phi} πϕ。
  6. 训练策略。
    1. 使用 r o ( τ i ) r_{o}(\tau_{i}) ro(τi),按照公式(3)计算回合级优势 A E ( τ i ) A^{E}(\tau_{i}) AE(τi);
    2. 使用 r ϕ ( a t i ) r_{\phi}(a_{t}^{i}) rϕ(ati),按照公式(4)计算步骤级优势 A S ( a t i ) A^{S}(a_{t}^{i}) AS(ati);
    3. 合并优势: A ( a t i ) = A E ( τ i ) + α A S ( a t i ) A(a_{t}^{i})=A^{E}(\tau_{i})+\alpha A^{S}(a_{t}^{i}) A(ati)=AE(τi)+αAS(ati);
    4. 通过最大化公式(6)中的目标更新策略 π θ \pi_{\theta} πθ;
    5. 更新旧参数: θ o l d a r r o w θ \theta_{old} arrow \theta θoldarrowθ。

附录 B:环境细节

WebShop

WebShop(Yao et al., 2022)在一个电商平台上模拟在线购物任务。智能体的目标是理解人类给出的文本指令,并购买满足给定规格的商品。为完成任务,智能体必须与网站搜索引擎交互,从搜索结果中选择商品进行查看,检查商品描述和详细信息,在最终点击"Buy"按钮之前选择相关选项,例如尺码和颜色。为了找出最符合用户要求的商品,智能体可能需要比较多个商品、在不同页面之间来回导航,并在必要时进行额外搜索。该环境包含来自 amazon.com 的一百多万件商品、超过 12,000 条众包指令,以及丰富的语义动作集合。奖励由程序化匹配函数自动计算;这些函数会评估所选商品的属性、类型、选项和价格。

VisualSokoban

Sokoban(Schrader, 2018)的房间由五类关键元素构成:墙壁、地板、箱子、箱子目标位置和智能体。根据某个元素是否与箱子目标位置重叠,这些元素可能处于不同状态。房间随机生成,从而帮助模型避免过拟合到特定预定义布局。游戏包含两类主要动作 Push 和 Move,并且二者都可以沿四个方向执行:Up、Down、Left、Right。当指定方向不存在墙壁或箱子阻挡时,Move 允许智能体移动到该方向上的空位置。Push 尝试推动相邻箱子,但只有箱子后方的格子为空时才能成功;系统不允许连续推动一串箱子。如果相邻位置没有箱子,则 Push 的效果与同方向的 Move 相同。把全部箱子推到目标位置并成功完成游戏,会在最后一步获得 10 分奖励。此外,把一个箱子推到目标位置会获得 1 分奖励,而把箱子从目标位置移走会受到 -1 分惩罚。每执行一步都会受到 -0.1 分的小额惩罚,以抑制步骤过多的轨迹。VisualSokoban 使用 RGB 图像渲染,其像素尺寸与网格大小相等。

SOTOPIA

SOTOPIA(Zhou et al., 2024)是一个通用领域、开放式的平台,用于模拟 LLM 智能体之间的社会交互。场景覆盖多种社会交互类型,例如谈判、交换、协作、竞争、迁就与说服。其中一个格外困难的子集称为 SOTOPIA-hard,它包含需要高级策略推理的场景。每个智能体都有一份角色档案,其中包括姓名、性别、性格和职业等属性。每段对话结束时,GPT-4o 会从七个维度评估智能体:目标完成度(Goal Completion)、可信度(Believability)、知识(Knowledge)、秘密(Secret)、关系(Relationship)、社会规则(Social Rules),以及经济与物质收益(Financial and Material Benefits)。SOTOPIA- π \pi π(Wang et al., 2024b)是后续工作,它使用 GPT-4 生成了一套新场景。SOTOPIA- π \pi π 中的社会任务保证与 SOTOPIA 中的任务完全不同。

附录 C:实验细节

C.1 训练细节

iStar 中的隐式 PRM 使用基础策略模型进行初始化。唯一例外是 VisualSokoban:其策略模型使用 Qwen2.5-VL-7B-Instruct,而 PRM 使用 Qwen2.5-7B-Instruct。策略模型使用恒定学习率 5 × 10 − 7 5\times10^{- 7} 5×10−7,隐式 PRM 使用恒定学习率 10 − 6 10^{- 6} 10−6,优化器均为 AdamW。策略模型与隐式 PRM 的 batch size 都是 64,micro-batch size 都是 8。训练不使用 KL 散度惩罚。优势系数设为 α = 1 \alpha=1 α=1,隐式 PRM 训练的 β = 0.05 \beta=0.05 β=0.05。每个提示的 rollout 数量设为 8。为了公平比较,所有方法使用完全相同的强化学习配置;全部实验均在 8 × 8\times 8×A100 GPU 上运行。下面给出各个环境的额外训练细节。

WebShop 与 VisualSokoban

策略学习的基础模型使用 Qwen2.5-(VL)-7B-Instruct(Yang et al., 2024)。为了处理 LLM 智能体产生的无效动作,系统施加 -0.1 的奖励惩罚。最大响应长度为 512 token;WebShop 的最大提示长度为 4096 token,VisualSokoban 的最大提示长度为 1024 token。WebShop 每次 rollout 采样 16 个不同组,因此总共使用 16 × 8 = 128 16\times8=128 16×8=128 个环境。VisualSokoban 每次 rollout 采样 32 个不同组,因此总共使用 32 × 8 = 256 32\times8=256 32×8=256 个环境。作为对照,PPO 在 WebShop 和 VisualSokoban 中分别使用 128 和 256 个彼此独立的环境执行 rollout。rollout 温度设为 1.0,验证温度设为 0.4。实验基于 veRL(Sheng et al., 2024)实现,每项实验训练 200 步。

SOTOPIA

策略学习分别使用 Qwen2.5-7B-Instruct(Yang et al., 2024)和 Llama3.1-8B-Instruct(Meta, 2024)作为基础模型,以验证本文方法面对不同模型骨干时的稳健性。最大提示长度为 6144 token,最大响应长度为 2048 token。与 WebShop 相同,每次 rollout 采样 16 个不同组,因此总共使用 16 × 8 = 128 16\times8=128 16×8=128 个环境;PPO 使用 128 个彼此独立的环境。rollout 温度设为 0.7。每项实验均基于 veRL 实现,并训练 800 步。

C.2 评估提示词

我们使用 ReAct(Yao et al., 2023)作为提示策略,在每次动作之前生成思维链(Wei et al., 2022)。用于评估 WebShop(Yao et al., 2022)、VisualSokoban(Schrader, 2018)和 SOTOPIA(Zhou et al., 2024)中的 LLM 或多模态大语言模型(Multimodal Large Language Model,MLLM)智能体的提示模板分别见图 6、图 7 和图 8。花括号 {} 中的占位符代表语义槽位,运行时会被动态填充。

图 6:WebShop 中 LLM 智能体使用的评估提示词

你是一名在 WebShop 电商环境中运行的专家级自主智能体。

你的任务是:{task_description}

在当前步骤之前,你已经执行了 {step_count} 个步骤。

下面给出最近 {history_length} 条观测,以及你采取的对应动作:{action_history}

你现在位于第 {current_step} 步,当前观测为:{current_observation}

当前情形下允许执行的动作如下:

[ {available_actions} ]

现在轮到你为当前步骤选择一个动作。

你应当先针对当前情形逐步推理,然后认真判断哪个允许执行的动作最能推进购物目标。

推理过程必须放在 <think> </think> 标签内。

完成推理后,你应当为当前步骤选择一个允许执行的动作,并把它放在 <action> </action> 标签内。

图 7:VisualSokoban 中 MLLM 智能体使用的评估提示词

你是一名在 Sokoban 环境中运行的专家智能体。

你的目标是把全部箱子推到目标位置。一旦所有箱子都位于目标位置,你就获胜。

规则

你只能推动箱子,不能拉动箱子,因此必须提前规划以免陷入死局。

你不能穿过墙壁,也不能把箱子推进墙内。

为避免陷阱,不要把箱子推进角落,也不要把它推到靠墙且之后无法再次移动的位置。

图像中的视觉元素

角色:一个绿色的小型外星人形象,带有两根触角和黑色眼睛,代表你自己。

箱子:一个黄色木箱,正面带有橙色的"X",这是你需要推动的箱子。

目标位置:一块以红色描边的黑色方格,中心有一个小型红色菱形;它表示箱子应当被推动到的目的地。

当前步骤

当前观测显示在图像中:<image>

允许执行的动作是 ["up", "down", "left", "right"]

现在轮到你移动;当前步骤只能选择一个动作。

你应当先针对当前情形逐步推理:观察箱子与目标位置,规划把箱子推向目标的路径,并避开角落或墙壁等陷阱。

推理过程必须放在 <think> </think> 标签内。

完成推理后,你应当为当前步骤选择一个允许执行的动作,并把它放在 <action> </action> 标签内。

图 8:SOTOPIA 中 LLM 智能体使用的评估提示词

想象你是 {agent}。你的任务是像 {agent} 那样行动或说话,同时牢记 {agent} 的社会目标。

你可以在"Here is the context of this interaction"字段中找到 {agent} 的目标或背景。

请注意,{agent} 的目标只有你能看到。

你应当尽最大努力,以符合该角色性格特征的方式实现 {agent} 的目标。

此外,保持对话的自然性与真实性也很重要,例如不要重复其他人已经说过的话。

现在是第 {turn} 轮。你可以说一些内容与对方互动,也可以直接说 left the conversation 来停止对话。

注意,在以下情况下你可以选择 left the conversation:1. 已经实现社会目标;2. 对话让你感到不适;3. 你觉得对话无聊或已经失去耐心;4. 你因其他原因希望离开。

你应当先逐步推理并反思当前对话状态,然后认真判断哪一种沟通方式和社会策略最能推进你的目标。

推理过程必须放在 <think> </think> 标签内。

完成推理后,给出你的响应,并把它放在 <action> </action> 标签内。

附录 D:补充结果

表 4 给出了使用 Qwen2.5-1.5B-Instruct(Yang et al., 2024)作为基础模型时,iStar 与各基线在 WebShop 上的比较结果。

表 4:以 Qwen2.5-1.5B-Instruct 为基础模型时的 WebShop 性能。 结果使用一个随机种子报告。

方法 成功率 Score
Qwen2.5-1.5B-Instruct(ReAct) 10.4 46.1
+ RLOO 71.9 85.7
+ GiGPO 72.7 86.8
+ PRIME 74.2 86.6
+ RLOO w/ iStar 80.5 91.5
相关推荐
前沿在线1 小时前
2026 WRC世界机器人大会| 黑芝麻智能展台亮点
人工智能·ai·大模型
怕浪猫1 小时前
CLI、Web、桌面端全制霸:DeepSeek Harness 的多端架构是怎么设计的
aigc·agent·产品
会周易的程序员2 小时前
软件接入大模型实现 Agent —— 从原理到 C++ 落地完全指南
c++·人工智能·物联网·架构·agent·工业协议·mcp
像风一样自由20202 小时前
11.PostgreSQ、-MySQL与MongoDB-AI应用如何选择数据库
数据库·人工智能·mysql·mongodb·大模型·rag·智能体
weixin_471383033 小时前
27 本地 + 云端智能路由(Local + Cloud Routing)
agent
白拾3 小时前
【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角
强化学习·colm 2025·search-r1 论文分享·llm后训练·检索增强推理
ReleaseU4 小时前
Kimi K3 登陆阿里云:2.8T 参数的开源模型,离闭源天花板还有多远?
人工智能·大模型
是Yu欸4 小时前
openPangu-2.0 技术报告全文翻译(1):摘要、引言与混合注意力架构
人工智能·华为·架构·aigc·交互·agent
长谷深风1114 小时前
AI Agent 踩坑:盲目重试会把小故障炸成系统灾难
java·大数据·ai·agent·ai agent·工具调用·agent设计