On-Policy Distillation(OPD)和reinforcement (RL)结合

你这里说的 OPD ,在当前 LLM 后训练 / Agent 语境里,通常指 On-Policy Distillation,在线策略蒸馏。

先给结论:

OPD 不是"比 RL 更先进、准备取代 RL"的方法。

它解决的是 RL 的一个核心短板:RL 的 reward 通常太稀疏,而 OPD 可以让强 Teacher 在 Student 自己实际走到的状态上,逐 token 告诉它"这里应该怎么做"。

因此截至 2026 年 8 月 ,更值得关注的趋势已经不是单纯的 OPD vs RL,而是:

On-policy rollout + Teacher dense supervision + RL outcome reward \boxed{\text{On-policy rollout}+\text{Teacher dense supervision}+\text{RL outcome reward}} On-policy rollout+Teacher dense supervision+RL outcome reward

即 OPD × RL 混合训练 ,尤其是在 long-horizon Agent / Tool Use / Agentic Search 上。

原始 On-Policy Distillation / GKD 工作已经证明了 student-generated trajectories 可以显著缓解传统 distillation 的 distribution mismatch;而 2026 年的研究正在集中解决 long-horizon agent、teacher-student mismatch、训练效率以及 OPD 与 RL 的融合。(arXiv)


一、先从你刚才理解的 GRPO 接上来

刚才我们讲 RL:

text 复制代码
Question
   ↓
Student rollout
   ↓
Think
Search
Observe
Think
Search
Answer
   ↓
最终 Reward = 1
   ↓
GRPO

最大的问题是什么?

假设 Agent 生成了 1000 个 token:

text 复制代码
Think A
↓
Search A
↓
Observe
↓
Think B
↓
Search B
↓
Observe
↓
Think C
↓
Answer

最后:

text 复制代码
Reward = 0

你只知道:

"这一整条轨迹不好。"

但你不知道:

text 复制代码
Think A 是否正确?
Search A 是否正确?
Think B 是否开始出错?
Search B 的 query 哪个 token 不好?

这就是之前讲的:

Sparse Reward + Credit Assignment


二、OPD 的思路完全不同

OPD 说:

既然我已经有一个很强的 Teacher,为什么非得等整个 trajectory 结束才告诉 Student 对不对?

可以让:

text 复制代码
Student
自己走

↓

Teacher
一路看着它走

↓

每一步告诉它:
"如果是我,我下一 token 会怎么选。"

于是:

text 复制代码
Student trajectory:

<s>
I need to first identify...

当前 Student:

π S ( ⋅ ∣ s t ) \pi_S(\cdot|s_t) πS(⋅∣st)

可能认为:

text 复制代码
search      0.40
answer      0.25
inspect     0.10
other       ...

Teacher 看同一个 state:

π T ( ⋅ ∣ s t ) \pi_T(\cdot|s_t) πT(⋅∣st)

给出:

text 复制代码
search      0.91
answer      0.02
inspect     0.03
...

于是:

Student 不需要等到任务结束,就已经得到一个非常强的学习信号:

text 复制代码
这里应该更倾向 Search
而不是直接 Answer

三、最核心的区别就在这里

RL

Teacher / Verifier 说:

text 复制代码
这一整道题:

7 / 10

OPD

Teacher 基本是在说:

text 复制代码
token 1:这里应该选 A
token 2:这里 B 概率应该更高
token 3:这个 reasoning direction 不太对
token 4:这里应该 search
token 5:query 应该这样写
...

所以可以把两者粗略理解成:

R L = O u t c o m e S u p e r v i s i o n \boxed{ RL = Outcome Supervision } RL=OutcomeSupervision

而:

O P D = D e n s e P o l i c y S u p e r v i s i o n \boxed{ OPD = Dense Policy Supervision } OPD=DensePolicySupervision

这也是为什么最近很多工作把 OPD 称为一种很有吸引力的 post-training paradigm。(arXiv)


四、OPD 为什么叫 On-Policy?

这里非常容易和普通蒸馏混掉。


普通知识蒸馏

Teacher 先生成:

text 复制代码
Question
    ↓
Teacher
    ↓
Trajectory A

然后 Student 学:

text 复制代码
Trajectory A

例如:

text 复制代码
Teacher:

Think A
→ Search A
→ Think B
→ Answer

Student SFT:

text 复制代码
模仿 Teacher trajectory

问题:

Student 真正 inference 时可能根本不会走到 Teacher 的这些状态。


例如 Teacher:

text 复制代码
Step 1 → A
Step 2 → B
Step 3 → C

Student 实际:

text 复制代码
Step 1 → A
Step 2 → X

然后它到了:

text 复制代码
AX

这个状态。

但训练数据里:

text 复制代码
从来没有 AX

所以 Student:

"我现在不知道怎么办了。"

这就是:

Distribution Shift / Exposure Bias


五、On-Policy 的关键就是:让 Student 自己犯错

OPD:

text 复制代码
Question
   ↓

Student rollout

   ↓

Student:
A
↓
X
↓
????

Teacher 不要求 Student 重走:

text 复制代码
A → B → C

而是 Teacher 来到 Student 的当前状态:

text 复制代码
A → X

然后问 Teacher:

"如果已经走到 AX,你下一步会怎么走?"

Teacher:

text 复制代码
AX → Y

Student 学:

text 复制代码
AX → Y

这就是 OPD 最漂亮的地方。

原始 GKD 工作将自回归生成形式化成 token-level MDP,并让 student 在自己生成的状态 上模仿 teacher 的 next-token distribution,从而缓解纯 teacher-forcing 带来的分布不匹配。(arXiv)


六、所以 OPD 和 SFT 最大区别也在这里

可以直接记:

SFT / Off-policy Distillation OPD
Trajectory 谁生成 Teacher / Dataset Student
Student 学什么状态 Teacher 遇到的状态 Student 自己遇到的状态
犯错之后有监督吗 很少 有
Distribution mismatch 明显 较小
数据分布 固定 随 Policy 变化

这意味着:

text 复制代码
SFT:
教优秀学生看标准答案

OPD:
跟着学生做题,
学生做错以后现场指导

这个类比其实相当准确。


七、OPD 的 loss 是什么?

最简单的版本就是让:

π S \pi_S πS

逼近:

π T \pi_T πT

例如:

$$

L_{OPD}

\sum_t

D_{KL}

\left(

\pi_T(\cdot|s_t)

|

\pi_S(\cdot|s_t)

\right)

$$

其中关键是:

s t ∼ π S s_t \sim \pi_S st∼πS

也就是:

这些 state 是 Student 自己 rollout 出来的。

这才叫 On-Policy。

不过实际 OPD 不局限于 Forward KL。GKD 系统研究了 Forward KL、Reverse KL 和 JSD;其中 reverse KL 等 mode-seeking objective 在不少实验中表现更好。(arXiv)

比如 reverse KL:

D K L ( π S ∥ π T ) D_{KL} ( \pi_S \| \pi_T ) DKL(πS∥πT)

倾向于让 Student:

重点学习 Teacher 高概率的优秀模式。


八、那 OPD 相较于 RL 到底有什么优势?

这个问题最重要。


优势 1:Reward 极其密集

RL:

text 复制代码
1000 tokens

↓

Reward = 1

只有一个信号。

OPD:

text 复制代码
token 1 → Teacher distribution
token 2 → Teacher distribution
token 3 → Teacher distribution
...
token 1000 → Teacher distribution

相当于:

1000 1000 1000

个监督信号。

所以:

O P D 的 C r e d i t A s s i g n m e n t 明显比纯 O u t c o m e R L 容易 \boxed{ OPD 的 Credit Assignment 明显比纯 Outcome RL 容易 } OPD的CreditAssignment明显比纯OutcomeRL容易


九、优势 2:不用等模型偶然探索到正确答案

之前讲 GRPO 最大的问题:

text 复制代码
Group size = 8

Reward:
0
0
0
0
0
0
0
0

那:

text 复制代码
Advantage ≈ 0

基本学不到。

OPD 不一样。

即使 Student:

text 复制代码
完全不会解

Teacher 仍然可以在 Student 当前 state 上告诉它:

text 复制代码
下一步你应该这样走

所以学习信号不会完全消失。

这也是为什么 OPD 通常:

Sample Efficiency 更好、Early Training 更容易启动。


十、优势 3:不需要设计复杂 Reward

Agent RL 里你之前已经看到:

text 复制代码
Answer Reward
Evidence Reward
Citation Reward
Search Cost Reward
Format Reward
...

然后还会出现:

text 复制代码
Reward Hacking

OPD 可以简单很多:

text 复制代码
Teacher:

这是我的 policy distribution

↓

Student:

跟它靠近

核心 supervision 直接来自 Teacher。

所以不必人为定义:

text 复制代码
"一个 Search query 应该给多少 reward?"

十一、优势 4:特别适合小模型 Agent 化

比如:

text 复制代码
Teacher:

Qwen3-32B Agent

Student:

text 复制代码
Qwen3-4B

你希望 Student 学:

text 复制代码
什么时候 Search
怎么调用工具
怎么 Plan
怎么修正错误
怎么停止

SFT只能给:

text 复制代码
一些固定优秀 trajectory

OPD 可以:

text 复制代码
4B Student 自己跑
        ↓
出现它真正容易犯的问题
        ↓
32B Teacher
在这些状态进行指导

因此对:

大 Agent → 小 Agent 能力迁移

很有吸引力。

2026 年 Guided-OPD 就用 Qwen3 大 Teacher 向更小 Student 蒸馏多轮 Agent 能力,并专门处理小 Student 多轮错误累积问题。(arXiv)


十二、把 RL 和 OPD 放一起看就非常清晰了

RL / GRPO OPD
谁告诉模型好不好 Reward / Verifier Teacher Model
信号 Scalar Reward Token Distribution
信号密度 稀疏 极密集
Credit Assignment 难 容易很多
是否需要 Teacher 不一定 需要
是否需要 Reward 是 不一定
探索能力 强 较弱
能否超过 Teacher 理论上可以 容易受 Teacher ceiling 限制
学新策略 更有潜力 主要模仿 Teacher
Reward Hacking 有 少很多,但有其他 pathology
Teacher Error 不敏感 容易继承
Long Horizon sparse reward严重 teacher cost严重
数据 On-policy On-policy

注意最后:

两者都是 on-policy。

区别不在 on-policy。

区别主要是:

text 复制代码
RL:

on-policy trajectory
+
reward

vs

text 复制代码
OPD:

on-policy trajectory
+
teacher distribution

十三、但是这里我要纠正一个很容易产生的印象

你可能会想:

OPD 有 dense reward,那是不是全面优于 RL?

不是。

OPD 有几个非常明显的天花板。


十四、第一个:Teacher Ceiling

假设:

text 复制代码
Teacher
只能做到 80%

你一直让 Student:

π S → π T \pi_S \rightarrow \pi_T πS→πT

那么:

Student 最终主要是在复制 Teacher。

Teacher 错了:

text 复制代码
Student也被要求学它的错误

MAD-OPD 2026 就把这个称作 single-teacher capability ceiling,并尝试通过多个 Teacher debate 后形成集体监督来缓解。(arXiv)

而 RL 不一样。

假如 Verifier 客观:

text 复制代码
Teacher strategy → reward 0

Student自己探索的新策略 → reward 1

RL:

可以强化 Student 自己发现的新策略。

所以:

R L 的真正优势是探索 \boxed{ RL 的真正优势是探索 } RL的真正优势是探索


十五、第二个问题:Teacher--Student Gap

这个问题现在很热门。

假设:

text 复制代码
Teacher = 671B
Student = 1.5B

Teacher:

text 复制代码
复杂 reasoning
复杂 long-horizon plan

Student:

根本没有 capacity 表达这种 policy。

于是 Teacher 虽然很强:

text 复制代码
Teacher distribution

对 Student 却未必是有效学习目标。

2026 年系统研究发现 OPD 成功依赖至少两个重要条件:

  1. Student 与 Teacher 的 thinking pattern 要较兼容;
  2. Teacher 又必须提供 Student 当前训练分布中真正缺少的能力。

Teacher 太接近,没什么新东西;差得太远,又可能教不进去。(arXiv)

这其实很像一个:

Teacher--Student Sweet Spot


十六、尤其 Agent 场景更加严重

普通 math:

text 复制代码
Student错一个token

可能还能继续。

Agent:

text 复制代码
Turn 1
Search错了

↓

Observation完全不同

↓

Turn 2 state不同

↓

Turn 3进一步漂移

↓

Turn 10
已经进入另一条世界线

即:

Compounding Error

因此 Vanilla OPD 对 long-horizon Agent 并没有想象中那么简单。

Guided-OPD 2026 的解决方式非常典型:

text 复制代码
训练前期:

Teacher intervention多
Student不会走太偏

↓

训练中期:

逐渐减少 Teacher intervention

↓

训练后期:

纯 Student on-policy

类似 curriculum。(arXiv)


十七、第三个问题:OPD 其实很贵

想一下。

Student rollout:

text 复制代码
2000 tokens

每一个 Student state:

text 复制代码
Teacher
都需要给 vocabulary distribution

假如:

text 复制代码
vocab = 150K
Teacher = 32B / 72B

那成本很高。

RL:

text 复制代码
Student rollout
+
最终 verifier

OPD:

text 复制代码
Student rollout

+

Teacher Forward
Teacher Forward
Teacher Forward
...

所以 OPD 最大的工程瓶颈之一就是:

Teacher Inference Cost

Lightning OPD 2026 就是专门解决这个问题:尝试把 teacher logits 预计算下来,让 OPD 不再要求训练期间维持 live teacher server;论文报告在其设置中取得约 4× 训练加速。(arXiv)


比如:

text 复制代码
Student

Think
Search
Observe 4K tokens

Think
Search
Observe 5K

Think
Search
Observe 6K
...

如果每一个 turn:

text 复制代码
Teacher重新forward整个context

成本会爆炸。

因此 2026 出现:

TurnOPD

它明确针对 long-horizon Agent 发现两个问题:

text 复制代码
① 后面很多 turn
Teacher supervision价值越来越低

② token-level KL
过多集中在前面的 shallow turn

所以提出:

text 复制代码
Adaptive Rollout Depth
+
Turn-normalized Loss

并在:

  • ALFWorld
  • WebShop
  • Multi-Hop Search

上测试。(arXiv)

这个和 Agentic Search 非常相关。


十九、还有一个非常重要的新发现:OPD 不一定"增加能力上限"

这是 2026 年目前非常值得关注的研究。

以前大家容易认为:

text 复制代码
Teacher更强

↓

OPD

↓

Student获得Teacher的新能力

但现在证据没这么简单。

2026 年 8 月一篇专门从 Test-Time Scaling 观察 OPD 的工作发现:

text 复制代码
OPD后:

avg@K ↑

也就是平均采样更容易正确。

但是随着:

text 复制代码
K越来越大

pre-OPD model 在 pass@K 上甚至重新取得优势。

作者进一步用 pass@1024 分析发现,OPD 可能让某些本来可解的问题反而变得不可解。(arXiv)


二十、这和我们上一轮讲 RL 的 Distribution Sharpening 非常像

可以理解:

OPD 前

Student:

text 复制代码
Strategy A  10%  ← correct
Strategy B  20%
Strategy C  20%
Strategy D  50%

Teacher 引导后:

text 复制代码
Strategy A  60%
Strategy B  15%
Strategy C  10%
Strategy D  15%

于是:

text 复制代码
pass@1
大涨

但原本 Student 有:

text 复制代码
很多不同探索路径

现在:

text 复制代码
distribution更加集中

所以大规模 sampling 后:

text 复制代码
pass@128 / pass@1024

不一定提高。

2026 年另一项分析也把 OPD 描述为一种 exploration catalyst ,强调它主要引导 Student 更频繁进入正确 reasoning path,而不是自动扩大 capability ceiling。(arXiv)


二十一、所以 OPD vs RL 的本质区别,可以用一句很关键的话概括

OPD

Teacher 告诉你往哪里走。

所以:

text 复制代码
指导强
学习快
探索弱

RL

你自己探索,环境告诉你最后走得好不好。

所以:

text 复制代码
指导弱
训练难
探索强

因此二者的优势实际上互补。


二十二、这就解释了为什么现在越来越热门的是 OPD + RL

可以写成:

text 复制代码
                    Student
                       │
                       ↓
                 On-policy Rollout
                       │
          ┌────────────┴───────────┐
          ↓                        ↓
       Teacher                  Verifier
          ↓                        ↓
   Token-level Signal         Outcome Reward
          │                        │
          └────────────┬───────────┘
                       ↓
                   Update

对应:

L = L R L + λ L O P D L = L_{RL} + \lambda L_{OPD} L=LRL+λLOPD

其中:

L R L L_{RL} LRL

负责:

"最终任务是否完成?"

而:

L O P D L_{OPD} LOPD

负责:

"中间应该往什么方向优化?"


二十三、2026 最近一个非常典型的工作:Distilled RL

7 月的 Distilled Reinforcement Learning for LLM Post-training 就明确把:

text 复制代码
RL

和:

text 复制代码
OPD

列为两种主要 paradigm,并指出:

RL 问题

text 复制代码
Outcome signal粗
Credit Assignment困难

OPD 问题

text 复制代码
无条件匹配 Teacher logits

Teacher太相似 → 没新知识
Teacher差太大 → 教不进去

于是提出:

text 复制代码
Distilled RL

核心不是:

text 复制代码
Teacher说什么都学

而是:

把 Teacher guidance 放进 RL objective,由 RL 有选择地决定哪些 Teacher knowledge 值得强化。

论文报告其在 within-family 和 cross-family distillation 中都优于标准 RL 和 OPD。(arXiv)

这条路线我认为比"OPD 替代 RL"更值得关注。


二十四、现在 OPD / RL 真正热门的方向有哪些?

截至 2026 年 8 月,如果限定:

LLM / Reasoning / Agent / Agentic Search Post-training

我会把研究热度大致分成下面 6 条主线。


第一梯队:OPD × RL Hybrid

我认为这是目前最值得关注的。

核心问题:

D e n s e T e a c h e r G u i d a n c e + O u t c o m e − b a s e d E x p l o r a t i o n \boxed{ Dense Teacher Guidance + Outcome-based Exploration } DenseTeacherGuidance+Outcome−basedExploration

代表思路:

text 复制代码
Distilled RL
SEED
SSOPD

SEED 更进一步把 Agent 完成后的 trajectory 转成 hindsight skills,再将 skill 对 action probability 的影响蒸馏回当前 policy,并和 outcome RL 联合训练。(arXiv)

而 SSOPD 利用同一个 GRPO group:

text 复制代码
correct trajectory
vs
wrong trajectory

从它们之间构建 dense process supervision;其论文报告在多个 reasoning benchmark 上超过纯 GRPO。(arXiv)

为什么热门?

因为它正好补:

text 复制代码
RL:会探索但信号稀疏

OPD:信号密集但被Teacher限制

二十五、第二梯队:Long-Horizon Agent OPD

这和 Agentic Search 最直接相关。

问题已经从:

text 复制代码
怎么蒸馏一个回答

变成:

text 复制代码
怎么蒸馏:

Plan
→ Search
→ Read
→ Search
→ Verify
→ Tool
→ Answer

几十个 turn

当前主要解决:

text 复制代码
Compounding Error
Turn Credit Assignment
Trajectory Length
Teacher Cost
Deep Turn Under-training

代表:

text 复制代码
TurnOPD
Guided-OPD
OPAD / MAD-OPD

(arXiv)


二十六、第三梯队:Efficient / Offline OPD

因为:

text 复制代码
大Teacher实时forward

太贵。

所以现在开始研究:

text 复制代码
Teacher Logit Cache
Offline OPD
Selective Distillation
Sparse Update
Partial Token Supervision

代表:

text 复制代码
Lightning OPD

目标就是把:

text 复制代码
Student rollout
+
Online Teacher Server

逐渐变成:

text 复制代码
Student rollout
+
Cached / Selective Teacher Signal

(arXiv)

这条方向工程价值很高。


二十七、第四梯队:Teacher--Student Mismatch

这个问题未来一定还会继续做。

研究:

text 复制代码
什么 Teacher 最适合什么 Student?

Teacher越强越好吗?

跨模型家族:
DeepSeek → Qwen
Claude → Qwen
Llama → Qwen

能不能有效蒸馏?

目前答案已经比较明确:

不是 Teacher 越强越好。

关键是:

text 复制代码
Teacher Capability
        +
Policy Compatibility

因此现在出现:

text 复制代码
Teacher Selection
Multi-Teacher
Debate Teacher
Cross-family Distillation
Adaptive KL

(arXiv)


二十八、第五梯队:Process-level / Turn-level Supervision

过去:

text 复制代码
Sequence-level Reward

现在:

text 复制代码
Turn-level
Step-level
Token-level

开始组合。

尤其 Agent:

text 复制代码
Turn 1:Plan
Turn 2:Search
Turn 3:Read
Turn 4:Search
Turn 5:Answer

问题变成:

到底哪个 turn 应该学 Teacher?

TurnOPD 就明确开始从 token-level budget 转向 turn-aware budgeting 。(arXiv)

这和之前 Agent RL 的:

text 复制代码
Process Reward

实际上正在逐渐汇合。


二十九、第六梯队:重新研究"RL / OPD 到底学到了什么"

这是偏基础研究,但非常热。

核心:

text 复制代码
RL到底创造了新reasoning能力吗?

OPD真的transfer了Teacher knowledge吗?

还是只是:

改变现有trajectory概率?

评估也从:

text 复制代码
pass@1

进入:

text 复制代码
pass@K
avg@K
large-K capability
policy entropy
trajectory diversity

2026 年最新 OPD 研究已经开始明确挑战:

"OPD = 从 Teacher 获得新能力"

这个传统叙事。(arXiv)


三十、如果专门放到 Agentic Search,我认为路线会长这样

你前面已经有:

text 复制代码
Search-R1
DeepResearcher
WebDancer

↓

Outcome RL / GRPO

现在可以继续往下补:

text 复制代码
                     Agentic Search Post-training

                              │
                 ┌────────────┴────────────┐
                 ↓                         ↓

              RL / GRPO                   OPD

                 │                         │
       Search Agent自己探索        Student自己跑Search
                 │                         │
          Final Reward              Teacher逐步指导
                 │                         │
          Search Policy             Dense Supervision

                 │                         │
                 └────────────┬────────────┘
                              ↓

                       Hybrid RL + OPD
                              │
                 ┌────────────┼─────────────┐
                 ↓            ↓             ↓

              Outcome      Teacher       Efficiency
              Reward       Guidance       Reward

                 ↓            ↓             ↓

            Answer正确    Search策略好   搜索不要过多

                       ↓

               Long-Horizon Search Agent

       Plan → Search → Observe → Verify → Search → Stop

我不会推荐:

"做一个 OPD,然后和 GRPO 比 Accuracy。"

这个题已经偏简单。

我更推荐:

例如研究:

text 复制代码
Outcome Reward
+
Teacher token guidance

Teacher 专门指导:

text 复制代码
when-to-search
query generation
stop decision

但最终:

text 复制代码
Correctness
Evidence
Efficiency

仍由 RL reward 控制。

如果不加 OPD:

Agent 在长 trajectory 中:

text 复制代码
reward sparse
credit assignment困难

如果不用 RL:

Agent 容易:

text 复制代码
被 Teacher policy ceiling 限制

这两者组合非常合理。


三十二、备选方向:Turn-level OPD for Deep Research

这个可能更适合真正 Agentic Search。

不要:

text 复制代码
每一个 token
都找 Teacher

而是:

text 复制代码
Plan turn
Search query turn
Evidence judgment turn
Stop turn

只在关键决策点:

text 复制代码
Teacher supervision

比如:

L = w p L p l a n + w s L s e a r c h + w e L e v i d e n c e + w s t o p L s t o p + λ L R L L = w_pL_{plan} + w_sL_{search} + w_eL_{evidence} + w_{stop}L_{stop} + \lambda L_{RL} L=wpLplan+wsLsearch+weLevidence+wstopLstop+λLRL

这样相比 vanilla OPD:

text 复制代码
Teacher cost ↓

而且 supervision 更符合 Agent 的:

text 复制代码
decision-level structure

而不是平均撒在所有 token 上。

TurnOPD 的最新结果实际上已经在支持这种"long-horizon Agent 不应只按 token 均匀蒸馏 "的方向。(arXiv)


三十三、最后把 SFT、OPD、RL 三者一次讲透

这三个东西你以后可以这么区分:

text 复制代码
                         Training Signal


SFT
│
├─ 谁产生trajectory?
│     Teacher / Dataset
│
├─ 学什么?
│     标准答案
│
└─ 本质
      模仿正确行为


OPD
│
├─ 谁产生trajectory?
│     Student
│
├─ 谁指导?
│     Teacher
│
└─ 本质
      在自己犯错的地方
      学Teacher怎么做


RL
│
├─ 谁产生trajectory?
│     Student
│
├─ 谁指导?
│     Reward / Environment
│
└─ 本质
      自己探索
      好结果得到强化

所以我会把现代 Agent 后训练理解成:

SFT负责"会做" \boxed{ \text{SFT负责"会做"} } SFT负责"会做"

OPD负责"有人带着改" \boxed{ \text{OPD负责"有人带着改"} } OPD负责"有人带着改"

RL负责"自己探索怎么做得更好" \boxed{ \text{RL负责"自己探索怎么做得更好"} } RL负责"自己探索怎么做得更好"

而 2026 年最值得看的方向不是三选一,而是如何把三者组合起来:

text 复制代码
SFT Cold Start
      ↓
On-policy Agent Rollout
      ↓
Teacher Dense Guidance
      +
Environment Outcome Reward
      ↓
OPD + RL
      ↓
Long-Horizon Agent

尤其对 Agentic Search 来说,我会重点盯 Turn-level OPD / OPD+RL / Teacher-Student Mismatch / Efficient OPD / Long-Horizon Agent Distillation 这几条,而不是只继续追 GRPO 的 optimizer 变体。

相关推荐
Setsuna_F_Seiei4 小时前
前端转型 Agent 开发 06 之 Agent Memory 记忆系统(让 Agent 更智能,更懂你)
前端·agent·ai编程
孟健5 小时前
Qwen3.8-27B 本地推理实测:从 14 tok/s 到 159 tok/s 的投机解码调优
人工智能·llm·ai编程
Flynt5 小时前
HN 614 分的 16.9MB 语音模型,我在 1 核 2G 上实测了一遍
llm
YYYing.7 小时前
【Agent系列 (二) 】大语言模型基础
人工智能·语言模型·自然语言处理·agent
大模型真好玩8 小时前
从 SDK 到成熟智能体:拆解 LangChain、Pi、DeepSeek Harness、Claude Code的本质区别
人工智能·agent·deepseek
梦在远山后8 小时前
通过 WSS 让 Server 安全调用 Desktop 本地工具(下01):Ticket、人工确认、幂等与断线对账
python·langchain·agent
阿里云云原生9 小时前
阿里云发布 AgenticOps 全栈能力,让 Agent 成为运维与研发的第一用户
agent
阿里云云原生9 小时前
阿里云刚发布的 AgentCore 有何不同?
agent
xiaozongt198910 小时前
AI代码学习-Function Calling + ReAct
agent·ai编程
阿里云云原生11 小时前
从个人生产力到企业生产力,阿里云发布企业级 Agent 平台 AgentCore
agent