RL 效率综述
范围
本综述记录与提升 LLM RL/RLVR 效率相关的已有工作,重点关注难样本处理、信用分配、隐状态信号、rollout 分配和训练动态。
收录规则
允许来源:ICML、NeurIPS/NIPS、AAAI、ACL、ICLR、EMNLP,以及大公司技术报告。每篇论文笔记必须包含 arXiv 链接、代码状态、会议或机构证据。
路线图
| 路线 | 代表论文 | 核心机制 | 重叠风险 | 未解决问题 |
|---|---|---|---|---|
| 隐式计算槽位 | Pause Tokens; Coconut | 在输出词元前加入暂停/隐式计算,让部分推理不落成自然语言词元 | 仅加隐式/暂停词元已被覆盖;Coconut 已覆盖连续隐式思考 + 课程学习 | 如何把标准答案转成可验证的证明状态目标,而不是只靠剩余词元交叉熵 |
| 表示读出与控制 | Representation Engineering; CAA | 从正负刺激 / 解答中读出隐状态方向,并进行激活控制/投影 | 均值差控制、PCA 方向、RepE 评估框架已被覆盖 | 数学推理中的方向必须通过因果干预,且不能只是风格、长度、模板 |
| 表示微调 | ReFT | 冻结基座语言模型,训练作用于隐状态的低秩干预 | 直接做隐状态干预 SFT 与 ReFT 重叠 | 如何让干预表示答案/证明状态,而不是仍然由词元交叉熵驱动 |
| 世界模型探针 | Language Models Represent Space and Time | 隐状态中可线性读出空间/时间等结构变量 | 探针成功不是因果使用 | 数学中的证明状态/约束状态是否可读、可控、可训练 |
| 零阶 / ES / swarm 后训练 | ES at Scale; EGGROLL; Model Swarms; LOZO; ZO-Finetuner; LOREN; MeZO-SVRG; QuZO | 覆盖全参数 ES、fresh low-rank population、LoRA/LLM 权重粒子的完整 PSO、低秩子空间、自适应协方差、方差控制和量化训练 | LoRA + no backprop + population/PSO search 已不是空白;Model Swarms 已完整使用 velocity、personal/global best 和 reward utility |
能否在 matched query 下突破 Model Swarms 的初始 expert 仿射包,并同时保留已发现方向 |
| RLVR reward baseline | OPO; SPO; BV-Blend; James-Stein Baselines; POISE | 覆盖 score-norm/length-weighted optimal baseline、persistent global tracker、semantic-cluster historical moments、跨 prompt shrinkage、actor hidden-state value estimation | 普通 cluster EMA、global tracker、length weighting、轻量 value probe 均已有直接近邻 | 尚可检验:在 prompt semantic function space 中直接估计 score-weighted variance-optimal projection,并证明 gradient MSE 独立下降 |
严格在线 single-rollout (G=1) |
InstructGPT/PPO; RTO; (A^\star)-PO; Single-stream PO | PPO 用 learned critic;RTO 用 preference-derived token reward;(A^\star)-PO 用离线固定最优 value;Single-stream PO 用每题历史 Beta/EMA tracker | 不能把 GRPO 直接设 G=1;A*PO 与 Single-stream PO 默认都在初始化阶段每题采 8 条,RTO 依赖额外 preference data |
真正未解决的是:不做额外分支 rollout 时,如何获得可靠的 token/segment signed credit,而不只是 sequence advantage 调幅 |
| 相关 rollout 的无偏 policy gradient | CARMS; QuasiMoTTo; XQPO | CARMS 允许已知 joint PMF 的 categorical antithetic estimator;QuasiMoTTo 已计算 arithmetic-QMC sequence pair law,但 lattice 不覆盖 iid pair target;XQPO 通过独立 blocks 绕开依赖 | FACS-RL 用 q_rho=(1-rho)pi⊗pi+rho q_Q 把 lattice coupling 变成 full-support、ratio 有界的 sequence-level proposal,再用 pairwise PoD 校正 |
weak-to-pass;必须先同时超过 iid-RLOO 与 XQPO 的 fixed-checkpoint gradient MSE,并证明 overlap/weight 成本没有吞掉 coverage 收益 |
| Counterfactual credit / reset RL | RRPO; SRPO | 从 thought-level prefix reset 并重采样 suffix,mask shared prefix,只在可区分 continuation 的 suffix 上做 outcome RL | trajectory advantage × token importance 只调幅度,不能替代 action-conditioned counterfactual value;FlowTracer/EAPO/STARE 已覆盖 saliency/entropy/surprisal reweight |
若用 BT,只能拟合同 prefix 的 action/suffix relative value;二元可靠 verifier 下先用直接 suffix success-rate,且任何新方法必须 compute-matched 超过 SRPO |
| 业务场景动态 Skill 加载 | AutoGuide; AutoManual; UPRISE; AWM; RouteLLM; Memp; SkillsBench; SRA-Bench; SkillRet | 覆盖状态感知 guideline 选择、外部手册/流程构建、提示检索训练、偏好路由、程序性记忆维护和 2026 Agent Skill 评测 | embedding top-k + prompt 注入 已非空白;不能把业务 Skill 问题写成功能调用,也不能用固定 skill ID 证明新增 Skill 泛化 |
开放问题是用业务效用训练带 NONE/ASK/DEFER 的描述条件化 Router,并单独训练加载后的 Skill incorporation,在完全未见 Skill、错误 Skill 拒绝、规则冲突和多轮状态变化上泛化;详见项目根目录 dynamic_skill_loading_survey.md |
| On-policy / privileged self-distillation | GKD; MiniLLM; OPSD; PI-Distill; RLSD; RLCSD; Purified OPSD; EDGE-OPD; PW-OPSD; DOPD; PHF; Rethinking OPSD; LEAP; PromptKD; MetaDistil; RSR; Variational Reasoning | student-prefix KD、PI-conditioned self-teacher、evidence-ratio RL、correct/wrong hint contrast、reference-only purification、evidence token mask、position weighting、dual token routing、hidden-flow distillation与高熵分叉诊断 | 静态 PI teacher、token evidence/mask/position weight、privileged teacher/student token routing、直接复制 privileged hidden flow 均已有近邻;raw attention token weighting 风险极高 | 可检验空白:不重权 token,而以 attention-path intervention 构造 reward-constrained minimal-information teacher,检验 teacher utility--PI dependence frontier 是否预测最终无 PI transfer |
| 失败触发的反馈纠正 | STaR; LEMA; SELF-EXPLORE; SCoRe; Guide; HiLL; Feedback Friction | 覆盖答错后给答案/提示重试、错误解释与修正数据、首错误细粒度偏好、在线多轮纠错 RL、全错组自适应提示、hint transfer weighting 与反馈抗拒 | wrong→hint→correct、三元组纠错、全错触发提示和按无提示似然选择 hint 均已被覆盖;同题二次答对不等于训练后能力固化 |
可检验残差:更新后在无提示、同技能不同实例上的 cross-consolidation gain,是否比 difficulty、hint lift 与 HiLL reliance 更能预测最终训练收益 |
| Instruction following / context use | IFEval; AgentIF; IFBench; AdvancedIF; Context-faithful Prompting; ReasonIF(未收录预印本); POPE(未收录预印本) | 已覆盖可验证格式约束、真实 agent 长指令与 tool/condition constraints、held-out constraint RLVR、复杂多轮/system prompt rubric RL、上下文与参数知识冲突 | "模型经常忽略 Skill/上下文"和"做 IF-RL 能提高遵循"不是新 claim;AgentIF 已有 CSR/ISR,AdvancedIF 已有 rubric verifier+RL,IFBench 已有 OOD constraint RLVR | 尚缺的是 Skill-specific incorporation:检索/加载正确后,模型能否根据任意未见 Skill 改变工具与回答、拒绝 matched wrong Skill,并把 teacher-only correction 迁移到保留 Skill 的 deployment policy |
| 固定多项 Rubric Judge 蒸馏 | LLM-Rubric; Prometheus; JudgeLM; Con-J; EvalPlanner; J1; Think-J; ArmoRM | 覆盖多维 rubric 概率+校准、custom criterion evaluator SFT、GPT-4 Judge 蒸馏、受控 judgment DPO、Judge correctness GRPO、multi-objective RM | "生成式 Judge 在 SFT 后用 DPO/GRPO 可提升"已被覆盖;本项目step-200的裸0.8*item_F2+0.2*Better reward约0.75震荡且record recall下降3.79pp。SFT缓存24组×64条中83.3%组有reward方差且mean oracle gap为0.234,说明并非完全无候选信号;但64条极值需subsample到真实训练G |
下一步不能仅凭clipfrac=0/ppo_kl≈0判定LR过小:先确认verl指标时点,用固定probe测SFT→checkpoint累计KL/log-prob漂移,拆分Must/Better组内方差,再做同起点20--50步1e-6/3e-6/5e-6 sweep。JSON可保留;DPO不是必经步骤 |
当前想法重叠图
| 想法 / 机制 | 最接近的已有工作 | 重叠点 | 差异 | 判断 |
|---|---|---|---|---|
| LCR / 隐状态反事实稳健 reward | MC Dropout robustness, Activation uncertainty, Hidden-Align, DynaMO | 都利用扰动/隐状态/不确定性 | 不训练 confidence model,不构造数据;用最终验证器复验隐状态扰动后的短答案,作为 RLVR reward 稳健估计 | weak-to-pass;前置实验需证明不是 entropy/logprob 换皮且成本低于多 rollout |
| LRD / 自然修正隐状态蒸馏 | Oops Wait, Single-Utterance Self-Correction, Coconut, Hidden-Align | 都关注自我修正、latent slots 或 hidden states | 不强化 wait token,不人工扰动 CoT;蒸馏自然成功修正前后的隐状态跃迁为 latent revision operator | rejected;自然成功修正事件稀疏且有冷启动死局,诱导数据会破坏自然性假设 |
| ACIPS / 答案控制不变证明子空间 | Hidden-Align, TILR, Coconut, ReFT, HARP | 都使用隐状态、低秩子空间或 latent slots | 显式把答案泄露、格式、长度作为 nuisance,要求同答案不同题分离,并用 proof subspace 训练 latent slots | rejected;核心依赖大量人工 answer-controlled 对照组,数据构造本身会制造伪信号 |
| MIPS / 多解不变证明状态优化 | Hidden-Align, Coconut, ReFT, RepE, CAA, TILR | 都使用隐状态、隐式槽位或表示方向;Hidden-Align 已覆盖正确 rollout hidden-state 对齐 | 当前版本新颖性一般;必须从单均值 c_q 改成 answer-controlled invariant proof subspace / prototype set,并证明不是 answer state |
weak-to-revise;Hidden-Align 必须作为强 baseline |
| 答案状态蒸馏 | RepE, CAA, ReFT, Coconut | 都使用隐状态表示 / 隐式状态 | 需要强调同题多解不变性、因果干预、短答监督,而不是词元级 CoT 模仿 | 可探索,但必须先做隐状态前置实验 |
| 隐槽位 SFT | Pause Tokens, Coconut | 输出前隐式计算 / 连续思考 | 若只替换 CoT 词元,则与 Coconut 高重叠;可加入证明状态对齐或验证器约束的隐状态目标 | 可探索,创新点必须在目标和验证 |
| 正确/错误解激活均值差控制 | CAA, RepE | 均值差激活方向 | 无明显差异 | 不能作为独立 idea,只能作为诊断或组件 |
| SDPT-PSO / 固定低维 LoRA 粒子群搜索 | ES at Scale, EGGROLL, LOZO, ZO-Finetuner, LOREN, Derivative-Free LoRA | 都是 forward-only 参数空间搜索;EGGROLL 已在 7B GSM8K 做 fresh low-rank ES | 当前 PSO 使用固定 U,全程仍在同一 16D 空间;跨 batch pbest 不可比 |
fail as paper;仅保留"置信重评 swarm memory 是否比 EGGROLL 更省 query"的前置实验 |
| CIES / 置信可识别参数搜索 | Guided ES, EGGROLL, LOREN, SDPT-PSO | 都在参数空间用函数值选择更新;RL gradient subspace 也不是全新对象 | 删除永久 pbest/gbest,把 antithetic probes 作为带噪线性测量,仅提交置信集合内仍为正的方向 |
weak-to-revise;必须先证明在 matched query budget 下减少错误 commit 并超过 EGGROLL/Guided ES |
| PSO-LoRA / Model Swarms 邻域 | Model Swarms, EGGROLL, Particle Swarm Guided ES | Model Swarms 已把 LoRA/LLM 当粒子并使用完整 PSO;EGGROLL 提供 fresh low-rank 支持扩张;经典 PSGES 已融合 PSO 与 ES mutation | 唯一尚可检验的问题是"PSO 利用初始 expert span、ES 只探索其正交补"的严格分工是否带来不可被 PSGES/EGGROLL 复现的 query efficiency | open but high-risk;必须先做 affine-hull escape 与 compute-matched falsification |
| SNBPO / semantic historical baseline | BV-Blend, OPO, SPO, James-Stein Baselines, POISE | BV-Blend 已直接覆盖 fixed KMeans + semantic-cluster historical EMA moments + uncertainty blending;OPO 已推导 score-norm-weighted optimal baseline;SPO/POISE 已覆盖 single-stream 或 lightweight value estimation | 当前可检验修订 VOSB:把 prompt semantics 作为 baseline function basis,直接求 score-weighted variance-optimal projection;G=1 仅为结果 |
weak-to-pass;必须在 fixed-checkpoint gradient MSE 上同时超过 const、ordinary semantic regression、BV-Blend 和 OPO length proxy,否则语义 baseline 主线失败 |
| Orbit-Invariant RLVR / 等构 verifier reward | IPT / LLMs Gaming Verifiers(arXiv:2604.15149) | 都用逻辑等构变换检查是否真正学到规则,而非只通过原 verifier | IPT 已在受控 RLVR 中比较 extensional 与 isomorphic verifier,并报告后者消除 shortcut;变换 reward 的直接主张已被覆盖 | rejected;只能作为 reward-hacking 审计,不能作为主算法 |
| PIVOT-OPSD / 反事实 PI 接口选择 | MetaDistil; LEAP; PI-Distill; PromptKD; RSR; OPSD | 都关注 teacher/student capacity、PI realizability、student-friendly supervision 或 post-update student performance | 不优化 teacher 相似度或 token 权重;对多种 PI 做稀疏一步试更新,用独立无 PI verifier reward 定义操作值,允许 NULL 并随 checkpoint 重审计 |
weak-to-pass;MetaDistil 是最大历史碰撞。只有接口排序反转、一步 transfer 预测长期收益、且 compute-matched 超过 fixed-best PI 时才成立 |
| PIE-OPSD / PI 执行能力隔离与固化 | PI-Distill; Variational Reasoning; MetaDistil; Deep Context Distillation; POPE; ReasonIF | 都训练 teacher/posterior、压缩 context 或指出 instruction following 影响推理 | 不改变 PI 构造、不做 meta-gradient;用无 PI 时严格为零的 PI-only executor 隔离 acquisition,冻结 backbone 学 PI utilization,再冻结 executor 做 on-policy consolidation,最终丢弃 executor | weak-to-pass;若共享 π-Distill 不存在 correct-vs-shuffled false-utilization,或 matched compute 无优势,则退化为 teacher-only adapter + EM,应直接否决 |
| RIFT-OPSD / 层级可实现 PI 残差投影 | PIE-OPSD; Auxiliary Modality Learning; Multimodal Representation Collapse; Deep Context Distillation; intermediate-layer KD | 都涉及训练期辅助信息、跨层融合/蒸馏、缺失模态或隐状态匹配 | 不以 raw teacher accuracy 选层;在输出 Fisher metric 下把 PI residual 投影到无 PI hidden 可实现函数空间,用 reachable teacher 做 OPSD,并以 retained reward 选择层 | weak-to-pass;原始"PI 当模态 + layer sweep"接近 fail。只有 raw utility 与 reachable utility 稳定排序反转、Fisher projection 胜 hidden MSE/logit-only、且 matched-compute 胜 OPSD/PIE 时才成立 |
| MIST-OPSD / 最小信息 privileged teacher | RLSD; EDGE-OPD; PW-OPSD; DOPD; Purified OPSD; PHF; ContextCite; causal attention pruning | 都诊断或修改 PI token/hidden/context signal | raw attention 只定位候选通路;通过 PI-on/off attention gate 干预测 JSD 依赖,在保留 PI reward 增益的约束下搜索最少依赖 PI 的整体 teacher,再执行未重权的 OPSD | weak-to-pass;若只是 attention token mask 则 fail。只有 utility--dependence frontier 稳定存在、依赖指标胜 raw attention/evidence/position 预测 transfer,且 matched-compute 胜 Purified OPSD/EDGE/DOPD 才可保留 |
| SCD / Skill-Causal Distillation | OPSD; PI-Distill; RLSD; Purified OPSD; SkillsBench; SRA-Bench; AgentIF; AdvancedIF | 试图把 privileged correction 与 runtime Skill 统一进同一 counterfactual distillation 目标 | 项目当前明确要求两条独立路线:OPSD 不加载 Skill;动态 Skill 不考虑 OPSD | rejected;问题边界不符。后续不得用"都是外部信息"作为合并两条路线的理由 |
| CCT / 跨题无提示固化选择 | STaR; LEMA; SCoRe; Guide; HiLL; MetaDistil | 都用错误、提示、修正或 student post-update performance 改善训练 | CCT 不以同题 hinted success 为"学会",而用短 pilot update 后、同技能兄弟题上的 no-hint reward change 测固化;不直接 meta-train teacher | weak-to-pass;若该分数不能在 matched cost 下额外预测长期收益,或只在同题有效,则降级为分析工具 |
| DR-FPO / 纠错提议策略优化 | RLTF-SD; VPD; Guide; HiLL; DistIL; DR-Off-PAC | 首答失败后获取文字反馈并二答、再把反馈条件能力迁回无反馈策略;DR off-policy gradient 本身亦有经典先例 | 不把二答当 demonstration,而把它视为由失败选择、反馈上下文生成的 proposal;用 propensity、context ratio 与 outcome residual 估计同一个无反馈 reward gradient | rejected / Level 2 high overlap;用户明确不接受该重合等级,停止作为论文候选 |
| FUSE / 反馈条件更新后验 | MEND; CaMeLS; Text2Grad; RLTF-SD; LETI; Text-to-LoRA; Bi-NAC | 都覆盖 learned update rule、文本到梯度/adapter、二元+文本反馈或以 post-update 表现衡量反馈 | 额外学习 update posterior,本质上仍是另外的更新模型;不符合"单一简单原理"的约束 | rejected;用户明确否决模型堆叠和隐藏的 loss 融合,不再推进 |
| CAP-Map / OPSD 特权信息因果通路与迁移图谱 | RLSD; RLCSD; Purified OPSD; EDGE-OPD; ContextCite; Attention Flow; ALTI | 都测量 PI 引起的 logit、token evidence、context attribution 或 attention flow | 不立即改 loss;在固定 student trajectory 上对 PI→response attention edges 做因果 gate,使用 same-length shuffled/wrong/null PI 消除位置与模板混淆,检验内部通路特征是否预测最终无 PI transfer | diagnostic candidate / Level 3 question;若因果通路不能比 raw attention、RLSD log-ratio、ContextCite 更好地预测 transfer,立即否决 |
| Feedback-Triggered Boundary Training | STaR; ILF; LEMA; SCoRe; RLTF-SD; Guide; HiLL; DAPO; CoDaPO; Step-DPO | 覆盖失败重试、文本反馈修正、0→10\to10→1 奖励、迁回 no-feedback policy、易/难/可学边界采样与首错偏好训练 | 将所有训练数据统一成动态 (y+,y−)(y^+,y^-)(y+,y−) 边界对,反馈仅用于 minimal repair 数据生成,易题衰减改为采样衰减而不改 reward | review draft / Level 2 high overlap;只有证明 0→10\to10→1 boundary episodes 在等计算下带来稳定更高的跨样本 no-feedback transfer,才能升级 |
| CCF / Counterfactually Coupled Feedback | RLTF-SD; SCoRe; InT; Gumbel Counterfactual Generation; Coupled Token Generation; DPO | 反馈纠正、局部 intervention、Gumbel coupling 与 preference optimization 已分别被覆盖 | 同噪声只改善 pair construction,最终目标仍是标准局部 DPO | rejected / fail;已有 counterfactual sampling + DPO 的组合不足以形成 ICLR 方法创新 |
开放问题
- 如何把一条正确答案转成可泛化、可干预、跨解法不变的隐式证明状态。
- 如何证明隐状态信号是因果能力对象,而不是探针伪影或风格/模板特征。
- 如何把 SFT/RL 的监督从完整 CoT 词元模仿转移到隐式槽位 / 隐状态干预,同时保留最终答案正确率。
- 详细综述见
all_ref/hidden_state_sft_internalization_survey.md。 - 零阶/ES 专题见
all_ref/zo_es_post_training_survey.md。 - 单 rollout、PPO/GRPO 与 rollout 成本专题见项目根目录
allinone.md。 - 动态 Agent Skills 的独立方案(召回训练、使用训练、Skill 组织、使用能力评测)见项目根目录
skill_training_retrieval_execution_benchmark.md;背景综述见dynamic_skill_loading_survey.md。 - OPSD 的独立优化方案(RLSD、PI 遵循、PI-USE-Agent Benchmark、无 PI 迁移)见项目根目录
opsd_optimization_pi_following_survey.md;早期综述与 PIVOT-OPSD 提案见opsd_iclr2027_survey_and_pivot.md。 - PI instruction execution 新方向与 PIE-OPSD 详案见
ideas/2026-08-10_pie_opsd.md。 - PI 作为训练期辅助模态的层级融合、Fisher-reachable projection 与 RIFT-OPSD 详案见
ideas/2026-08-14_rift_opsd.md。 - PI attention 因果干预、最小充分 privileged teacher 与 MIST-OPSD 详案见
ideas/2026-08-17_mist_opsd.md;ContextCite 论文笔记见all_ref/papers/2409.00729_contextcite.md。 - 开放式工具 Agent 的 PI utilization / instruction following 评测近邻见
all_ref/agent_pi_utilization_survey.md。 - 固定 Must/Better 多项 LLM Judge 的 partial-label SFT、DPO/GRPO 和 constrained reward 综述见项目根目录
llm_judge_training_survey.md。 ideas/skill_conditioned_opsd_dynamic_skills_plan.md是已否决的混合路线存档,不再作为后续方案依据。- 单 rollout 异质反馈统一的新近邻包括 UFT、SRFT/CHORD、BRAIn、Text2Grad、Provably Learning from Language Feedback、Post-Training is About States, Not Tokens,以及 GKD/OPSD/PI-Distill/RLSD/EDGE-OPD。
single rollout + rich feedback、feedback bandwidth hierarchy、reward posterior与SFT/RL loss mixing均已被覆盖;尚可检验的残差是把 demo/verdict/PI 编译为相交的 policy constraint set,求 minimum-KL feasible target,并用 infeasibility certificate 处理反馈冲突。详见ideas/2026-08-18_single_rollout_feedback_projection.md。 - 失败条件二答的新近邻以 RLTF-SD(ICML 2026)为首:它已覆盖首答、critique、二答、paired advantage、成功二答 SFT,以及 exact context IS 与 practical AWR 的取舍。可检验残差 DR-FPO 聚焦 failure-selection 与 feedback-context 的双重偏差;详见
ideas/2026-08-18_corrective_proposal_policy_optimization.md,逐步 novelty 审计见ideaspark_run/right-wrong-how-correction/scoop/。 - CCF 已否决,见
ideas/2026-08-21_counterfactually_coupled_feedback.md。决定性问题不是 coverage,而是优化目标完全退化为局部 DPO;same-noise SCM 只提供更干净的数据对。后续不得把新的 pair 筛选、coupling、minimal edit 或局部 span 构造直接包装为新算法,必须先说明新的学习对象或 estimator 为何不能被标准 DPO/SFT/RL 复现。 - Refine B / Failure Closure Distillation 见
ideas/2026-08-27_refine_b_failure_experience_internalization.md。纠正后的学习对象是有序失败集状态F_0→F_1→...→∅:每轮修复后重评,记录 resolved、persistent、regressed 与 newly exposed failures,并把整个 closure policy 压到无 Checklist 首答。PRECHECK 只是可能实现,不是核心定义。 - 2026-08-31 纠正裁决:撤回
Level 2 high overlap,改为not scooped / Level 3 medium adjacency。Self-Refine 覆盖多轮历史 refine 但不内化;TRD 覆盖单次 refine-then-distill;SGSD/SEED 覆盖经验型 mistake/avoidance skill 蒸馏;SD-Zero/RLTF-SD 只覆盖一次 revision;ReflexiCoder 在推理时仍执行反思循环;TTPO 无 refine。尚未发现工作同时覆盖"修复后才暴露残余失败"的有序闭合与首轮参数内化。必须用 Full-Closure 对 Final-Only、One-Revision、Last-Failure-Only、Shuffled-History 的 held-out no-checklist 增益和失败复发率来支撑该 delta;详见step1.md--step7.md。 - 2026-09-04 实施口径按真实流水线修正:主机制采用
n=1 chain mode,每题每轮一答,错误经策略诊断后追加到题级有序history再继续回答;n=4 aggregate mode则将同题本轮多条错答汇总为一张题级经验卡,只作为failure-discovery/coverage配置,不再描述成四条互不共享经验的独立链。AIME24上Qwen3-4B think/6k配Qwen3.8-27B judge从7/30闭合到15/30,前三轮救回7/8,支持三轮collection,但仍缺matched no-feedback/shuffled因果对照与参数内化证据;详见experiments/2026-09-04_qwen3_8_27b_judge_direct_refine.md。