【行业前沿报告】SCoRe:为什么会改答案,还需要专门训练摘要:本文解读 ICLR 2025 论文 SCoRe,它用两阶段多轮强化学习训练语言模型进行内生自我纠错。文章先厘清“测试时不给对错反馈”的信息条件,再用“错改对”与“对改错”两个转移量说明纠错收益的度量;随后分析监督微调为何难以教会纠错(分布偏移与行为坍塌),并拆解 SCoRe 两阶段训练与分轮奖励设计,指出“把纠错奖金乘到整条对话”是常见实现误区。主实验显示 SCoRe 在 MATH500 净提升 4.4 pp、HumanEval 净提升 12.2 pp,消融与更长推理实验则给出方法边界。检查模型是否