【RL系列文章】难样本学习等综述:看了很多,总的来说,不利用外部信息的都基本比较扯淡。链接:https://arxiv.org/pdf/2602.01601 本文的核心理论即我们到底选择哪些样本去学习,DAPO的逻辑是把全对全错的去掉,但是这个属于先rollout再评价好坏;本文提出可以事先根据query进行预测答对的概率。本文先证明了一个重要的前提,答对概率越接近50%的题目越具有信息量,优先采样这部分会对训练更有效。 为此,本文设计了一个非常巧妙的纯数学计算的方法,动态的维护题目答对的可能性。已经答过的题的答对概率被更新,未答过