PPO系列4 - Reward模型训练

流程:

训练Reward模型

训练数据:

相比给每条回答进行打分,人类更容易给出两者的比较结果。这样标注出来的数据,准确性更高。

模型:

可以使用和生成模型能力差不多的模型(或者更强的模型),作为Reward模型。

不能使用太差的模型,因为Reward模型是"老师"的角色,差老师教不出好学生。

但可以使用和生成模型能力差不多的模型。因为:Reward打分任务,比生成任务,难度小很多,更容易做对。例如:我来评判一篇文章《赤兔之死》是否写得好,比自己写出这种水平的文章,要容易很多。

是否能用强化学习无限提升模型能力?答:不行的。大模型的能力主要是在预训练阶段决定下来了,SFT和强化学习,都只是让大模型能力尽量发挥出来。

生成式模型:

如上,生成是N个token的概率。

Reward模型:

如上,输入是(question+chosen)或(question+rejected),生成是1个得分。

因此,Reward模型,只需要把生成式模型的最后一层(LM Head),替换成生成1个得分的层(Score Head),即可。前面的层可复用。

损失函数:

让chosen和分数 - rejected的分数,越大越好。

Reward模型推理2次,1次计算chosen的得分,1次计算rejected的得分。

代码:可用Huggingface的trl库里的RewardTrainer来做训练。

相关推荐
网络工程小王12 小时前
【LLM开发实验】强化学习实现原理及实战
深度学习·强化学习·rlhf·ppo·dpo·grpo
白拾1 天前
【arXiv 2026】LoGos:把人类思考带回围棋——通用大模型的专业领域专家之路|从围棋AI与LLM推理交叉视角
强化学习·大模型推理·arxiv 2026·logos 论文分享·围棋ai·专家知识注入
Terrence Shen1 天前
【读论文系列】AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS翻译+解读
大模型·agent·强化学习·rl
白拾2 天前
【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角
强化学习·colm 2025·search-r1 论文分享·llm后训练·检索增强推理
海天一色y2 天前
深入解析 DeepSpeedPPOTrainer:基于 PPO 的大规模 RLHF 训练实现
人工智能·强化学习·deepspeed·后训练
皮卡丘不断更2 天前
从一段 RGB 视频到机器人开门:读懂 Video2DoorTraversal 的仿真闭环
机器人·强化学习·数字孪生·具身智能·机器人仿真
山顶夕景3 天前
【MLLM Agent】多模态理解Agent研究进展
agent·强化学习·多模态·rl·agentic
闲研随记3 天前
【文献阅读 ICLR 2026】RL算法:DECS
算法·llm·强化学习·iclr·rl
XLYcmy4 天前
小红书 算法一面 十二
llm·负载均衡·强化学习·多模态·ppo·dpo·grpo
盼小辉丶6 天前
PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏
pytorch·深度学习·语言模型·chatgpt·强化学习