技术栈
奖励模型
thesky123456
20 天前
大模型
·
rlhf
·
奖励模型
·
ppo
·
dpo
·
grpo
·
强化学习对齐
27届大模型面试准备(七十三):大模型强化学习对齐工程实战——RLHF、PPO 与 GRPO 的训练流水线
引言前面把后训练(A16)、对齐税(A48)、多模态训练(A40)、工具调用训练(A42)都铺开了。本篇把"对齐"里最硬核、也是面试官最爱追问的一段单独拎出来讲透:基于强化学习的对齐训练。它和上一篇高频八股(A52)、指令遵循(A48)是一条线,但更偏工程实现——奖励模型怎么训、PPO 为什么要有 critic、GRPO 怎么把 critic 省掉、DPO 又怎么绕过奖励模型直接做偏好。
qcx23
4 个月前
人工智能
·
llm
·
sft
·
预训练
·
奖励模型
·
对齐
·
路线
【系统学AI】03 LLM训练全流程:预训练→SFT→对齐五条路线
一个LLM从"一堆随机参数"变成"ChatGPT那样能用",要经过三个阶段。这篇文章把三步全部讲透——前两步定义清楚、流程画清楚、成本算清楚,重点拆解第三步(对齐训练)在2026年已经分化出的5条路线。
阿杰学AI
5 个月前
人工智能
·
深度学习
·
ai
·
语言模型
·
强化学习
·
奖励模型
·
rm
AI核心知识121—大语言模型之 基于人类反馈的强化学习 (简洁且通俗易懂版)
奖励模型 (Reward Model, 简称 RM) 是 RLHF(基于人类反馈的强化学习)架构中不可或缺的“电子裁判” 。
阿杰学AI
9 个月前
人工智能
·
ai
·
语言模型
·
aigc
·
奖励模型
·
rm
·
reward model
AI核心知识43——大语言模型之RM(简洁且通俗易懂版)
奖励模型(Reward Model,简称 RM) 是大语言模型在 RLHF(基于人类反馈的强化学习) 阶段中不可或缺的一个组件。
汀、人工智能
3 年前
人工智能
·
语言模型
·
自然语言处理
·
llm
·
强化学习
·
奖励模型
·
深度强化学习
精进语言模型:探索LLM Training微调与奖励模型技术的新途径
LLMs Trainer 是一个旨在帮助人们从零开始训练大模型的仓库,该仓库最早参考自 Open-Llama,并在其基础上进行扩充。
我是有底线的