grpo

论文复现现场18 小时前
deepspeed·qlora·大模型训练·vllm·rtx4090·grpo·qwen3.8
Qwen3.8-27B 做 GRPO 需要几张 GPU?4×RTX 4090 与 8×RTX 4090 显存、vLLM 和 ZeRO-3 配置分析发布时间:2026 年 9 月 18 日直接结论:Qwen3.8-27B 做 GRPO,4×RTX 4090 只能作为 QLoRA、小 Batch、短输出的 PoC 起点;要把 vLLM Rollout 与训练进程分开,8×RTX 4090 更合理。全参数 GRPO 不建议直接用这两种配置。
thesky12345617 天前
大模型·rlhf·奖励模型·ppo·dpo·grpo·强化学习对齐
27届大模型面试准备(七十三):大模型强化学习对齐工程实战——RLHF、PPO 与 GRPO 的训练流水线引言前面把后训练(A16)、对齐税(A48)、多模态训练(A40)、工具调用训练(A42)都铺开了。本篇把"对齐"里最硬核、也是面试官最爱追问的一段单独拎出来讲透:基于强化学习的对齐训练。它和上一篇高频八股(A52)、指令遵循(A48)是一条线,但更偏工程实现——奖励模型怎么训、PPO 为什么要有 critic、GRPO 怎么把 critic 省掉、DPO 又怎么绕过奖励模型直接做偏好。
网络工程小王25 天前
深度学习·强化学习·rlhf·ppo·dpo·grpo
【LLM开发实验】强化学习实现原理及实战目录一、RLHF流程简介1.1 LLM 训练三步走1.2 核心痛点二、强化学习前置知识(热身)2.1 RL 五要素(贯穿式类比:训练运动员)
XLYcmy1 个月前
llm·负载均衡·强化学习·多模态·ppo·dpo·grpo
小红书 算法一面 十二在 **MoE(混合专家模型)** 场景中,**负载均衡** 是指**门控网络将输入 token 均匀分配给各个专家子网络**,使得每个专家接收的计算任务量(token 数量、计算开销)保持相对均衡,避免出现“热门专家过载、冷门专家闲置”的现象。
林间码客1 个月前
sft·强化学习·grpo·agentic-rl
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”本章将深入探讨Agentic-RL(基于强化学习的智能体训练)这一让智能体实现“自主进化”的关键技术。从LLM训练的基础流程出发,解析监督微调(SFT)与群组相对策略优化(GRPO)的训练流程,对比PPO、DPO、GRPO、RLVR等核心算法的演进逻辑,并介绍HelloAgents框架中Agentic RL的四层架构设计与GSM8K数学推理数据集上的训练实践,帮助读者理解如何通过强化学习让智能体学会推理与工具使用。
XLYcmy1 个月前
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数
小红书 算法一面 四SFT训练中**训练loss正常下降但测试集表现差**,核心原因是**模型泛化能力不足**——模型学到了训练集的特征(甚至噪声),但无法迁移到分布不同的测试集。结合SFT的任务特性(大模型微调、文本/多模态生成),具体原因可分为四大类,每类对应明确的排查和解决方法:
XLYcmy1 个月前
llm·sft·memory·多模态·位置编码·grpo·视觉数据
小红书 算法一面 二### 二、视觉数据Memory设计核心解析视觉数据的核心特征是**空间结构化(图像是2D网格)、时序动态性(视频是3D时空)、高维度(像素/patch特征维度高)**,这和NLP的一维序列数据有本质区别。因此视觉memory的设计核心是:**在保留时空结构的前提下,高效存储、检索和复用多粒度视觉特征,平衡存储容量、检索效率和任务效果**。
我是小邵2 个月前
强化学习·大模型训练·grpo·zero rl
Zero RL:当 AI 学会“顿悟“——零强化学习的狂欢与阵痛发布日期:2026-07-27 阅读时间:约 15-18 分钟 分类:技术杂谈 专栏:未归档 关键词:强化学习 Zero RL DeepSeek GRPO 大模型训练 推理模型
闲研随记2 个月前
论文阅读·算法·llm·强化学习·rl·icml·grpo
【文献阅读 ICML 2026】RL算法:Critique-GRPOCritique-GRPO:通过自然语言和数值反馈提升LLM推理能力基于数值反馈的在线强化学习使LLM能够通过试错机制(trial-and-error)学习,大幅提升了推理能力。然而,纯数值反馈的RL存在三大核心局限:
山顶夕景2 个月前
rl·vqa·vlm·grpo·视频质量评估
【AAAI 2026】VQAThinker:通过RL进行可解释VQA训练论文:VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning 2026.2 https://github.com/clh124/VQAThinker 开源模型:https://huggingface.co/kkkkkklinhan/InternVL3-VQAThinker-8B
litble4 个月前
人工智能·llm·ppo·grpo·gspo·dapo
如何速成LLM以伪装成一个AI研究者(4)——PPO,GRPO,DAPO,GSPO如何速成LLM以伪装成一个AI研究者(1)——循环,卷积,编解码器,注意力,Transformer 如何速成LLM以伪装成一个AI研究者(2)——Pre-LN,KV-Cache优化,MoE 如何速成LLM以伪装成一个AI研究者(3)——预训练,监督微调,强化学习RLHF/DPO
山顶夕景5 个月前
多模态·mllm·grpo·文档多模态
【MLLM】文档多模态MinerU2.5-Pro模型【文档多模态模型进展】MinerU2.5-Pro更新,主要特点是保留 MinerU2.5 的 1.2B 参数架构,主要改动点是训练数据从不足 1000 万页扩至 6550 万,工作报告在:MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale,https://arxiv.org/pdf/2604.04771, 代码在: https://github.com/opendatalab/MinerU, 模型权重在:
码农垦荒笔记6 个月前
人工智能·强化学习·grpo·dapo
LLM 后训练革命:GRPO、DAPO 与 RLVR 如何替代 RLHF 重塑大模型对齐训练据 llm-stats.com 2026 年 3 月 11 日发布的综述《Post-Training in 2026: GRPO, DAPO, RLVR & Beyond》,过去 12 个月发布的每个主要模型——从 DeepSeek-R1 到 Nemotron 3 Super 再到 GPT-5.3 Codex——都使用了不同的后训练技术栈。RLHF(基于人类反馈的强化学习)的标准配方已经「死了」。
威化饼的一隅6 个月前
大模型·llm·agent·强化学习·智能体·grpo
【大模型LLM学习】从强化学习到GRPO【下】在策略梯度部分,可以发现,RL和分类问题有一丝相像,RL只是多了一个来自轨迹的奖励分数权重 R ( τ ) R(\tau) R(τ)。在LLM语境里,每一轮游戏可以认为是输入x,输出完整句子 y y y抵达<EOS>。在《On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification》一文中有进一步的说明,并提出了基于此的DFT算法(相比于DFT只改了一行代码,效果比肩GRPO)。
威化饼的一隅6 个月前
大模型·llm·agent·强化学习·智能体·grpo
【大模型LLM学习】从强化学习到GRPO【上】强化学习是一个与时间相关的序列决策的问题,基本理论框架通常假设环境是一个马尔可夫决策过程(Markov Decision Process, MDP)。里面涉及到状态、动作、状态转移概率、奖励和奖励折扣因子( S 、 A 、 P 、 R 、 γ S、A、P、R、\gamma S、A、P、R、γ),这5 个合集就构成了强化学习马尔可夫决策过程的五元组:
爱听歌的周童鞋6 个月前
llm·policy gradient·assignment·grpo·cs336·experiments
斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Assignment 5: GRPO本篇文章记录 CS336 作业 Assignment 5: Alignment 中的 GRPO 作业要求,仅供自己参考😄
缘友一世7 个月前
grpo·easyr1·llm rl
Easy R1 训练环境搭建与配置实战指南(GRPO算法)环境特征总结:
大傻^7 个月前
强化学习·grpo
基于群组相对策略优化(GRPO)的大模型强化学习微调技术方案传统PPO(Proximal Policy Optimization)在LLM微调中存在显存占用高、价值函数估计不准等问题。本方案采用GRPO算法,其核心优势包括:
爱听歌的周童鞋9 个月前
llm·policy gradient·grpo·cs336·baselines·advantage funcs
斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Lecture 17: Alignment - RL 2学习斯坦福的 CS336 课程,本篇文章记录课程第十七讲:对齐 - RL(下),记录下个人学习笔记,仅供自己参考😄
亚里随笔9 个月前
深度学习·llm·rl·agentic·grpo
激活被遗忘的训练信号:ERPO框架如何让大模型在数学推理中更进一步随着大型语言模型在数学、编程等复杂推理任务中的表现日益出色,如何进一步提升其推理能力成为研究热点。本文介绍了一种创新的训练框架——ERPO(Explore Residual Prompts in Policy Optimization),通过巧妙利用训练过程中被"遗忘"的残余提示,显著提升了模型的数学推理性能,在多个基准测试中取得了显著改进。