grpo

闲研随记13 天前
论文阅读·算法·llm·强化学习·rl·icml·grpo
【文献阅读 ICML 2026】RL算法:Critique-GRPOCritique-GRPO:通过自然语言和数值反馈提升LLM推理能力基于数值反馈的在线强化学习使LLM能够通过试错机制(trial-and-error)学习,大幅提升了推理能力。然而,纯数值反馈的RL存在三大核心局限:
山顶夕景15 天前
rl·vqa·vlm·grpo·视频质量评估
【AAAI 2026】VQAThinker:通过RL进行可解释VQA训练论文:VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning 2026.2 https://github.com/clh124/VQAThinker 开源模型:https://huggingface.co/kkkkkklinhan/InternVL3-VQAThinker-8B
litble3 个月前
人工智能·llm·ppo·grpo·gspo·dapo
如何速成LLM以伪装成一个AI研究者(4)——PPO,GRPO,DAPO,GSPO如何速成LLM以伪装成一个AI研究者(1)——循环,卷积,编解码器,注意力,Transformer 如何速成LLM以伪装成一个AI研究者(2)——Pre-LN,KV-Cache优化,MoE 如何速成LLM以伪装成一个AI研究者(3)——预训练,监督微调,强化学习RLHF/DPO
山顶夕景3 个月前
多模态·mllm·grpo·文档多模态
【MLLM】文档多模态MinerU2.5-Pro模型【文档多模态模型进展】MinerU2.5-Pro更新,主要特点是保留 MinerU2.5 的 1.2B 参数架构,主要改动点是训练数据从不足 1000 万页扩至 6550 万,工作报告在:MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale,https://arxiv.org/pdf/2604.04771, 代码在: https://github.com/opendatalab/MinerU, 模型权重在:
码农垦荒笔记4 个月前
人工智能·强化学习·grpo·dapo
LLM 后训练革命:GRPO、DAPO 与 RLVR 如何替代 RLHF 重塑大模型对齐训练据 llm-stats.com 2026 年 3 月 11 日发布的综述《Post-Training in 2026: GRPO, DAPO, RLVR & Beyond》,过去 12 个月发布的每个主要模型——从 DeepSeek-R1 到 Nemotron 3 Super 再到 GPT-5.3 Codex——都使用了不同的后训练技术栈。RLHF(基于人类反馈的强化学习)的标准配方已经「死了」。
威化饼的一隅4 个月前
大模型·llm·agent·强化学习·智能体·grpo
【大模型LLM学习】从强化学习到GRPO【下】在策略梯度部分,可以发现,RL和分类问题有一丝相像,RL只是多了一个来自轨迹的奖励分数权重 R ( τ ) R(\tau) R(τ)。在LLM语境里,每一轮游戏可以认为是输入x,输出完整句子 y y y抵达<EOS>。在《On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification》一文中有进一步的说明,并提出了基于此的DFT算法(相比于DFT只改了一行代码,效果比肩GRPO)。
威化饼的一隅4 个月前
大模型·llm·agent·强化学习·智能体·grpo
【大模型LLM学习】从强化学习到GRPO【上】强化学习是一个与时间相关的序列决策的问题,基本理论框架通常假设环境是一个马尔可夫决策过程(Markov Decision Process, MDP)。里面涉及到状态、动作、状态转移概率、奖励和奖励折扣因子( S 、 A 、 P 、 R 、 γ S、A、P、R、\gamma S、A、P、R、γ),这5 个合集就构成了强化学习马尔可夫决策过程的五元组:
爱听歌的周童鞋4 个月前
llm·policy gradient·assignment·grpo·cs336·experiments
斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Assignment 5: GRPO本篇文章记录 CS336 作业 Assignment 5: Alignment 中的 GRPO 作业要求,仅供自己参考😄
缘友一世5 个月前
grpo·easyr1·llm rl
Easy R1 训练环境搭建与配置实战指南(GRPO算法)环境特征总结:
大傻^6 个月前
强化学习·grpo
基于群组相对策略优化(GRPO)的大模型强化学习微调技术方案传统PPO(Proximal Policy Optimization)在LLM微调中存在显存占用高、价值函数估计不准等问题。本方案采用GRPO算法,其核心优势包括:
爱听歌的周童鞋7 个月前
llm·policy gradient·grpo·cs336·baselines·advantage funcs
斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Lecture 17: Alignment - RL 2学习斯坦福的 CS336 课程,本篇文章记录课程第十七讲:对齐 - RL(下),记录下个人学习笔记,仅供自己参考😄
亚里随笔7 个月前
深度学习·llm·rl·agentic·grpo
激活被遗忘的训练信号:ERPO框架如何让大模型在数学推理中更进一步随着大型语言模型在数学、编程等复杂推理任务中的表现日益出色,如何进一步提升其推理能力成为研究热点。本文介绍了一种创新的训练框架——ERPO(Explore Residual Prompts in Policy Optimization),通过巧妙利用训练过程中被"遗忘"的残余提示,显著提升了模型的数学推理性能,在多个基准测试中取得了显著改进。
五月底_7 个月前
人工智能·深度学习·nlp·rl·grpo
GRPO参数详解actor_rollout.ref.rollout.n对于每个提示,采样 n 次。默认值为 1。对于 GRPO,请将其设置为大于 1 的值以进行分组采样。
core5127 个月前
人工智能·算法·机器学习·deepseek·grpo
深度解析DeepSeek-R1中GRPO强化学习算法GRPO (Generative Reward-Paired Optimization) 是由 DeepSeek (深度求索) 团队在发布 DeepSeek-R1 (DeepSeek-Math) 相关论文时提出的一种新型强化学习(RL)算法。
core5127 个月前
微调·qwen·unsloth·grpo
【实战】使用 Unsloth 与 GRPO 微调 Qwen2.5 模型在当前的大模型(LLM)领域,如何让模型具备更强的逻辑推理能力(Chain-of-Thought, CoT)是一个热门话题。DeepSeek-R1 等模型的成功证明了**强化学习(RL)**在提升推理能力方面的巨大潜力。
余俊晖9 个月前
人工智能·算法·ocr·grpo
RLVR训练多模态文档解析模型-olmOCR 2技术方案(模型、数据和代码均开源)OLMOCR1.0: allenai开源多模态的文档智能解析大模型(OLMOCR)方法、效果浅析往期相关:
marsggbo9 个月前
llm·强化学习·ppo·dpo·grpo
LLM 场景下的强化学习技术扫盲想象你正在和一个刚训练好的语言模型聊天。你问:“今天过得怎么样?” 模型可能回:“还行。” 也可能回:“我是个 AI,没有感情。” 人类觉得前者更自然、更友好——这就是偏好反馈。强化学习(RL)在 LLM 中的核心任务,就是让模型学会生成“人类更喜欢”的回复。
songyuc10 个月前
grpo
DeepSeek-Math 学习笔记
镰刀韭菜10 个月前
人工智能·自然语言处理·大语言模型·强化学习·ppo·后训练·grpo
【大语言模型】大模型后训练入门指南这些能力有什么共同点呢?答案是:它们都是在后训练阶段(post-training) 中发展出来的。尽管后训练解锁的能力在几年前看起来几乎像魔法一样,但它获得的关注却远少于 Transformer 架构和预训练的基础内容。
温柔哥`1 年前
语言模型·自动驾驶·agent·工具调用·grpo·强化微调·tool call
AgentThink:一种在自动驾驶视觉语言模型中用于工具增强链式思维推理的统一框架AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving 1 清华大学 2 麦吉尔大学 3 小米公司 4 威斯康星大学麦迪逊分校 arxiv’25’05