技术栈
grpo
网络工程小王
5 天前
深度学习
·
强化学习
·
rlhf
·
ppo
·
dpo
·
grpo
【LLM开发实验】强化学习实现原理及实战
目录一、RLHF流程简介1.1 LLM 训练三步走1.2 核心痛点二、强化学习前置知识(热身)2.1 RL 五要素(贯穿式类比:训练运动员)
XLYcmy
8 天前
llm
·
负载均衡
·
强化学习
·
多模态
·
ppo
·
dpo
·
grpo
小红书 算法一面 十二
在 **MoE(混合专家模型)** 场景中,**负载均衡** 是指**门控网络将输入 token 均匀分配给各个专家子网络**,使得每个专家接收的计算任务量(token 数量、计算开销)保持相对均衡,避免出现“热门专家过载、冷门专家闲置”的现象。
林间码客
12 天前
sft
·
强化学习
·
grpo
·
agentic-rl
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”
本章将深入探讨Agentic-RL(基于强化学习的智能体训练)这一让智能体实现“自主进化”的关键技术。从LLM训练的基础流程出发,解析监督微调(SFT)与群组相对策略优化(GRPO)的训练流程,对比PPO、DPO、GRPO、RLVR等核心算法的演进逻辑,并介绍HelloAgents框架中Agentic RL的四层架构设计与GSM8K数学推理数据集上的训练实践,帮助读者理解如何通过强化学习让智能体学会推理与工具使用。
XLYcmy
12 天前
深度学习
·
llm
·
sft
·
强化学习
·
多模态
·
grpo
·
奖励函数
小红书 算法一面 四
SFT训练中**训练loss正常下降但测试集表现差**,核心原因是**模型泛化能力不足**——模型学到了训练集的特征(甚至噪声),但无法迁移到分布不同的测试集。结合SFT的任务特性(大模型微调、文本/多模态生成),具体原因可分为四大类,每类对应明确的排查和解决方法:
XLYcmy
14 天前
llm
·
sft
·
memory
·
多模态
·
位置编码
·
grpo
·
视觉数据
小红书 算法一面 二
### 二、视觉数据Memory设计核心解析视觉数据的核心特征是**空间结构化(图像是2D网格)、时序动态性(视频是3D时空)、高维度(像素/patch特征维度高)**,这和NLP的一维序列数据有本质区别。因此视觉memory的设计核心是:**在保留时空结构的前提下,高效存储、检索和复用多粒度视觉特征,平衡存储容量、检索效率和任务效果**。
我是小邵
1 个月前
强化学习
·
大模型训练
·
grpo
·
zero rl
Zero RL:当 AI 学会“顿悟“——零强化学习的狂欢与阵痛
发布日期:2026-07-27 阅读时间:约 15-18 分钟 分类:技术杂谈 专栏:未归档 关键词:强化学习 Zero RL DeepSeek GRPO 大模型训练 推理模型
闲研随记
2 个月前
论文阅读
·
算法
·
llm
·
强化学习
·
rl
·
icml
·
grpo
【文献阅读 ICML 2026】RL算法:Critique-GRPO
Critique-GRPO:通过自然语言和数值反馈提升LLM推理能力基于数值反馈的在线强化学习使LLM能够通过试错机制(trial-and-error)学习,大幅提升了推理能力。然而,纯数值反馈的RL存在三大核心局限:
山顶夕景
2 个月前
rl
·
vqa
·
vlm
·
grpo
·
视频质量评估
【AAAI 2026】VQAThinker:通过RL进行可解释VQA训练
论文:VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning 2026.2 https://github.com/clh124/VQAThinker 开源模型:https://huggingface.co/kkkkkklinhan/InternVL3-VQAThinker-8B
litble
4 个月前
人工智能
·
llm
·
ppo
·
grpo
·
gspo
·
dapo
如何速成LLM以伪装成一个AI研究者(4)——PPO,GRPO,DAPO,GSPO
如何速成LLM以伪装成一个AI研究者(1)——循环,卷积,编解码器,注意力,Transformer 如何速成LLM以伪装成一个AI研究者(2)——Pre-LN,KV-Cache优化,MoE 如何速成LLM以伪装成一个AI研究者(3)——预训练,监督微调,强化学习RLHF/DPO
山顶夕景
5 个月前
多模态
·
mllm
·
grpo
·
文档多模态
【MLLM】文档多模态MinerU2.5-Pro模型
【文档多模态模型进展】MinerU2.5-Pro更新,主要特点是保留 MinerU2.5 的 1.2B 参数架构,主要改动点是训练数据从不足 1000 万页扩至 6550 万,工作报告在:MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale,https://arxiv.org/pdf/2604.04771, 代码在: https://github.com/opendatalab/MinerU, 模型权重在:
码农垦荒笔记
5 个月前
人工智能
·
强化学习
·
grpo
·
dapo
LLM 后训练革命:GRPO、DAPO 与 RLVR 如何替代 RLHF 重塑大模型对齐训练
据 llm-stats.com 2026 年 3 月 11 日发布的综述《Post-Training in 2026: GRPO, DAPO, RLVR & Beyond》,过去 12 个月发布的每个主要模型——从 DeepSeek-R1 到 Nemotron 3 Super 再到 GPT-5.3 Codex——都使用了不同的后训练技术栈。RLHF(基于人类反馈的强化学习)的标准配方已经「死了」。
威化饼的一隅
5 个月前
大模型
·
llm
·
agent
·
强化学习
·
智能体
·
grpo
【大模型LLM学习】从强化学习到GRPO【下】
在策略梯度部分,可以发现,RL和分类问题有一丝相像,RL只是多了一个来自轨迹的奖励分数权重 R ( τ ) R(\tau) R(τ)。在LLM语境里,每一轮游戏可以认为是输入x,输出完整句子 y y y抵达<EOS>。在《On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification》一文中有进一步的说明,并提出了基于此的DFT算法(相比于DFT只改了一行代码,效果比肩GRPO)。
威化饼的一隅
5 个月前
大模型
·
llm
·
agent
·
强化学习
·
智能体
·
grpo
【大模型LLM学习】从强化学习到GRPO【上】
强化学习是一个与时间相关的序列决策的问题,基本理论框架通常假设环境是一个马尔可夫决策过程(Markov Decision Process, MDP)。里面涉及到状态、动作、状态转移概率、奖励和奖励折扣因子( S 、 A 、 P 、 R 、 γ S、A、P、R、\gamma S、A、P、R、γ),这5 个合集就构成了强化学习马尔可夫决策过程的五元组:
爱听歌的周童鞋
6 个月前
llm
·
policy gradient
·
assignment
·
grpo
·
cs336
·
experiments
斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Assignment 5: GRPO
本篇文章记录 CS336 作业 Assignment 5: Alignment 中的 GRPO 作业要求,仅供自己参考😄
缘友一世
6 个月前
grpo
·
easyr1
·
llm rl
Easy R1 训练环境搭建与配置实战指南(GRPO算法)
环境特征总结:
大傻^
7 个月前
强化学习
·
grpo
基于群组相对策略优化(GRPO)的大模型强化学习微调技术方案
传统PPO(Proximal Policy Optimization)在LLM微调中存在显存占用高、价值函数估计不准等问题。本方案采用GRPO算法,其核心优势包括:
爱听歌的周童鞋
8 个月前
llm
·
policy gradient
·
grpo
·
cs336
·
baselines
·
advantage funcs
斯坦福大学 | CS336 | 从零开始构建语言模型 | Spring 2025 | 笔记 | Lecture 17: Alignment - RL 2
学习斯坦福的 CS336 课程,本篇文章记录课程第十七讲:对齐 - RL(下),记录下个人学习笔记,仅供自己参考😄
亚里随笔
8 个月前
深度学习
·
llm
·
rl
·
agentic
·
grpo
激活被遗忘的训练信号:ERPO框架如何让大模型在数学推理中更进一步
随着大型语言模型在数学、编程等复杂推理任务中的表现日益出色,如何进一步提升其推理能力成为研究热点。本文介绍了一种创新的训练框架——ERPO(Explore Residual Prompts in Policy Optimization),通过巧妙利用训练过程中被"遗忘"的残余提示,显著提升了模型的数学推理性能,在多个基准测试中取得了显著改进。
五月底_
8 个月前
人工智能
·
深度学习
·
nlp
·
rl
·
grpo
GRPO参数详解
actor_rollout.ref.rollout.n对于每个提示,采样 n 次。默认值为 1。对于 GRPO,请将其设置为大于 1 的值以进行分组采样。
core512
9 个月前
人工智能
·
算法
·
机器学习
·
deepseek
·
grpo
深度解析DeepSeek-R1中GRPO强化学习算法
GRPO (Generative Reward-Paired Optimization) 是由 DeepSeek (深度求索) 团队在发布 DeepSeek-R1 (DeepSeek-Math) 相关论文时提出的一种新型强化学习(RL)算法。