强化学习

爱听歌的周童鞋6 小时前
强化学习·贝尔曼公式·matrix-vector·closed-form·iterative
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 2 | Part 4 | 贝尔曼公式(公式向量形式与求解)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第二讲 Part 4:贝尔曼公式(公式向量形式与求解),记录个人学习笔记,和大家一起分享交流😄
海天一色y11 小时前
人工智能·python·强化学习
强化学习工具函数详解:从经验回放到优势函数计算在强化学习(RL)算法的实现中,除了核心的策略网络和价值网络外,一套高效、稳健的工具函数往往能大幅提升开发效率与实验可复现性。本文将对一个典型的 rl_utils.py 模块进行深入剖析,该模块封装了经验回放缓存、滑动平均平滑、在线/离线策略训练流程以及广义优势估计(GAE) 等关键组件。无论你是RL初学者还是希望构建自有代码库的开发者,这篇博客都将为你提供清晰的实现思路与实用技巧。
网络工程小王1 天前
深度学习·强化学习·rlhf·ppo·dpo·grpo
【LLM开发实验】强化学习实现原理及实战目录一、RLHF流程简介1.1 LLM 训练三步走1.2 核心痛点二、强化学习前置知识(热身)2.1 RL 五要素(贯穿式类比:训练运动员)
XLYcmy5 天前
llm·负载均衡·强化学习·多模态·ppo·dpo·grpo
小红书 算法一面 十二在 **MoE(混合专家模型)** 场景中,**负载均衡** 是指**门控网络将输入 token 均匀分配给各个专家子网络**,使得每个专家接收的计算任务量(token 数量、计算开销)保持相对均衡,避免出现“热门专家过载、冷门专家闲置”的现象。
白拾2 天前
强化学习·大模型推理·arxiv 2026·logos 论文分享·围棋ai·专家知识注入
【arXiv 2026】LoGos:把人类思考带回围棋——通用大模型的专业领域专家之路|从围棋AI与LLM推理交叉视角本文解读 arXiv 2026 论文《Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go》。该论文提出LoGos(Language-Oriented Go System),通过融合启发式规则合成专家数据、长 CoT 混合冷启动与GRPO 自探索强化学习,把通用大模型变成能在自然语言中分析局面、推理并落子的职业级围棋棋手,其特别之处在于全程不依赖稀缺的人类推理标注,仅用可规模化的结构化专家知识。实验表明 LoGos(32B
Terrence Shen2 天前
大模型·agent·强化学习·rl
【读论文系列】AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS翻译+解读arXiv v1 原名 Online Process Reward Learning(OPRL),最终 ICLR 2026 版本改名为 Agentic Reinforcement Learning with Implicit Step Rewards(iStar)。以下以 arXiv v3、ICLR 2026 camera-ready 为准,并用 ICLR slides 补充作者想强调的直觉。
白拾2 天前
强化学习·colm 2025·search-r1 论文分享·llm后训练·检索增强推理
【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角本文解读 COLM 2025 论文《Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning》。该论文提出 Search-R1 强化学习框架,通过融合搜索引擎环境建模、检索 token 损失掩码与纯结果奖励,让大语言模型在推理过程中自主发起多轮搜索、整合实时信息,其特别之处在于不需要任何人工标注轨迹或过程监督。实验表明 7B 与 3B 模型相对 RAG 基线平均提升 24% 与 20
海天一色y3 天前
人工智能·强化学习·deepspeed·后训练
深入解析 DeepSpeedPPOTrainer:基于 PPO 的大规模 RLHF 训练实现在大语言模型(LLM)的后训练阶段,基于人类反馈的强化学习(RLHF) 已成为提升模型对话能力和对齐性的关键步骤。其中,近端策略优化(PPO) 因其稳定性和效率被广泛采用。然而,将 PPO 扩展到百亿甚至千亿参数规模的模型时,显存、通信和训练稳定性都面临巨大挑战。
皮卡丘不断更3 天前
机器人·强化学习·数字孪生·具身智能·机器人仿真
从一段 RGB 视频到机器人开门:读懂 Video2DoorTraversal 的仿真闭环8 月 20 日公开的 Video2DoorTraversal 把一个很具体的问题拆成了可检查的链路:拍一段目标门的 RGB 视频,重建带关节的门体数字孪生,在仿真中生成可执行轨迹,再训练轮足机器人完成接近、开门和穿越。它适合关注具身智能、机器人仿真和开发工具的读者参考方法,而不是把一篇预印本当作已经可直接复用的生产方案。本文只解读作者公开的论文和项目页,不宣称本地复现。
山顶夕景3 天前
agent·强化学习·多模态·rl·agentic
【MLLM Agent】多模态理解Agent研究进展(1)框架类(可直接搭建多模态 Agent 基座) DeepSeek‑Harness(DeepSeek 2026) 定位:Agent 运行时框架,近期新增 Vision 支持,对接 V4‑Flash‑Vision‑Exp,实现图片输入 + 原生 function call 闭环,可插拔 Agent 循环、工具、记忆、上下文管理 仓库:https://github.com/deepseek‑ai/harness
闲研随记4 天前
算法·llm·强化学习·iclr·rl
【文献阅读 ICLR 2026】RL算法:DECS标题:通过解耦奖励和课程数据调度来缓解过度思考 方法名称:DECS 论文链接:arxiv:2509.25827v2 项目链接:https://github.com/pixas/DECS 发表会议:ICLR 2026
盼小辉丶7 天前
pytorch·深度学习·语言模型·chatgpt·强化学习
PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏文本互动小说 (interactive fiction) 是强化学习研究中一个独特而富有挑战性的领域。与图形丰富的街机游戏不同,这类游戏通过纯文本描述呈现状态,要求智能体理解自然语言、进行长期规划并在复杂的语义空间中决策。我们已经以微软 TextWorld 为实验平台,学习了如何使用自然语言处理 (Natural Language Processing, NLP) 工具处理复杂的文本数据,并在交互式小说游戏环境中进行实验,在本节中,我们将借助 Hugging Face 预训练 Transformer 和
林间码客8 天前
sft·强化学习·grpo·agentic-rl
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”本章将深入探讨Agentic-RL(基于强化学习的智能体训练)这一让智能体实现“自主进化”的关键技术。从LLM训练的基础流程出发,解析监督微调(SFT)与群组相对策略优化(GRPO)的训练流程,对比PPO、DPO、GRPO、RLVR等核心算法的演进逻辑,并介绍HelloAgents框架中Agentic RL的四层架构设计与GSM8K数学推理数据集上的训练实践,帮助读者理解如何通过强化学习让智能体学会推理与工具使用。
XLYcmy9 天前
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数
小红书 算法一面 四SFT训练中**训练loss正常下降但测试集表现差**,核心原因是**模型泛化能力不足**——模型学到了训练集的特征(甚至噪声),但无法迁移到分布不同的测试集。结合SFT的任务特性(大模型微调、文本/多模态生成),具体原因可分为四大类,每类对应明确的排查和解决方法:
盼小辉丶10 天前
pytorch·深度学习·强化学习
PyTorch强化学习实战(22)——将强化学习应用于TextWorld互动小说游戏在本节中,我们将使用强化学习 (Reinforcement Learning, RL) 解决基于文本的互动小说 (interactive fiction) 游戏,采用微软研究院发布的 TextWorld 环境,展示 RL 如何应用于具有丰富观测空间的复杂环境。此外,我们还会探讨深度自然语言处理方法,并介绍大语言模型 (Large Language Model, LLM)。
XLYcmy11 天前
llm·sft·强化学习·多模态·损失函数·visual r1·奖励机制
小红书 算法一面 三# Visual R1 原理与 MLLM RL 方案设计全解析## 一、Visual R1 核心实现原理
chen_zn9511 天前
人工智能·强化学习·具身智能·vla
《VLA 系列》RLT | RL Token | 轻量 Actor-Critic | 在线强化学习与源码解析RLT(RL Token)解决的是一个很具体的问题:通用 VLA 已经会做任务,但到了插孔、拧螺丝、穿扎带这类最后一毫米的接触阶段,动作往往不够快,也不够稳。直接用在线强化学习更新数十亿参数的 VLA,真实机器人数据和算力都承受不起;完全绕开 VLA 训练一个小策略,又会丢掉大模型已经学到的视觉和操作知识。RLT 的做法是在两者之间加一个紧凑接口:先把 VLA 内部表征压缩成一个 RL token,再冻结 VLA,用小型 actor-critic 在真实机器人上做在线强化学习。
计科杨某人13 天前
随机森林·机器学习·支持向量机·监督学习·强化学习·最小二乘法·无监督学习
机器学习基本常识最近由于本人开始转向机器学习方向的研究,所以打算做一个新专栏。以下是今天我们主要讲解的内容,大家先看一下:
云和数据.ChenGuang14 天前
java·服务器·数据库·人工智能·深度学习·fastapi·强化学习
fastapi项目拆分实战数据模型目录回顾schemas/init.py之后在 routers/users.py 可以这样导入:不用写长长的 from schemas.user import xxx,代码清爽。
林泽毅22 天前
人工智能·深度学习·机器学习·llm·强化学习
PyTRIO快速入门实战篇(二):用 GRPO 提升 GSM8K 数学推理准确率用 PyTRIO 对 Qwen3.5-4B 进行 50 step 的 GRPO 训练。在 GSM8K test split 的前 100 道题上,模型的准确率从 79% 提升到 95%,训练与评估总成本仅 1.7 元。