强化学习

林泽毅2 天前
人工智能·深度学习·机器学习·llm·强化学习
PyTRIO快速入门实战篇(二):用 GRPO 提升 GSM8K 数学推理准确率用 PyTRIO 对 Qwen3.5-4B 进行 50 step 的 GRPO 训练。在 GSM8K test split 的前 100 道题上,模型的准确率从 79% 提升到 95%,训练与评估总成本仅 1.7 元。
幻影123!5 天前
python·深度学习·神经网络·强化学习·五子棋·alpha zero·mokugo
从零训练一个会下五子棋的AI摘要:本人在两张消费级 GPU(RTX 4090 + RTX 2080 Ti)上,从零训练出了一个 15×15 五子棋 AlphaZero AI。本文记录了完整实战过程:从框架选型、网络架构、分布式训练,到 14 个真实踩坑(每个都有症状+根因+修复)、一套可靠的评估方法论(loss 下降≠棋力上升),以及 v1→v2→v3 的对照实验设计与早期数据。全文 7000+ 字,全部结论均有实测数据支撑,无水分。
我是小邵10 天前
强化学习·大模型训练·grpo·zero rl
Zero RL:当 AI 学会“顿悟“——零强化学习的狂欢与阵痛发布日期:2026-07-27 阅读时间:约 15-18 分钟 分类:技术杂谈 专栏:未归档 关键词:强化学习 Zero RL DeepSeek GRPO 大模型训练 推理模型
盼小辉丶11 天前
pytorch·深度学习·强化学习·优势演员-评论家算法
PyTorch强化学习实战(20)——优势演员-评论家(Advantage Actor-Critic, A2C)我们已经介绍了一种基于策略的方法,讨论了 REINFORCE 方法及其改进版本,后者使用折扣奖励来计算策略梯度(梯度指明了策略优化的方向),这两种方法在简单的CartPole问题中表现良好,但在更复杂的 Pong 环境中却无法收敛。 本节中,我们将讨论原始策略梯度方法的另一种变体,即演员-评论家 (actor-critic)算法,显著提升了方法的稳定性和收敛速度,现已成为深度强化学习中最强大的方法之一。
GRITJW11 天前
强化学习·大模型微调
从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布理解大模型后训练中的能力学习、泛化与遗忘大语言模型在预训练阶段阅读海量文本,并通过“预测下一个 token”学习语言规律、世界知识、代码结构与一定程度的推理能力。然而,一个完成预训练的模型并不天然知道怎样遵循用户指令,也不一定会按照我们期待的格式回答,更不会自动把“对用户有帮助”“数学答案正确”或“代码能够通过测试”当作自己的优化目标。
阿木实验室14 天前
强化学习·自主无人机
预设航线之外,无人机如何应对变化?一架无人机正在执行园区巡检。大部分航点已经完成,剩余电量不多,前方施工区域却临时增加了障碍,设备区同时上报异常。此时是继续原航线、先处理异常,还是直接返航?
一颗小树x19 天前
机器人·强化学习·amp·vla·复现
《VLA 系列》AMP 代码复现 | 强化训练 | 行走 跌倒 恢复本博客是基于 mjlab + rsl_rl 的 G1/H2 AMP 运动控制,同时支持走/跑、跌倒恢复 🚀
飞思实验室20 天前
gpu算力·强化学习
跨越算力鸿沟与不可微壁垒:GPU张量化仿真如何重塑多智能体强化学习?在具身智能与多智能体强化学习( MARL)的探索之路上,算法收敛速度与物理环境交互效率始终是横亘在科研人员面前的两座大山。
紫金修道21 天前
强化学习
深度强化学习内核:从马尔可夫链到PPO的哲学与数学之美这是一篇为你整理的深度强化学习技术博客,内容侧重于核心原理与数学直觉,而非浅尝辄止的应用列表。如果说监督学习是模仿已有的答案,无监督学习是发现隐藏的模式,那么强化学习(Reinforcement Learning, RL)则是关于“如何在动态环境中通过序列决策,实现长期收益最大化”的学问。
闲研随记23 天前
论文阅读·人工智能·算法·强化学习·icml·rl算法
【文献阅读 ICML 2026】RL算法:R2VPORL算法:R2VPO这一节,将从策略比值policy ratio的角度重新审视trust-region策略优化算法,并将证明,策略散度divergence的局部几何特征均由策略比值policy ratio的方差variance统一决定。这一发现引出了一种简单且具备理论依据的方案,替代裁剪操作:引入方差正则化目标函数来实现稳定参数更新,同时天然支持离线策略数据复用。
EW Frontier1 个月前
开发语言·python·无人机·强化学习·通信资源分配
三级跳突破864维动作空间——QMIX-Hierarchical多无人机协同通信方法全解析【附python代码】导读:在战场或灾区的复杂电磁环境中,移动干扰器持续压制通信信号,地面IoT设备电量有限且分布不均。如何让多架无人机自主协同,一边躲避干扰、一边高效服务所有设备?本文介绍一种三层递进的多智能体深度强化学习方法——MaDRL (Multi-agent Deep Reinforcement Learning),在仿真中实现吞吐量从基线的0.32飙升至0.96,干扰失败率降低66%。
盼小辉丶1 个月前
pytorch·深度学习·强化学习
PyTorch强化学习实战(18)——基于DQN处理股票交易问题在本节中,我们将尝试运用深度Q网络 (Deep Q-Network, DQN) 知识来处理更具现实意义的金融交易问题。我们的目标旨在突破 Atari 游戏的局限,展示如何将强化学习 (Reinforcement Learning, RL) 应用于另一个实际领域。
闲研随记1 个月前
论文阅读·算法·llm·强化学习·rl·icml·grpo
【文献阅读 ICML 2026】RL算法:Critique-GRPOCritique-GRPO:通过自然语言和数值反馈提升LLM推理能力基于数值反馈的在线强化学习使LLM能够通过试错机制(trial-and-error)学习,大幅提升了推理能力。然而,纯数值反馈的RL存在三大核心局限:
智能优化与强化学习1 个月前
算法·强化学习·gym·零基础入门·算法评估
Gym(Gymnasium)仿真环境详解(二):环境简介、入门算法、调参要点、核心挑战OpenAI Gym 目前已由 Farama Foundation 接管维护并更名为 Gymnasium,接口与原 Gym 高度兼容,是强化学习领域最主流的仿真环境库。以下按类别逐一介绍常用环境简介、入门算法、调参要点、核心挑战特性。
指掀涛澜天下惊2 个月前
人工智能·机器学习·强化学习
AI 基础知识十九 强化学习前言RL 不再局限游戏 / 机器人,成为大语言模型对齐、通用人工智能核心工具。广泛地讲,强化学习是机器通过与环境交互来实现目标的一种计算方法。机器在环境的一个状态下做一个动作,这个环境发生相应的改变并且将相应的奖励反馈和下一轮状态传回机器。这个动作决策对未来产生(影响)的收益价值。分为三个层次结构组成:基本元素、主要元素、核心元素
劈星斩月2 个月前
人工智能·机器学习·监督学习·强化学习·无监督学习
机器学习之 定义与三大范式过去十多年,从引爆深度学习浪潮的 ImageNet 图像竞赛、颠覆围棋认知的 AlphaGo,再到掀起生成式 AI 革命的 ChatGPT 大模型,每一次震撼行业的技术颠覆与跨越式突破,本质都是机器学习各类范式持续迭代、相互融合催生的成果。
盼小辉丶2 个月前
pytorch·python·深度学习·强化学习
PyTorch强化学习实战(14)——优先经验回放机制经验回放 (Experience Replay) 通过打破样本间的时序相关性,极大地稳定了训练过程,使深度Q网络 (Deep Q-Network, DQN) 能够从非平稳分布中高效学习。然而,传统经验回放采用均匀采样策略,对所有经验样本一视同仁,这引发了一个关键问题:是否所有经验都具有同等价值?2015 年,DeepMind 的研究团队发表了《Prioritized Experience Replay》,提出了一种全新的采样机制——优先级经验回放。该方法的核心是:强化学习算法可以从更重要、更有价值的经验中
文艺倾年2 个月前
人工智能·分布式·大模型·强化学习·vibecoding
【强化学习】数学推导专题,20W字总结(十五)😊你好,我是小航,一个正在变秃、变强的文艺倾年。 🔔本文讲解【强化学习】数学推导专题,20W字总结(十五),期待与你一同探索、学习、进步,一起卷起来叭!
文艺倾年2 个月前
人工智能·软件工程·强化学习
【强化学习】MDP、贝尔曼方程与CartPole 编程,20W字总结(二)😊你好,我是小航,一个正在变秃、变强的文艺倾年。 🔔本文讲解【强化学习】MDP、贝尔曼方程与CartPole 编程,20W字总结(二),期待与你一同探索、学习、进步,一起卷起来叭!
happyprince2 个月前
人工智能·架构·wpf·强化学习
07_verl-Trainer模块详解Trainer 模块是 verl 训练流程的控制中心,负责编排完整的 PPO(Proximal Policy Optimization)训练循环。它将数据加载、模型推理、奖励计算、优势估计、策略更新等环节串联成一个端到端的训练流水线,同时协调多个分布式 Worker 之间的协作。