强化学习

Better Bench10 小时前
学习·强化学习·贝尔曼方程·离线强化学习·在线强化学习·q值
从摸石头过河到看录像学习:强化学习与离线RL的进化故事举例:一个刚“出生”的机械臂,它面前有一个红色杯子。它想抓住这个杯子,但一开始它连手臂怎么动都会碰倒杯子。经过无数次摔倒和重来,它终于学会了稳稳抓取。这个“试错-学习-变强”的过程,就是强化学习的核心思想。本文将通过一个贯穿始终的机械臂学抓取的故事,由浅入深地揭开强化学习(RL)与离线强化学习(Offline RL)的算法演进史。
论文复现现场11 小时前
强化学习·qwen·大模型微调·rtx4090·算家云·grpo
Qwen3.8-27B 做 GRPO 需要几张 4090?Coding Agent 显存预算与多卡验收Qwen3.8-27B 做 GRPO,不能只按模型权重计算 4090 卡数。单张 24GB 无法容纳完整 BF16 权重;多卡需求还取决于全参或 LoRA、生成并发、上下文长度,以及训练与生成是否共用 GPU。
微小冷2 天前
强化学习·gym·仿真环境·gymnasium·动力学仿真
gymnasium初步教程gymnasium是OpenAI的强化学习(Reinforcement Learning, RL)库,提供了一套统一的Python接口,用于定义和交互单智能体强化学习环境,并内置了大量经典参考环境。pip安装即可
Web3&Basketball3 天前
python·大模型·agent·强化学习·多模态·推理
用 SGLang 决策端点做毫秒级 Agent 路由本文结论先行:把「分类 / 路由 / 判定」这类任务从生成模型里拆出来,交给专门的决策模型(decision model),能把单次延迟从几百毫秒压到 sub-100ms,成本降到原来的几十分之一。SGLang 已在 nightly 加入 /v1/decisions 与 /v1/systemone 端点,AWS 也开源了 Strands Decider 2B,这个方向已经从概念变成可落地的工程选项。
AI你一生一世3 天前
强化学习·决策系统·低延迟推理·非自回归模型·实时竞价
一年前,我用 RL 造了一批非自回归决策模型我是AI时代的无业游民,我游荡在现实与意念之间一年前我在做一个实时竞价场景的决策系统。核心需求是:在 20ms 内,对每一次请求给出一个多维动作——出价、预算分配、投放时段选择。最初团队用的是自回归(autoregressive)序列生成:把动作拆成 token 序列,逐个解码。听起来很优雅,但上线后问题暴露得很彻底。
盘古开天16664 天前
人工智能·算法·机器学习·强化学习·ppo
PPO算法原理详解(上):从策略梯度到近端策略优化的演进之路在强化学习的发展历程中,策略梯度方法(Policy Gradient)一直是最重要的技术路线之一。从最原始的REINFORCE算法,到TRPO,再到如今广为人知的PPO(Proximal Policy Optimization,近端策略优化),策略优化方法经历了从"简单但不稳定"到"复杂但可靠",再到"简单且可靠"的演进过程。
盼小辉丶4 天前
人工智能·pytorch·深度学习·强化学习
PyTorch强化学习实战(27)——进化策略在强化学习中的应用在本节中,我们将改变对强化学习 (Reinforcement Learning, RL) 训练的视角,转而讨论黑盒优化方法,它们在大规模 RL 问题中具有适用性,并能与价值迭代和策略梯度方法竞争。尽管存在时间较长,这类方法在某些情境下仍然更具效率。具体而言,本节将介绍黑盒优化方法:进化策略。
火星机器人life5 天前
强化学习·机器人导航·控制屏障函数·安全滤波
PPO 会探索、CBF 会保命:RADAR-BPO 把复杂环境碰撞率压到 10.7%原文:Risk-Aware Reinforcement Learning with Dynamic Safety Filter for Collision Risk Mitigation in Mobile Robot Navigation 作者:Bingbing Guo、Guina Wang、Yiyang Chen、Yue Gao(苏州大学机电工程学院)、Qian Xie(江苏易程科技股份有限公司) 期刊:Sensors 2025, 25, 5488(MDPI,2025-09-03 出版,DOI: 10
维度攻城狮7 天前
强化学习·dqn·drl
从Q-learning到DQN:小车倒立摆的智能控制进阶想象一辆只能沿水平轨道左右移动的小车,车顶用铰链连着一根细杆。控制器不能直接扶杆,只能左右推车,让支点追到杆的下方。Q-learning、DQN、Double DQN 和 Dueling DQN,就像这位控制器在一次次倒杆之后学会的四代本领。
zh路西法8 天前
python·强化学习·huggingface·ppo·mujoco·microduck
【上手一只MicroDuck】:(一)从机器人结构到强化学习训练框架说人话:安装本身不复杂,uv sync一条命令就够。真正花时间的是两处环境冲突:ARM 机器上第一次下载容易被超时打断,终端里残留的 ROS 环境变量会污染这个 Python 3.12 的虚拟环境。前者把超时调大,后者用run.sh绕开。
阿里云大数据AI技术9 天前
人工智能·强化学习
云栖2026|Agentic AI Infra,加速模型与智能体创新过去一年,AI 重心转向 Agent 自主长跑,KV Cache 成为核心资产,大模型竞争迈入以强化学习为主的后训练时代,智能从数字世界深入到物理世界。这一切要求 AI Infra 从“堆算力”升级为精密系统工程。2026 云栖大会上,阿里云人工智能平台 PAI 带来年度重磅发布,无尽前延、大众汽车、小米、费莫一科技、穹彻智能、流形空间等团队也带来相关技术洞察与最佳实践分享。
AI模力圈15 天前
大模型·强化学习·知识蒸馏
On-Policy Distillation:原理、变体与工程实现解析作者:昇腾实战派 知识地图:https://blog.csdn.net/Lumos_Lovegood/article/details/161601003
xx_xxxxx_16 天前
人工智能·深度学习·机器学习·强化学习
论文阅读-Search-R1这篇文章的点没有啥细节算法设计,整体来说比较好理解。Search-R1(2025,arXiv:2503.09516)研究如何让大语言模型通过强化学习自主学习“何时搜索、搜索什么、是否继续搜索以及如何利用检索结果”。传统RAG通常采用“问题→检索→回答”的单轮模式,而Search-R1将搜索引擎直接纳入RL环境,使模型能够执行“推理→搜索→读取→继续推理→再次搜索→回答”的多轮交互。
xx_xxxxx_17 天前
人工智能·深度学习·机器学习·强化学习
论文阅读-REINFORCE++与Lessons of Developing PRMs两篇论文可以统一到LLM推理强化学习链路:推理轨迹 → Reward/PRM → Advantage → 归一化 → KL约束 → Policy Update。PRM主要解决“什么样的推理过程值得奖励”,REINFORCE++主要解决“如何将奖励稳定地转化为策略更新”。
爱听歌的周童鞋17 天前
强化学习·policy gradient·metric·policy-based
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 9 | Part 1 | 策略梯度方法(该方法的基本思路)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第九讲 Part 1:策略梯度方法(该方法的基本思路),记录个人学习笔记,和大家一起分享交流😄
盼小辉丶18 天前
人工智能·pytorch·深度学习·强化学习
PyTorch强化学习实战——分布式策略梯度深度确定性策略梯度 (Deep Deterministic Policy Gradient, DDPG) 虽然在连续控制任务上取得了比优势演员-评论家 (Advantage Actor-Critic, A2C) 方法更优的效果,但其训练稳定性仍有提升空间。本节将介绍分布式分布深度确定性策略梯度 (Distributed Distributional Deep Deterministic Policy Gradient, D4PG) 算法,它从四个关键维度对 DDPG 进行了改进:用概率分布替代评论家的单一
爱听歌的周童鞋18 天前
强化学习·deep q-learning·experience·replay buffer
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 7 | 值函数近似(DQN-Experience replay)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 7:值函数近似(DQN-Experience replay),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋20 天前
强化学习·sarsa·q-learning·value function·approximation
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 5 | 值函数近似(Sarsa 和 Q-learning)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 5:值函数近似(Sarsa 和 Q-learning),记录个人学习笔记,和大家一起分享交流😄
闲研随记21 天前
算法·llm·强化学习·rl
RL算法学习:ArgMaxRL链接:https://www.doubleai.com/research/argmaxrl-generalizing-maxrl-to-continuous-rewards
XLYcmy21 天前
llm·sft·强化学习·多模态·苹果·rag·检索
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享今天分享的论文是《DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search》