rl

闲研随记5 天前
算法·llm·强化学习·rl
RL算法学习:ArgMaxRL链接:https://www.doubleai.com/research/argmaxrl-generalizing-maxrl-to-continuous-rewards
Hello Mr.Z12 天前
机器人·uv·rl·ppo·microduck
microduck_rl(MuJoCo+PPO+WandB+UV训练机器人)MuJoCo: PPO: WandB: UV:Step 1:准备 Ubuntu + NVIDIA GPU
指针常量17 天前
学习·大语言模型·rl·后训练
【RL系列文章】难样本学习等综述:看了很多,总的来说,不利用外部信息的都基本比较扯淡。链接:https://arxiv.org/pdf/2602.01601 本文的核心理论即我们到底选择哪些样本去学习,DAPO的逻辑是把全对全错的去掉,但是这个属于先rollout再评价好坏;本文提出可以事先根据query进行预测答对的概率。本文先证明了一个重要的前提,答对概率越接近50%的题目越具有信息量,优先采样这部分会对训练更有效。 为此,本文设计了一个非常巧妙的纯数学计算的方法,动态的维护题目答对的可能性。已经答过的题的答对概率被更新,未答过
夫唯不争,故无尤也21 天前
强化学习·rl
RL强化学习常见问题目录1. 最经典的问题:Reward Hacking / Reward Over-optimization
夫唯不争,故无尤也22 天前
llm·agent·强化学习·rl·opd
On-Policy Distillation(OPD)和reinforcement (RL)结合你这里说的 OPD,在当前 LLM 后训练 / Agent 语境里,通常指 On-Policy Distillation,在线策略蒸馏。
夫唯不争,故无尤也23 天前
人工智能·深度学习·机器学习·强化学习·rl
Agentic Search + RL :打通从RL原理到实际训练全流程目录结论一、先把传统 RL 和 Agentic Search 对上号二、一次真正的 Agentic Search RL Rollout 是怎么发生的
Terrence Shen1 个月前
大模型·agent·强化学习·rl
【读论文系列】AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS翻译+解读arXiv v1 原名 Online Process Reward Learning(OPRL),最终 ICLR 2026 版本改名为 Agentic Reinforcement Learning with Implicit Step Rewards(iStar)。以下以 arXiv v3、ICLR 2026 camera-ready 为准,并用 ICLR slides 补充作者想强调的直觉。
山顶夕景1 个月前
agent·强化学习·多模态·rl·agentic
【MLLM Agent】多模态理解Agent研究进展(1)框架类(可直接搭建多模态 Agent 基座) DeepSeek‑Harness(DeepSeek 2026) 定位:Agent 运行时框架,近期新增 Vision 支持,对接 V4‑Flash‑Vision‑Exp,实现图片输入 + 原生 function call 闭环,可插拔 Agent 循环、工具、记忆、上下文管理 仓库:https://github.com/deepseek‑ai/harness
闲研随记1 个月前
算法·llm·强化学习·iclr·rl
【文献阅读 ICLR 2026】RL算法:DECS标题:通过解耦奖励和课程数据调度来缓解过度思考 方法名称:DECS 论文链接:arxiv:2509.25827v2 项目链接:https://github.com/pixas/DECS 发表会议:ICLR 2026
TechEdu2026061 个月前
人工智能·ai·rl
[人工智能]Tianshou强化学习框架:概念、架构与工程实践Tianshou强化学习框架:概念、架构与工程实践本文面向工程实践与科研应用,系统介绍Tianshou强化学习框架的核心概念、架构设计和常见使用模式。Tianshou基于PyTorch实现,突出模块化、可复用和高性能,提供丰富的策略类、采样器、经验回放和训练工具,适合从原型验证到工程落地的不同阶段。本文结合示意图和表格,形成超过4页的技术参考材料,便于团队内部培训和方案评审。
闲研随记2 个月前
论文阅读·算法·llm·强化学习·rl·icml·grpo
【文献阅读 ICML 2026】RL算法:Critique-GRPOCritique-GRPO:通过自然语言和数值反馈提升LLM推理能力基于数值反馈的在线强化学习使LLM能够通过试错机制(trial-and-error)学习,大幅提升了推理能力。然而,纯数值反馈的RL存在三大核心局限:
山顶夕景2 个月前
rl·vqa·vlm·grpo·视频质量评估
【AAAI 2026】VQAThinker:通过RL进行可解释VQA训练论文:VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning 2026.2 https://github.com/clh124/VQAThinker 开源模型:https://huggingface.co/kkkkkklinhan/InternVL3-VQAThinker-8B
熊猫钓鱼>_>4 个月前
人工智能·llm·强化学习·rl·马尔可夫·mdp·决策过程
强化学习与决策优化:从理论到工程落地的完整指南摘要:强化学习(Reinforcement Learning, RL)作为人工智能领域的重要分支,正在从游戏场景走向工业现场。本文将深入讲解RL的核心原理、主流算法,并通过桥梁智能设计的具体案例,展示如何将RL技术落地应用于工程决策场景。
江汉似年4 个月前
人工智能·深度学习·算法·rl
强化学习中的 On-policy 与 Off-policy 全面解析本文系统总结强化学习中 On-policy 与 Off-policy 的核心区别、典型算法、底层原理以及现代 RL 中的发展趋势。
江汉似年4 个月前
rl
【无标题】基于 Lilian Weng 的经典博客《A (Long) Peek into Reinforcement Learning》整理,并结合经典强化学习理论进行系统归纳。
非社会人士5 个月前
强化学习·rlhf·rl·ppo·verl·infra
RL 系统 Infra 笔记:区分不同模型强化学习系统(RLHF/PPO)Infra 学习笔记,从 Infra 视角梳理各模块职责、数据流与训练循环,持续更新。
Robot_Nav5 个月前
rl·learning_based·mppi
RL-Driven MPPI:基于离线策略加速在线控制律计算的模型预测路径积分控制最优控制方法是众多复杂控制与决策任务的核心技术,其目标是通过求解由预设代价函数和系统动力学定义的优化问题,找到最优控制律序列。传统最优控制方法,如线性二次调节器(LQR),在处理线性系统时表现优异,但面对非线性系统时存在明显局限。
大唐荣华5 个月前
强化学习·rl·vla
从π到F:分阶段强化学习如何让机器人学会精密装配在具身智能与机器人操作领域,长时序精密装配一直是核心难题——从目标搜索、姿态对齐、稳定抓取到精准插入,任何一环失误都会导致任务失败。传统端到端强化学习常面临样本效率低、任务拆解难、鲁棒性不足的问题,而分阶段策略学习凭借「前向初始化+反向微调」的闭环框架,成为解决复杂操作任务的主流方案。
bryant_meng6 个月前
人工智能·深度学习·rl·vla·世界模型·vlm
【VLA】Vision Language Action世界模型 是智能体(Agent)内部对环境动态(dynamics)的可学习、可推理的内部表征或模拟器。它能预测“如果我执行某个动作,环境会如何变化”。
山顶夕景6 个月前
大模型·强化学习·图像生成·rl·agentic
【MLLM】GraphWalker:Deepresearch用于图像生成【Deepresearch用于图像生成思路】思路是用于图像生成的多模态深度搜索智能体,进行多跳推理与搜索,以获取图像生成所需的文本知识和参考图像,结论是在KnowGen上使Qwen-Image性能提高约16分,在WISE上提高约15分。GraphWalker: Agentic Knowledge Graph Question Answer-ing via Synthetic Trajectory Curriculum,https://arxiv.org/pdf/2603.28533,https://gen