rl

夫唯不争,故无尤也1 天前
强化学习·rl
RL强化学习常见问题目录1. 最经典的问题:Reward Hacking / Reward Over-optimization
夫唯不争,故无尤也2 天前
llm·agent·强化学习·rl·opd
On-Policy Distillation(OPD)和reinforcement (RL)结合你这里说的 OPD,在当前 LLM 后训练 / Agent 语境里,通常指 On-Policy Distillation,在线策略蒸馏。
夫唯不争,故无尤也2 天前
人工智能·深度学习·机器学习·强化学习·rl
Agentic Search + RL :打通从RL原理到实际训练全流程目录结论一、先把传统 RL 和 Agentic Search 对上号二、一次真正的 Agentic Search RL Rollout 是怎么发生的
Terrence Shen6 天前
大模型·agent·强化学习·rl
【读论文系列】AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS翻译+解读arXiv v1 原名 Online Process Reward Learning(OPRL),最终 ICLR 2026 版本改名为 Agentic Reinforcement Learning with Implicit Step Rewards(iStar)。以下以 arXiv v3、ICLR 2026 camera-ready 为准,并用 ICLR slides 补充作者想强调的直觉。
山顶夕景7 天前
agent·强化学习·多模态·rl·agentic
【MLLM Agent】多模态理解Agent研究进展(1)框架类(可直接搭建多模态 Agent 基座) DeepSeek‑Harness(DeepSeek 2026) 定位:Agent 运行时框架,近期新增 Vision 支持,对接 V4‑Flash‑Vision‑Exp,实现图片输入 + 原生 function call 闭环,可插拔 Agent 循环、工具、记忆、上下文管理 仓库:https://github.com/deepseek‑ai/harness
闲研随记8 天前
算法·llm·强化学习·iclr·rl
【文献阅读 ICLR 2026】RL算法:DECS标题:通过解耦奖励和课程数据调度来缓解过度思考 方法名称:DECS 论文链接:arxiv:2509.25827v2 项目链接:https://github.com/pixas/DECS 发表会议:ICLR 2026
TechEdu20260613 天前
人工智能·ai·rl
[人工智能]Tianshou强化学习框架:概念、架构与工程实践Tianshou强化学习框架:概念、架构与工程实践本文面向工程实践与科研应用,系统介绍Tianshou强化学习框架的核心概念、架构设计和常见使用模式。Tianshou基于PyTorch实现,突出模块化、可复用和高性能,提供丰富的策略类、采样器、经验回放和训练工具,适合从原型验证到工程落地的不同阶段。本文结合示意图和表格,形成超过4页的技术参考材料,便于团队内部培训和方案评审。
闲研随记2 个月前
论文阅读·算法·llm·强化学习·rl·icml·grpo
【文献阅读 ICML 2026】RL算法:Critique-GRPOCritique-GRPO:通过自然语言和数值反馈提升LLM推理能力基于数值反馈的在线强化学习使LLM能够通过试错机制(trial-and-error)学习,大幅提升了推理能力。然而,纯数值反馈的RL存在三大核心局限:
山顶夕景2 个月前
rl·vqa·vlm·grpo·视频质量评估
【AAAI 2026】VQAThinker:通过RL进行可解释VQA训练论文:VQAThinker: Exploring Generalizable and Explainable Video Quality Assessment via Reinforcement Learning 2026.2 https://github.com/clh124/VQAThinker 开源模型:https://huggingface.co/kkkkkklinhan/InternVL3-VQAThinker-8B
熊猫钓鱼>_>3 个月前
人工智能·llm·强化学习·rl·马尔可夫·mdp·决策过程
强化学习与决策优化:从理论到工程落地的完整指南摘要:强化学习(Reinforcement Learning, RL)作为人工智能领域的重要分支,正在从游戏场景走向工业现场。本文将深入讲解RL的核心原理、主流算法,并通过桥梁智能设计的具体案例,展示如何将RL技术落地应用于工程决策场景。
江汉似年4 个月前
人工智能·深度学习·算法·rl
强化学习中的 On-policy 与 Off-policy 全面解析本文系统总结强化学习中 On-policy 与 Off-policy 的核心区别、典型算法、底层原理以及现代 RL 中的发展趋势。
江汉似年4 个月前
rl
【无标题】基于 Lilian Weng 的经典博客《A (Long) Peek into Reinforcement Learning》整理,并结合经典强化学习理论进行系统归纳。
非社会人士4 个月前
强化学习·rlhf·rl·ppo·verl·infra
RL 系统 Infra 笔记:区分不同模型强化学习系统(RLHF/PPO)Infra 学习笔记,从 Infra 视角梳理各模块职责、数据流与训练循环,持续更新。
Robot_Nav4 个月前
rl·learning_based·mppi
RL-Driven MPPI:基于离线策略加速在线控制律计算的模型预测路径积分控制最优控制方法是众多复杂控制与决策任务的核心技术,其目标是通过求解由预设代价函数和系统动力学定义的优化问题,找到最优控制律序列。传统最优控制方法,如线性二次调节器(LQR),在处理线性系统时表现优异,但面对非线性系统时存在明显局限。
大唐荣华5 个月前
强化学习·rl·vla
从π到F:分阶段强化学习如何让机器人学会精密装配在具身智能与机器人操作领域,长时序精密装配一直是核心难题——从目标搜索、姿态对齐、稳定抓取到精准插入,任何一环失误都会导致任务失败。传统端到端强化学习常面临样本效率低、任务拆解难、鲁棒性不足的问题,而分阶段策略学习凭借「前向初始化+反向微调」的闭环框架,成为解决复杂操作任务的主流方案。
bryant_meng5 个月前
人工智能·深度学习·rl·vla·世界模型·vlm
【VLA】Vision Language Action世界模型 是智能体(Agent)内部对环境动态(dynamics)的可学习、可推理的内部表征或模拟器。它能预测“如果我执行某个动作,环境会如何变化”。
山顶夕景5 个月前
大模型·强化学习·图像生成·rl·agentic
【MLLM】GraphWalker:Deepresearch用于图像生成【Deepresearch用于图像生成思路】思路是用于图像生成的多模态深度搜索智能体,进行多跳推理与搜索,以获取图像生成所需的文本知识和参考图像,结论是在KnowGen上使Qwen-Image性能提高约16分,在WISE上提高约15分。GraphWalker: Agentic Knowledge Graph Question Answer-ing via Synthetic Trajectory Curriculum,https://arxiv.org/pdf/2603.28533,https://gen
传说故事5 个月前
论文阅读·人工智能·具身智能·rl
【论文阅读】RL Token: Bootstrapping Online RL with Vision-Language-Action Models在大型视觉-语言-动作模型(VLA)里插一个专门的“RL Token”来提取特征,让机器人只需在线练习几小时就能掌握拧螺丝、插线等极高难度的微操。
亚里随笔6 个月前
人工智能·学习·llm·rl·agentic
OpenClaw-RL:让AI Agent在对话中自主学习进化想象一下,你的AI助手每与你互动一次,就自动变得更懂你的偏好——无需额外标注,无需人工干预,仅仅是"在使用中学习"。这正是OpenClaw-RL带来的突破性范式:将每一次对话的"下一状态信号"转化为实时在线学习源,实现Agent的持续进化。
山顶夕景6 个月前
大模型·llm·强化学习·rl·agentic rl
【LLM】ROLL团队的Agentic RL训练坑点首先在 ROLL 中构建了一套环境管理器,并清晰地划分了三个核心组件之间的交互边界:ROLL(训练框架)、iFlow CLI(Agent 框架) 和 ROCK(沙箱管理器)。