强化学习

爱听歌的周童鞋7 小时前
强化学习·sarsa·q-learning·value function·approximation
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 5 | 值函数近似(Sarsa 和 Q-learning)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 5:值函数近似(Sarsa 和 Q-learning),记录个人学习笔记,和大家一起分享交流😄
闲研随记15 小时前
算法·llm·强化学习·rl
RL算法学习:ArgMaxRL链接:https://www.doubleai.com/research/argmaxrl-generalizing-maxrl-to-continuous-rewards
XLYcmy1 天前
llm·sft·强化学习·多模态·苹果·rag·检索
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享今天分享的论文是《DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search》
爱听歌的周童鞋2 天前
强化学习·example·td-linear·bellman error
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 4 | 值函数近似(原理-示例与分析)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 4:值函数近似(原理-示例与分析),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋2 天前
强化学习·目标函数·value function·approximation·平稳分布
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 2 | 值函数近似(原理-目标函数介绍)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 2:值函数近似(原理-目标函数介绍),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋2 天前
强化学习·q-learning·on-policy·off-policy
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 7 | Part 7 | 时序差分方法(Q-learning 伪代码与例子)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第七讲 Part 7:时序差分方法(Q-learning 伪代码与例子),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋3 天前
强化学习·td
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 7 | Part 8 | 时序差分方法(TD 算法的统一形式和总结)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第七讲 Part 8:时序差分方法(TD 算法的统一形式和总结),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋3 天前
强化学习·value function·approximation
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 1 | 值函数近似(例子-曲线拟合)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 1:值函数近似(例子-曲线拟合),记录个人学习笔记,和大家一起分享交流😄
幻影123!3 天前
人工智能·强化学习·马尔科夫·决策过程
AlphaZero 五子棋实战(一):单卡从零自举,我的v36 最终版配置这是一个用消费级显卡跑了2个月多的 AlphaZero 五子棋自举实验:不喂棋谱、不装外部引擎当老师、不用开局库,就靠"网络 + MCTS + 自己跟自己下"从零长棋力。这篇文章把最终版 v36 的全套配置、参数、训练策略一次性摊开——包括每个参数现在是多少、为什么是这个值、以及它把外部引擎 Rapfi 打到了什么水平。
幻影123!3 天前
人工智能·机器学习·强化学习·alpha zero
AlphaZero 五子棋实战(五):评估工具 —— 学会在错误的地方掉头这个系列的前四篇讲了配置、参数、机制、踩坑。最后这篇讲一件最容易被忽略、但决定了前面所有努力是否有效的事:你怎么知道自己走错了?
爱听歌的周童鞋4 天前
强化学习·rm·td learning·收敛性·mc 对比
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 7 | Part 3 | 时序差分方法(TD 算法收敛性、与 MC 的比较)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第七讲 Part 3:时序差分方法(TD 算法收敛性、与 MC 的比较),记录个人学习笔记,和大家一起分享交流😄
CV山月7 天前
人工智能·经验分享·python·大模型·强化学习·研究生
《DPO 算法详解:不训练奖励模型,如何让大模型直接学会人类偏好?》在前面几期我们介绍了多种强化学习算法,其中我们介绍了 RLHF 框架,这一期的内容我们主要分享的是 DPO 框架,其实更可以称之为优化算法;不同于 RLHF 框架中采用奖励模型 + 策略优化的方式,DPO 直接省去这个过程,直接用 chosen / rejected 更新 Policy;下面我们详细的描述这个方法的来龙去脉;没有阅读之前内容的,可以直接点击下面的链接进行阅读:
xingxiliang7 天前
强化学习
从 Bellman-Ford 到 DQN:为什么 Target 值比当前 Q 值更值得信?很多人第一次接触强化学习中的 DQN (Deep Q-Network) 时,都会卡在同一个更新公式上:
CV山月8 天前
人工智能·python·大模型·强化学习·多模态·研究生
大模型强化学习对齐:从 RLHF 框架到 PPO 算法原理前面几期内容,我们主要介绍强化学习中更新模型的手段,比如 GRPO、GSPO 等,那么这一期我们想把顺序理清楚,向大家完善强化学习的框架,并从原理角度介绍 PPO 算法;如果前几期内容没有了解的,可以直接点击下方的链接:
机器学习之心10 天前
强化学习·股票价格预测
基于强化学习的股票价格预测与智能交易实战用 Deep Q-Network 训练一个会自己买卖股票的交易智能体,是种什么体验?传统的股票价格预测方法,不外乎时间序列模型(ARIMA、GARCH)和深度学习模型(LSTM、Transformer)。这些方法的核心思路是**“预测价格,然后决定买卖”**,即先预测未来价格,再根据预测结果执行交易策略。
XLYcmy10 天前
自然语言处理·llm·微调·sft·论文笔记·强化学习·自进化
Self-Adapting Language Models论文分享今天分享的论文是《Self-Adapting Language Models》原文链接:[2506.10943] Self-Adapting Language Models
指掀涛澜天下惊11 天前
深度学习·学习·算法·强化学习
强化学习进阶篇八 策略梯度算法Q-learning、DQN 及 DQN 改进算法都是基于价值的方法。其中 Q-learning 是处理有限状态的算法,而 DQN 可以用来解决连续状态的问题。除了基于值函数的方法,还有一支非常经典的方法,那就是基于策略的方法。在此之前要学一些基础:
盼小辉丶11 天前
人工智能·pytorch·python·深度学习·强化学习
PyTorch强化学习实战——融合人类示范数据的高效强化学习我们已经学习了强化学习在网页导航与浏览器自动化中的应用,介绍了 MiniWoB++ 基准测试,该环境提供像素观测、文本描述和 DOM 元素等多模态输入,动作空间涵盖鼠标键盘操作。并且实现了基于异步优势演员-评论家 (Asynchronous Advantage Actor-Critic, A3C) 算法的按钮点击智能体,将动作空间简化为网格化点击,通过卷积网络处理图像观测。实验结果表明该智能体能解决简单任务(如点击对话框),但在处理多步骤、依赖文本描述或违反马尔可夫性质的任务时效果不佳。 为改进训练过程,
爱听歌的周童鞋12 天前
强化学习·monte carlo·estimation·model-free·mc basic
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 2 | 蒙特卡洛方法(MC Basic 算法介绍)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第五讲 Part 2:蒙特卡洛方法(MC Basic 算法介绍),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋12 天前
强化学习·example·monte carlo·mc basic·episode length
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 3 | 蒙特卡洛方法(MC Basic 算法例子)学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第五讲 Part 3:蒙特卡洛方法(MC Basic 算法例子),记录个人学习笔记,和大家一起分享交流😄