技术栈
强化学习
爱听歌的周童鞋
7 小时前
强化学习
·
sarsa
·
q-learning
·
value function
·
approximation
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 5 | 值函数近似(Sarsa 和 Q-learning)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 5:值函数近似(Sarsa 和 Q-learning),记录个人学习笔记,和大家一起分享交流😄
闲研随记
15 小时前
算法
·
llm
·
强化学习
·
rl
RL算法学习:ArgMaxRL
链接:https://www.doubleai.com/research/argmaxrl-generalizing-maxrl-to-continuous-rewards
XLYcmy
1 天前
llm
·
sft
·
强化学习
·
多模态
·
苹果
·
rag
·
检索
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享
今天分享的论文是《DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search》
爱听歌的周童鞋
2 天前
强化学习
·
example
·
td-linear
·
bellman error
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 4 | 值函数近似(原理-示例与分析)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 4:值函数近似(原理-示例与分析),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋
2 天前
强化学习
·
目标函数
·
value function
·
approximation
·
平稳分布
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 2 | 值函数近似(原理-目标函数介绍)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 2:值函数近似(原理-目标函数介绍),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋
2 天前
强化学习
·
q-learning
·
on-policy
·
off-policy
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 7 | Part 7 | 时序差分方法(Q-learning 伪代码与例子)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第七讲 Part 7:时序差分方法(Q-learning 伪代码与例子),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋
3 天前
强化学习
·
td
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 7 | Part 8 | 时序差分方法(TD 算法的统一形式和总结)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第七讲 Part 8:时序差分方法(TD 算法的统一形式和总结),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋
3 天前
强化学习
·
value function
·
approximation
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 8 | Part 1 | 值函数近似(例子-曲线拟合)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第八讲 Part 1:值函数近似(例子-曲线拟合),记录个人学习笔记,和大家一起分享交流😄
幻影123!
3 天前
人工智能
·
强化学习
·
马尔科夫
·
决策过程
AlphaZero 五子棋实战(一):单卡从零自举,我的v36 最终版配置
这是一个用消费级显卡跑了2个月多的 AlphaZero 五子棋自举实验:不喂棋谱、不装外部引擎当老师、不用开局库,就靠"网络 + MCTS + 自己跟自己下"从零长棋力。这篇文章把最终版 v36 的全套配置、参数、训练策略一次性摊开——包括每个参数现在是多少、为什么是这个值、以及它把外部引擎 Rapfi 打到了什么水平。
幻影123!
3 天前
人工智能
·
机器学习
·
强化学习
·
alpha zero
AlphaZero 五子棋实战(五):评估工具 —— 学会在错误的地方掉头
这个系列的前四篇讲了配置、参数、机制、踩坑。最后这篇讲一件最容易被忽略、但决定了前面所有努力是否有效的事:你怎么知道自己走错了?
爱听歌的周童鞋
4 天前
强化学习
·
rm
·
td learning
·
收敛性
·
mc 对比
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 7 | Part 3 | 时序差分方法(TD 算法收敛性、与 MC 的比较)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第七讲 Part 3:时序差分方法(TD 算法收敛性、与 MC 的比较),记录个人学习笔记,和大家一起分享交流😄
CV山月
7 天前
人工智能
·
经验分享
·
python
·
大模型
·
强化学习
·
研究生
《DPO 算法详解:不训练奖励模型,如何让大模型直接学会人类偏好?》
在前面几期我们介绍了多种强化学习算法,其中我们介绍了 RLHF 框架,这一期的内容我们主要分享的是 DPO 框架,其实更可以称之为优化算法;不同于 RLHF 框架中采用奖励模型 + 策略优化的方式,DPO 直接省去这个过程,直接用 chosen / rejected 更新 Policy;下面我们详细的描述这个方法的来龙去脉;没有阅读之前内容的,可以直接点击下面的链接进行阅读:
xingxiliang
7 天前
强化学习
从 Bellman-Ford 到 DQN:为什么 Target 值比当前 Q 值更值得信?
很多人第一次接触强化学习中的 DQN (Deep Q-Network) 时,都会卡在同一个更新公式上:
CV山月
8 天前
人工智能
·
python
·
大模型
·
强化学习
·
多模态
·
研究生
大模型强化学习对齐:从 RLHF 框架到 PPO 算法原理
前面几期内容,我们主要介绍强化学习中更新模型的手段,比如 GRPO、GSPO 等,那么这一期我们想把顺序理清楚,向大家完善强化学习的框架,并从原理角度介绍 PPO 算法;如果前几期内容没有了解的,可以直接点击下方的链接:
机器学习之心
10 天前
强化学习
·
股票价格预测
基于强化学习的股票价格预测与智能交易实战
用 Deep Q-Network 训练一个会自己买卖股票的交易智能体,是种什么体验?传统的股票价格预测方法,不外乎时间序列模型(ARIMA、GARCH)和深度学习模型(LSTM、Transformer)。这些方法的核心思路是**“预测价格,然后决定买卖”**,即先预测未来价格,再根据预测结果执行交易策略。
XLYcmy
10 天前
自然语言处理
·
llm
·
微调
·
sft
·
论文笔记
·
强化学习
·
自进化
Self-Adapting Language Models论文分享
今天分享的论文是《Self-Adapting Language Models》原文链接:[2506.10943] Self-Adapting Language Models
指掀涛澜天下惊
11 天前
深度学习
·
学习
·
算法
·
强化学习
强化学习进阶篇八 策略梯度算法
Q-learning、DQN 及 DQN 改进算法都是基于价值的方法。其中 Q-learning 是处理有限状态的算法,而 DQN 可以用来解决连续状态的问题。除了基于值函数的方法,还有一支非常经典的方法,那就是基于策略的方法。在此之前要学一些基础:
盼小辉丶
11 天前
人工智能
·
pytorch
·
python
·
深度学习
·
强化学习
PyTorch强化学习实战——融合人类示范数据的高效强化学习
我们已经学习了强化学习在网页导航与浏览器自动化中的应用,介绍了 MiniWoB++ 基准测试,该环境提供像素观测、文本描述和 DOM 元素等多模态输入,动作空间涵盖鼠标键盘操作。并且实现了基于异步优势演员-评论家 (Asynchronous Advantage Actor-Critic, A3C) 算法的按钮点击智能体,将动作空间简化为网格化点击,通过卷积网络处理图像观测。实验结果表明该智能体能解决简单任务(如点击对话框),但在处理多步骤、依赖文本描述或违反马尔可夫性质的任务时效果不佳。 为改进训练过程,
爱听歌的周童鞋
12 天前
强化学习
·
monte carlo
·
estimation
·
model-free
·
mc basic
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 2 | 蒙特卡洛方法(MC Basic 算法介绍)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第五讲 Part 2:蒙特卡洛方法(MC Basic 算法介绍),记录个人学习笔记,和大家一起分享交流😄
爱听歌的周童鞋
12 天前
强化学习
·
example
·
monte carlo
·
mc basic
·
episode length
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 3 | 蒙特卡洛方法(MC Basic 算法例子)
学习赵老师讲授的强化学习的数学原理视频,本篇文章记录第五讲 Part 3:蒙特卡洛方法(MC Basic 算法例子),记录个人学习笔记,和大家一起分享交流😄