强化学习的数学原理 学习笔记

视频资源

https://www.bilibili.com/video/BV1sd4y167NS/?spm_id_from=333.337.search-card.all.click\&vd_source=ec24b6849ccef697ae8281501f02da61

以下所有PPT的截图都来自于老师课件,可在视频链接中获取

Chapter 1

  • state state space
  • action
    action space of a state
  • state transition


    Q: penalty 设置的不合理 是不是训练结果就不理想了 和cost function 设置异曲同工?
    是的,penalty(正则化惩罚项)设置不合理确实会导致训练结果不理想,这和代价函数(cost function)设计不当的影响是异曲同工甚至相辅相成的:一方面,如果 penalty 的类型(L1/L2)或系数 λ 选得不合适,比如 λ 过大容易欠拟合、λ 过小无法抑制过拟合,都会让模型在验证集上的泛化效果变差;另一方面,cost function 若不能正确衡量任务目标(如分类用均方误差、正负样本严重失衡未加权等),同样会使优化方向偏离最优解。二者本质都是在影响目标函数(total loss = cost function + penalty)的形貌与优化路径------cost function 引导模型去拟合数据分布,penalty 约束模型复杂度防止过拟合,任一方设计失当都会让最终学到的参数并非真正"最优",从而导致训练或泛化结果不理想。

Case 1 可能虽然惩罚 但是整体更近

比较受限,只能表示确定的情况,实际可能一个状态transit到不同的情况

现在状态是s1 我采取a2的行动 跳到s2 的概率是1

如果是 stochastic 情况 可能各自是0.5

  • policy
    用箭头来表示

复杂情况则使用数学方式表达 pi 是条件概率,在状态S1下采取a1的概率为x

也分为 deterministic 和stochastic 情况

表格形式也可以表达

  • reward


    Q一般reward 我要怎么设计才合理 是不是和penalty要一样 怎么在实际中调整我的惩罚和奖励
    在实际调 reward 时,核心是先保证"信号干净、尺度一致",再慢慢平衡奖励和惩罚,而不是追求数学对称。你可以先把 reward 拆成三部分:完成主目标的稀疏大奖励(比如任务成功给 +1)、过程小奖励(如接近目标给 +0.01)、以及行为惩罚(如每步 -0.001、撞墙 -0.1)。惩罚不要和奖励硬对齐,而是用来"压掉坏行为、拉长探索时间",比如步数惩罚是为了鼓励高效策略,违反约束的惩罚要明显大于单步收益,避免模型学会"靠犯错刷分"。实际调参时,先用只有 reward 的简化环境看能否学到基础行为,再逐步加入 penalty,观察 reward curve:如果 early stopping 太早、策略很保守,就减小 penalty 或给更多过程奖励;如果疯狂试探边界、频繁违规,就适当加大对应惩罚。最后记得做 reward scaling,把总 reward 控制在相近量级(比如 -1,1-10,10),避免某一块主导梯度,这样训练会更稳、调参也更直观

reward 形式也可以是随机的

  • trajectory and return

return 是一个总的reward

防止在变大的sum值引入折扣率 等比数列公式以及由于 折扣率小于1 最后化简

  • episode
    对于有terminal state的trial 我们称为episode 反之 continuing tasks

对于二者 我们可以统一处理

使用case 2 的话 就不用区分 target state了 和其他normal state一样

  • MDP
    历史无关性

如果policy 确定了 那么就编程马尔科夫过程

Chapter 2

Chapter 3

Chapter 4

Chapter 5

Chapter 6

Chapter 7

chapter 8

chatpter 9

Chapter10

相关推荐
小小仙子2 分钟前
矢量网络分析仪如何测试S参数的?
人工智能·算法·机器学习
IT_陈寒16 分钟前
SpringBoot这个分页坑,我踩了三天才爬出来
前端·人工智能·后端
颜酱19 分钟前
05 | 召回前置准备:根据业务数据库生成各数据库(读取配置阶段)
前端·人工智能·后端
Infedium37 分钟前
英特物理AI仿真赋能制造!打破传统有限元瓶颈,研发提效降本翻倍
人工智能·制造
天国梦1 小时前
2026英语教学系统选型实战:AI如何让备课效率提升42%?天学网技术落地全解析
人工智能·学习
hqyjzsb1 小时前
AI证书和传统证书有什么区别?
人工智能·金融·数据挖掘·数据分析·aigc·创业创新·学习方法
阿里云大数据AI技术1 小时前
阿里云 Elasticsearch 9.4 Agent Builder 实战
人工智能·elasticsearch·agent
维克兜率天1 小时前
【维克】大数定律与中心极限定理:为什么长期均值终将回归?
经验分享·学习·金融·概率论
用户7783366132111 小时前
serpbase + Cloudflare R2 边缘持久化实战
前端·人工智能
东方小月1 小时前
从零开发一个 Coding Agent(三):EventStream 事件流通道设计与实现
前端·人工智能·后端