强化学习的数学原理 学习笔记

视频资源

https://www.bilibili.com/video/BV1sd4y167NS/?spm_id_from=333.337.search-card.all.click\&vd_source=ec24b6849ccef697ae8281501f02da61

以下所有PPT的截图都来自于老师课件,可在视频链接中获取

Chapter 1

  • state state space
  • action
    action space of a state
  • state transition


    Q: penalty 设置的不合理 是不是训练结果就不理想了 和cost function 设置异曲同工?
    是的,penalty(正则化惩罚项)设置不合理确实会导致训练结果不理想,这和代价函数(cost function)设计不当的影响是异曲同工甚至相辅相成的:一方面,如果 penalty 的类型(L1/L2)或系数 λ 选得不合适,比如 λ 过大容易欠拟合、λ 过小无法抑制过拟合,都会让模型在验证集上的泛化效果变差;另一方面,cost function 若不能正确衡量任务目标(如分类用均方误差、正负样本严重失衡未加权等),同样会使优化方向偏离最优解。二者本质都是在影响目标函数(total loss = cost function + penalty)的形貌与优化路径------cost function 引导模型去拟合数据分布,penalty 约束模型复杂度防止过拟合,任一方设计失当都会让最终学到的参数并非真正"最优",从而导致训练或泛化结果不理想。

Case 1 可能虽然惩罚 但是整体更近

比较受限,只能表示确定的情况,实际可能一个状态transit到不同的情况

现在状态是s1 我采取a2的行动 跳到s2 的概率是1

如果是 stochastic 情况 可能各自是0.5

  • policy
    用箭头来表示

复杂情况则使用数学方式表达 pi 是条件概率,在状态S1下采取a1的概率为x

也分为 deterministic 和stochastic 情况

表格形式也可以表达

  • reward


    Q一般reward 我要怎么设计才合理 是不是和penalty要一样 怎么在实际中调整我的惩罚和奖励
    在实际调 reward 时,核心是先保证"信号干净、尺度一致",再慢慢平衡奖励和惩罚,而不是追求数学对称。你可以先把 reward 拆成三部分:完成主目标的稀疏大奖励(比如任务成功给 +1)、过程小奖励(如接近目标给 +0.01)、以及行为惩罚(如每步 -0.001、撞墙 -0.1)。惩罚不要和奖励硬对齐,而是用来"压掉坏行为、拉长探索时间",比如步数惩罚是为了鼓励高效策略,违反约束的惩罚要明显大于单步收益,避免模型学会"靠犯错刷分"。实际调参时,先用只有 reward 的简化环境看能否学到基础行为,再逐步加入 penalty,观察 reward curve:如果 early stopping 太早、策略很保守,就减小 penalty 或给更多过程奖励;如果疯狂试探边界、频繁违规,就适当加大对应惩罚。最后记得做 reward scaling,把总 reward 控制在相近量级(比如 -1,1-10,10),避免某一块主导梯度,这样训练会更稳、调参也更直观

reward 形式也可以是随机的

  • trajectory and return

return 是一个总的reward

防止在变大的sum值引入折扣率 等比数列公式以及由于 折扣率小于1 最后化简

  • episode
    对于有terminal state的trial 我们称为episode 反之 continuing tasks

对于二者 我们可以统一处理

使用case 2 的话 就不用区分 target state了 和其他normal state一样

  • MDP
    历史无关性

如果policy 确定了 那么就编程马尔科夫过程

Chapter 2

Chapter 3

Chapter 4

Chapter 5

Chapter 6

Chapter 7

chapter 8

chatpter 9

Chapter10

相关推荐
星辰徐哥1 分钟前
鸿蒙PC平台 Gnote 笔记应用适配实战:从 Linux 到 鸿蒙PC 的 Electron 迁移
linux·笔记·electron·harmonyos·gnote
夏文强2 分钟前
DeepSeek Harness 可观测性:用 OpenTelemetry 把会话遥测出去
人工智能·开源·大模型·agent·deepseek
艾莉丝努力练剑2 分钟前
【AI大模型接入SDK】Gemini模型接入知识体系
java·开发语言·网络·人工智能·网络协议·学习·http
AC赳赳老秦3 分钟前
电力能源公开数据采集实操:用 OpenClaw 合规抓取电网电价与发电量数据,生成区域能源供需分析报告
大数据·数据库·人工智能·python·php·deepseek·openclaw
ljt27249606613 分钟前
Flutter笔记--本地通知
笔记·flutter
一切皆是因缘际会4 分钟前
资源的适配
大数据·人工智能·算法
计算机编程-吉哥5 分钟前
小麦叶病害识别系统:基于MobileNet的智能农业病害检测实战【计算机毕业设计选题推荐、深度学习】
人工智能·深度学习·毕业设计·课程设计·计算机毕业设计选题·机器学习毕业设计·大数据毕业设计选题推荐
传奇开心果编程6 分钟前
【Rust入门知识点学与练】第13课:枚举 Enum
开发语言·学习·rust
新知图书7 分钟前
第11章 智能体应用设计模式
人工智能·智能体
LlmCraft|大模型工程实践11 分钟前
09 大语言模型(LLM)演进与 Prompt 入门
人工智能·语言模型·prompt