强化学习·导论

任务类型:单元式和持续型任务

  • 分为单元式(Episodic)和持续型任务
  • 单元式任务存在一个开始和结束状态
  • 持续型任务没有结束状态。

探索和利用

  • 探索是通过尝试随机行动来探索环境,以获取更多关于环境的信息。
  • 利用是利用已知信息以最大化回报。

解决强化学习的两类方法

基于策略的方法

  • 直接学习一个最佳的策略,然后根据策略指导行动,间接的让智能体选择有价值的状态
  • 这个策略可能是确定性的(返回一个确定的动作),可能是随机的(返回一个动作函数的概率分布)。


基于价值的方法

  • 在基于价值的方法中,我们不是学习策略函数,而是学习一个价值函数,将状态映射到处于该状态的期望值。

  • 状态的价值是代理人在该状态开始并按照我们的策略行动时,能获得的预期贴现回报。

  • "按照我们的政策行事"只是意味着我们的政策"归属于价值最高的国家"。

深度强化学习中"深度"的含义

相关推荐
技术小黑2 小时前
RNN算法实战系列04 | LSTM火灾温度预测
rnn·深度学习·lstm·tensorflow2
2zcode17 小时前
基于MATLAB深度学习的乳腺钼靶影像乳腺癌智能诊断系统设计与实现
开发语言·深度学习·matlab·乳腺癌
Mister Leon17 小时前
深度学习踩坑之JIT ——即时编译(Just-In-Time Compilation)
深度学习
TechEdu20260619 小时前
[人工智能]深度学习(DL)算法:网络结构、训练方法与工程实践
人工智能·深度学习·ai
AI人工智能+19 小时前
智能文档抽取系统采用“解析底座+大模型“双引擎架构,突破传统OCR局限
深度学习·ocr·文档抽取
林泽毅20 小时前
PyTRIO:当强化学习不再需要本地GPU
人工智能·python·深度学习·机器学习
这张生成的图像能检测吗21 小时前
(论文速读)SCNN:用于交通场景理解的空间CNN
人工智能·深度学习·目标检测·计算机视觉·道路线检测
就是一顿骚操作1 天前
生成对抗网络 GAN:生成模型的经典入门解读
人工智能·深度学习·神经网络·生成对抗网络·论文解读
其美杰布-富贵-李1 天前
为什么注意力分数要除以 $\sqrt{d_k}$
深度学习·注意力
ZENERGY-众壹1 天前
AI 诊断光伏组件热斑:从 10% 功率偏差到深度学习建模的实战复盘
人工智能·深度学习·光伏运维·逆变器api·能源数字化