强化学习方法分类:

强化学习的目标就是找到一个最优策略。

强化学习方法就是通过不同的思路与路径找到最优策略。

强化学习方法分类:

1. 按"是否利用环境模型"分类

分类核心:算法是否利用环境的状态转移概率 P 和 奖励函数 R来学习最优策略。

  • 有模型方法 (Model-Based): 智能体完全了解环境的运转规律(即"游戏物理引擎"和"计分规则"是已知的)。在已知环境状态转移函数和奖励函数的情况下,算法可以通过推导下一个可能状态的价值来更新当前状态的价值 。

    • 典型代表: 动态规划(DP)、动态规划分为价值迭代算法与策略迭代算法 。
  • 无模型方法 (Model-Free): 在许多实际场景中,我们无法提前得知环境的底层概率规律 。智能体只能通过在环境中不断尝试(探索)、收集真实数据来学习 。

    • 典型代表: 蒙特卡洛方法(Monte-Carlo Methods),它通过"实战模拟"和经验采样来进行无模型的价值估计 。

2. 按"状态价值的表示与存储方式"分类

当环境变得极其复杂时,记录状态价值的方式决定了算法的适用范围。

  • 查表法 (Tabular Methods): 适用于状态和动作空间较小、离散的简单环境。它像一个 Excel 表格一样,每一行是一个状态 s,每一列是一个动作 a,格子里的值就是动作价值 q(s,a) 。

    • 典型代表: 传统的动态规划、基础的蒙特卡洛方法 。
  • 函数逼近法 / 深度强化学习 (Deep Reinforcement Learning, DRL): 当面对海量或连续的状态空间(如围棋的 10\^{170} 种状态,或自动驾驶的连续像素画面)时,传统表格根本存不下 。此时引入神经网络(NN/DNN/CNN)作为非线性函数逼近器,通过输入状态来输出预测价值,从而打破了"维度灾难" 。

    • 典型代表: DQN(Deep Q-Network)算法、AlphaGo 。

3. 按"数据采样的策略与更新策略是否一致"分类

这个分类主要针对无模型方法,区别在于智能体能否"从历史经验或他人的经验中学习"。

  • 同策略 (On-Policy): 智能体必须使用当前正在优化的策略去与环境交互并收集数据。一旦策略更新,之前收集的旧数据就作废了。

    • 典型代表: 基础的蒙特卡洛价值估计(要求使用当前策略采样序列来计算价值) 。
  • 离策略 (Off-Policy): 算法允许使用历史旧策略产生的数据,来优化当前的最新策略 。这种特性使得算法可以建立"记忆库"并反复利用过去的数据,大幅提升了样本利用率 。

    • 典型代表: 带有经验回放(Experience Replay)机制的 Q-Learning、DQN、DDPG 等算法 。
相关推荐
m4Rk_3 小时前
【论文阅读】Agent 记忆机制(83):Inside Out——用可演化 PersonaTree 构建 Agent 的核心长期记忆
论文阅读·人工智能·学习·开源·github
运行时异常3 小时前
【WMS 仓储系统集成 AI Agent 实战】第 8 讲(终篇):生产部署与并发安全——Semaphore 放进 Flux.defer 的坑,压测抓了一晚上
人工智能·安全
杨杨杨大侠3 小时前
Jev、Kev、Laya:决策模型怎么选,什么时候需要微调?
人工智能·python·agent
代码方舟3 小时前
零信任架构实战:基于天远人企关联构建自动化供应链金融网关
运维·人工智能·架构·自动化
虹科网络安全4 小时前
“顶会”看安全(十八):超越越狱:揭示由能力边界模糊引发的 LLM 应用安全风险
人工智能·安全
Maiko Star4 小时前
* LangChain 提示词模板详解:ChatPromptTemplate 的使用与高级特性
java·人工智能·langchain
鬓戈4 小时前
Rust 语言与 AI 应用生态调研及学习路径
人工智能·学习·rust
天远API4 小时前
零信任架构实战:基于天远人企关联构建自动化图谱网关
网络·人工智能·架构·自动化
爱吃提升4 小时前
文生视频模型发展趋势(2026)
人工智能·音视频
AIGS0015 小时前
什么是本体语义平台?和知识图谱、传统数据中台的区别在哪
人工智能·知识图谱·数据中台·ai问数·本体语义平台·智能数据中台