Q 值与状态值

在强化学习里,状态 - 动作值 一般指 Q 值(Q-value) ,全称是 状态 - 动作价值函数(State-Action Value Function),记作:

Q(s,a)


1. 直观含义

  • s:当前状态
  • a:在这个状态下采取的动作

Q(s,a) 表示:

状态 s 下,选择动作 a 之后,未来能获得的累积期望回报

简单说:

在这个状态下,做这个动作到底有多 "值"。


2. 与状态价值函数 V (s) 的区别

  • 状态价值 V(s):只看状态,不看动作

    表示 "在状态 s 下,我接下来按策略走,总体有多好"。

    V (s) 由 Q (s,a) 平均而来

    在策略 πππ 下:

    Vπ(s)=Ea∼π(⋅∣s)Qπ(s,a)=∑a∈Aπ(a∣s)Qπ(s,a)V_π(s)=\mathbb E_{a∼π(⋅∣s)}Q_π(s,a)=\sum_{a\in\mathcal{A}}\pi(a|s)Q_π(s,a)Vπ(s)=Ea∼π(⋅∣s)Qπ(s,a)=∑a∈Aπ(a∣s)Qπ(s,a)(这就是书上2.16式)

    即:

    状态价值 = 该状态下所有动作的 Q 值按策略概率加权平均

    在状态 s,策略会以不同概率选不同动作,

    V (s) 就是这些动作 Q 值的平均。

    作用:

    • 评价当前状态好坏

    • 做策略评估(policy evaluation)

    • 辅助计算优势函数 A (s,a) = Q (s,a) - V (s)

  • 状态 - 动作价值 Q(s,a):同时看状态 + 动作

    表示 "在状态 s 下,选动作 a 这件事本身有多好"。

    Q (s,a) 由 V (s') 递推而来

    Qπ(s,a)=Er+γVπ(s′)=∑r∈Rp(r∣s,a)r+γ∑s′∈Sp(s′∣s,a)vπ(s′)Q_π(s,a)=\mathbb Er+γV_π(s′)=\sum_{r\in\mathcal{R}}p(r|s,a)r+γ\sum_{s'\in\mathcal{S}}p(s'|s,a)v_\pi(s')Qπ(s,a)=Er+γVπ(s′)=∑r∈Rp(r∣s,a)r+γ∑s′∈Sp(s′∣s,a)vπ(s′)(这就是书上2.17式,书上更严谨)

    即:

    动作价值 = 即时奖励 + 下一状态的状态价值(折扣后)

    状态 - 动作值 Q(s,a) 就是:在当前状态下,选这个动作的长期收益打分。

    作用:

    • 直接选动作

      选 Q 值最大的动作就是最优策略

    • Q-learning、DQN、Sarsa 核心都是学 Q

    • 是强化学习中最常用、最实用的价值


3. 贝尔曼方程(核心公式)

状态 - 动作值满足递归关系:

Q(s,a)=Er+γmax⁡a′Q(s′,a′)Q(s,a)=\mathbb Er+γ\\max_{a′}Q(s′,a′)Q(s,a)=Er+γmaxa′Q(s′,a′)

含义:

  • 立刻得到奖励 r
  • 加上折扣后的下一状态最优动作价值 γmaxQ(s′,a′)

贝尔曼方程:某个价值 = 即时奖励 + 折扣 × 下一个价值

对比项 V(s) 的贝尔曼方程 Q(s,a) 的贝尔曼方程
左边主体 状态 s(还没选动作) 状态 - 动作对 (s,a)(已经选了动作 a)
期望 E 的对象 动作 a下一状态 s′ 双重期望 只对下一状态 s′ 单重期望
动作 a 的角色 随机变量(由策略 π 决定) 确定值(已知、固定)
物理意义 状态 s 的平均未来价值 状态 s 下,选动作 a 这个具体选择的未来价值
与策略的关系 依赖策略 π(选动作的方式) 依赖策略 π(用于计算 V(s′)),但动作 a 独立于策略
相关推荐
lhjcsubupt3 小时前
第二十二篇 从随机过程到IMU噪声模型
算法·机器学习·概率论
2301_7644413315 小时前
主流手机pc品牌的端侧模型部署梳理
人工智能·windows·机器学习·智能手机·产品运营
硅谷秋水16 小时前
HumanEgo:基于人类第一人称视角数分钟视频的零样本机器人学习
人工智能·机器学习·计算机视觉·机器人
湘美书院--湘美谈教育18 小时前
湘美谈教育AI系列经验集锦:赋能整理聊斋志异大寓言
大数据·人工智能·深度学习·神经网络·机器学习
大模型最新论文速读20 小时前
小红书提出 RedKnot:分头处理 kv 缓存,延时降低 60%效果还提升
论文阅读·人工智能·深度学习·机器学习·缓存·自然语言处理
一楼的猫21 小时前
茄子写作助手——品牌搜索突破9万后的技术型品牌认知与官网入口指南
人工智能·学习·机器学习·chatgpt·ai写作
苏州邦恩精密1 天前
江苏三维扫描仪厂家如何选择合适的工业测量方案?
人工智能·科技·机器学习·3d·自动化·制造
叫我:松哥1 天前
基于深度卷积神经网络的水果图片分类算法设计与实现,有ResNet50的迁移学习模型,准确率达95%
人工智能·python·神经网络·机器学习·分类·cnn·迁移学习