草稿纸1106

我继续在学习《ML Lecture 23-1: Deep Reinforcement Learning by Hung-yi Lee》中的视频教程https://youtu.be/W8XF3ME8G2I?si=zEQ3qj_iXzZZ-n85,其中提到:

"""
Gradient Ascent θ new ← θ old + η ∇ R ˉ θ old = ∑ t = 1 T ∇ log ⁡ p ( a t ∣ s t , θ ) ∇ R ˉ θ ≈ 1 N ∑ n = 1 N R ( τ n ) ∇ log ⁡ P ( τ n ∣ θ ) = 1 N ∑ n = 1 N R ( τ n ) ∑ t = 1 T n ∇ log ⁡ p ( a t n ∣ s t n , θ ) = 1 N ∑ n = 1 N ∑ t = 1 T n R ( τ o n ) ∇ log ⁡ ‾ p ( a t n ∣ s t n , θ ) \begin{aligned} & \begin{array}{l} \text { Gradient Ascent } \\ \theta^{\text {new }} \leftarrow \theta^{\text {old }}+\eta \nabla \bar{R}{\theta^{\text {old }}} \end{array} \quad=\sum{t=1}^T \nabla \log p\left(a_t \mid s_t, \theta\right) \\ & \nabla \bar{R}\theta \approx \frac{1}{N} \sum{n=1}^N R\left(\tau^n\right) \nabla \log P\left(\tau^n \mid \theta\right)=\frac{1}{N} \sum_{n=1}^N R\left(\tau^n\right) \sum_{t=1}^{T_n} \nabla \log p\left(a_t^n \mid s_t^n, \theta\right) \\ & =\frac{1}{N} \sum_{n=1}^N \sum_{t=1}^{T_n} R\left(\tau_o^n\right) \nabla \underline{\log } p\left(a_t^n \mid s_t^n, \theta\right) \\ & \end{aligned} Gradient Ascent θnew ←θold +η∇Rˉθold =t=1∑T∇logp(at∣st,θ)∇Rˉθ≈N1n=1∑NR(τn)∇logP(τn∣θ)=N1n=1∑NR(τn)t=1∑Tn∇logp(atn∣stn,θ)=N1n=1∑Nt=1∑TnR(τon)∇logp(atn∣stn,θ)

"""

"这里的 Gradient Ascent 的微分是很符合人类直觉的, R ( τ n ) R\left(\tau^n\right) R(τn)为正则会提升获得此次胜利的过程中采取的每一次动作的概率;而 R ( τ n ) R\left(\tau^n\right) R(τn)为负,则会降低这些动作出现的概率",请问,这种说法正确吗

相关推荐
真理Eternal1 小时前
手搓人工智能—聚类分析(下)谱系聚类与K-mean聚类
人工智能·机器学习
xiangxiang-3 小时前
目标检测,图像分割,超分辨率重建
算法·机器学习·支持向量机
cdut_suye3 小时前
C++11新特性探索:Lambda表达式与函数包装器的实用指南
开发语言·数据库·c++·人工智能·python·机器学习·华为
奔跑的犀牛先生4 小时前
【小白学机器学习36】关于独立概率,联合概率,交叉概率,交叉概率和,总概率等 概念辨析的例子
人工智能·机器学习·概率论
无水先生5 小时前
ML 系列:第 36 节 — 统计学中的抽样类型
人工智能·机器学习·概率论
PaLu-LI6 小时前
ORB-SLAM2源码学习:Initializer.cc:Initializer::CheckFundamental地图初始化——检查基础矩阵F并评分
c++·opencv·学习·线性代数·ubuntu·计算机视觉·矩阵
大大大反派7 小时前
深入了解决策树---机器学习中的经典算法
算法·决策树·机器学习
数据猎手小k7 小时前
FineTuneBench:由斯坦福大学创建,包含625个训练问题和1075个测试问题,覆盖4个领域。目的评估商业微调API在不同泛化任务中的知识注入能力。
人工智能·深度学习·机器学习·数据集·机器学习数据集·ai大模型应用
傻瓜学习7 小时前
机器学习知识点
人工智能·机器学习
IT古董14 小时前
【机器学习】如何使用Python的Scikit-learn库实现机器学习模型,并对数据进行预处理和特征缩放以提高模型性能?
python·机器学习·scikit-learn