强化学习原理(二)

一、贝尔曼最优公式(BOE)

Motivating examples:

贝尔曼最优公式:

贝尔曼最优公式(矩阵向量形式):

求解贝尔曼最优公式:

贝尔曼公式求解以及最优性:

**Fixed point:**f(x) = x

Contraction mapping:

Contraction mapping Theorem:

二、值迭代与策略迭代

值迭代算法:

① Policy update

② Value update

策略迭代算法:

① policy evaluation:

② policy improvement:

相关推荐
数智前线15 分钟前
AI Coding,正在把存储推向前台
人工智能
唠点键盘之外的5 小时前
15 微调 vs RAG:到底怎么选
人工智能·机器学习·面试·aigc
具身AGI6 小时前
人机协同预训练:三条路线,一条拉开差距
人工智能
东风破_6 小时前
LangSmith:从链路追踪到 RAG 自动化评估
人工智能
东方芷兰6 小时前
Agent 技术摘要 04 —— AI4S、VLM、VLA、VLN、WM、AI Infra
人工智能
catchadmin6 小时前
用 Jev 与 Laravel AI SDK 检测垃圾邮件和自动回复
数据库·人工智能·laravel
一 铭7 小时前
Pi实战 05:本地模型 · MCP · 安全沙箱篇
人工智能·ai·agent·harness
硅谷秋水7 小时前
EmbodiedMemory-Bench:面向长时程具身任务的具身记忆基准测试
机器学习·语言模型·机器人
198******126347 小时前
2026企业AI办公工具选型指南:从评估框架到场景适配
大数据·运维·人工智能
OxYGC7 小时前
[AI工程]Jev 决策模型第二篇:三原语、一次多问与置信度路由,从 Playground 到能上线的代码
人工智能