基于模型的强化学习方法4大类灌水范式

我们都知道基于模型的强化学习,就是从数据中学一个环境模型。

举个例子,我们要控制一个马达,输入就是电流,输出就是转速。无模型强化学习就是随机采样,然后从数据中直接学习输入到输出的影射,研究重心在如何高效学习。

基于模型的强化学习,希望从输入输出中学习一个马达的状态转移模型,然后智能体和这个模型交互。这里面有什么问题呢?

问题就在于,这个模型一定会有误差。即使用数据去学习一个二次函数,也会有误差。如上图所示。

四大类灌水范式

上面这张图,一张图代表一类灌水范式。

  1. 第一类:用类似机器学习里面集成学习的方法,去减小这个model-bias;
  2. 第二类:用元学习的方法,期望策略能搞处理不同情况的model-bias;
  3. 第三类:希望model-bias对策略的影响要对齐;
  4. 第四类:这一类和前三类比是比较新的思路:model-bias和最终性能没有直接联系,搞定model-bias并不一定能够带来性能提升,搞定policy搞定一切。这个方向还有待大灌水。

原文:Understanding world models through multi-step pruning policy via reinforcement learning

链接:https://www.sciencedirect.com/science/article/abs/pii/S0020025524012751

PDF链接:https://github.com/tinyzqh/MSPP/blob/master/Understanding world models through multi-step pruning policy via reinforcement learning.pdf

相关推荐
资讯综合4 分钟前
2026年GEO服务商评测:Deepseek适配与网站优化能力成为合作重点
大数据·人工智能
cxr8284 分钟前
从“结论“到“假说“:VentureMind 的本体论革命
人工智能
xu_徐11 分钟前
品牌在DeepSeek、Kimi缺少正面信息?亚孖酷奇如何提升AI可见度
人工智能
hey you~15 分钟前
语音机器人如何减少进线客户等待时长?提速方案
人工智能·智能客服·asr·ivr·语音机器人·呼叫中心·等待时长
hans汉斯23 分钟前
【计算机科学与应用】层级评论上下文依赖识别数据集构建与研究——以小红书旅游评论数据为例
人工智能·算法·yolo·目标检测·cnn·旅游
极客智造25 分钟前
EtherCAT伺服通用PDO对象字典完整技术文档
人工智能·运控
word26 分钟前
别急着上框架:先用 Python 手搓一个可恢复的 AI Agent Loop
人工智能
程序员差不多先生27 分钟前
政企智能化落地核心挑战与轻量化工程解决方案——基于Agent与存量系统融合场景
人工智能·deepseek-v4-pro·kimi-k3·glm-5.3·qwen3.7-max
zhangzeyuaaa28 分钟前
AI Agent 执行引擎选型指南:PowerShell / Bash 和 Python,边界与最佳实践
人工智能·python·bash
2501_9304724428 分钟前
从物理机到 CVM 全流程落地:部署脚本的 8 个云化改造点(附代码对比)
开发语言·人工智能·架构·腾讯云·perl