强化学习学习笔记

1.关于agent

在之前一直听说强化学习里有agent和environment,在大模型的学习时也有基于langchain搭建智能体,一直没有搞清楚什么意思。

其实这两种都是agent,不过当大语言模型到来时的agent是llm based的。

2.强化学习、监督学习、无监督学习区别

如果只是对比监督学习和无监督学习,它们的区别是有无标签,机器学习的目的是学习数据中的某种模式,比如具有某些特征的是什么,比如四条腿的就不会是鸡,但是如果要机器来学习这些模式就需要带有标签的数据。

强化学习得到的反馈是只针对当前的行为,比如一个人在人生某个阶段采取了某个行动,世界给了他反馈,不管这个反馈是什么,他能明确的就是采取这样的行动,在怎样怎样的条件下会得到什么样的结果。他无法预知自己未做的选择有什么结果。

用比喻的做法来说就是监督学习有一个老师告诉你怎么做是最好的,哪怕你做错了 他也会告诉你。强化学习是你采取了一个行为,没有人告诉你是否别的更好,你只能自己摸索着看看这个情况怎么样,要做哪个还是不能确定。

3.强化学习的目标

如果说一个行动和一个状态有一个价值,长期来看有一个期望价值,但是actor是不知道的,他只能通过自己已知,已经采取过的行动去估计,比如做某件事情,十次有七次有收获,有三次无 刚好他采取的三次都有收获,他就认为目前为止这个行动收获的概率是100%。

相关推荐
Joshua-a3 小时前
工程数学-理解卷积的含义_线性时不变系统的冲激响应与卷积
人工智能·深度学习
song5013 小时前
React Native for OpenHarmony 实战:三方库 react-native-css-transformer 的鸿蒙化适配指南
css·人工智能·深度学习·react native·transformer
数智工坊12 小时前
视觉SLAM第12讲|地图构建:单目稠密重建、RGB-D点云与八叉树地图全解析
人工智能·深度学习·矩阵·机器人
GPU实战笔记12 小时前
云端 GPU 训练的账户余额提醒:它能说明什么,不能说明什么?
深度学习·算法·成本管理·gpu云计算·云端训练
论文复现现场14 小时前
8卡4090能跑70B吗?Llama-2显存预算、QLoRA与通信瓶颈
人工智能·深度学习·分布式训练·llama·显存·qlora·算家云
用户159706376014 小时前
一文读懂淘宝店铺在售商品接口:整店商品批量拉取用于竞品研究
深度学习
布吉岛的石头15 小时前
Java 程序员第 49 阶段11:Java 接 BERT:用 ONNX Runtime 做句向量推理
java·人工智能·python·深度学习·bert·transformer
liron7116 小时前
技术的诞生与演化--技术自举及其冷启动
人工智能·深度学习·神经网络·自然语言处理
喜欢打篮球的普通人17 小时前
MiniMind 学习笔记(十八):速通强化学习——从 MDP 到 PPO 的概念与算法地图
笔记·深度学习·学习
`流年づ18 小时前
VGG、AlexNet、GoogLeNet对比
人工智能·深度学习