强化学习学习笔记

1.关于agent

在之前一直听说强化学习里有agent和environment,在大模型的学习时也有基于langchain搭建智能体,一直没有搞清楚什么意思。

其实这两种都是agent,不过当大语言模型到来时的agent是llm based的。

2.强化学习、监督学习、无监督学习区别

如果只是对比监督学习和无监督学习,它们的区别是有无标签,机器学习的目的是学习数据中的某种模式,比如具有某些特征的是什么,比如四条腿的就不会是鸡,但是如果要机器来学习这些模式就需要带有标签的数据。

强化学习得到的反馈是只针对当前的行为,比如一个人在人生某个阶段采取了某个行动,世界给了他反馈,不管这个反馈是什么,他能明确的就是采取这样的行动,在怎样怎样的条件下会得到什么样的结果。他无法预知自己未做的选择有什么结果。

用比喻的做法来说就是监督学习有一个老师告诉你怎么做是最好的,哪怕你做错了 他也会告诉你。强化学习是你采取了一个行为,没有人告诉你是否别的更好,你只能自己摸索着看看这个情况怎么样,要做哪个还是不能确定。

3.强化学习的目标

如果说一个行动和一个状态有一个价值,长期来看有一个期望价值,但是actor是不知道的,他只能通过自己已知,已经采取过的行动去估计,比如做某件事情,十次有七次有收获,有三次无 刚好他采取的三次都有收获,他就认为目前为止这个行动收获的概率是100%。

相关推荐
一切皆是因缘际会11 小时前
AI低代码开发实战:轻量化部署与多场景落地
人工智能·深度学习·低代码·机器学习·ai·架构
EnCi Zheng11 小时前
09-斯坦福CS336作业 [特殊字符]
人工智能·pytorch·python·深度学习·神经网络
Hali_Botebie12 小时前
【量化】Post-training quantization for vision transformer.
人工智能·深度学习·transformer
郑寿昌13 小时前
SubQ颠覆Transformer:亚二次稀疏注意力革命
人工智能·深度学习·transformer
jay神13 小时前
基于YOLOv8的交通标志识别Web系统
前端·人工智能·深度学习·yolo·机器学习·毕业设计
名不经传的养虾人14 小时前
OpenAI GPT-Image-2.0 在线生图实测:$0.01/张,一组“南宋工笔画”看透模型差距
人工智能·深度学习·ai作画·nano banana 2·gpt-image-2
RSTJ_162515 小时前
PYTHON+AI LLM DAY FOURTY-NINE
人工智能·python·深度学习
Hali_Botebie15 小时前
【蒸馏】Tinybert:Distilling BERT for natural language understanding.
人工智能·深度学习·bert
nashane16 小时前
HarmonyOS 6学习:卡片组件圆角白边问题的诊断与修复实战
人工智能·pytorch·深度学习·harmonyos
Hali_Botebie16 小时前
【量化】Q-bert: Hessian based ultra low precision quantization of bert.
人工智能·深度学习·bert