如何学习agent

如何学习agent

不停的问AI,用vibecoding写一个代码agent的cli工具。

从写简单的agent loop开始,工具抽象skill加载和管理mcp加载和扩展上下文管理长期记忆管理(本地文件或者mem0)

plan and execute模式切换+任务列表管理,rag,审计和回滚,prompt防注入,prompt管理,可观测性OTEL+langfuse,可评估性(swe bench)一个个的往里面加

先不要考虑可观测性和可评估性,输出json本地化log用于debug就可以


关于skill

skill的本质是什么?

一段渐进式披露的prompt, context.

skill最原始的状态就是一段文本来告诉模型做事情的顺序。

一个Skill只能告诉模型先做什么,后做什么,但是,你要给它匹配相应的工具。比如说,我举个例子,你给龙虾配了一个工具,说每天早上起来给我搜索这么多的新闻,早上起来发个日报给我,但是你没有给他配brave的API,他就早上起来搜索不了。

所以,这是一个skill的问题吗?这不是skill的问题,这是skill加工具的问题。但是,为什么skill加工具不能解决所有的事情,是因为你真正要想让它稳定产出的时候,你需要有结构化数据,再强调一遍结构化数据,结构化数据 is everything,

所以skill只能做一定程度的编排和精细化的适配,所以真正好的skill 通常包含四部分,第一个的md文档,第二个是一个运行的脚本,第三个是它需要的工具链,第四个是它的验证机制,这才是一个完整的skill pack.

然后你在你的agent当中做一大堆相应的工具给到他,最后结尾的时候一定要有validation要验证,然后agent要写库要落库,这才是完整的。

其实,可以理解为skill里边儿所暴露出来的工程思维非常有价值,叫渐进披露,对不对?你如果把它拉的时间更长,不是一个MD文档,而是1万换个MD文档。它是在上下文关联的最紧密的时候给你披露那个最正确的部分,只不过你把它做成一个MD文档,它的相关性很容易被明确。

但是,如果你把它放大到规模更大的10倍、1万倍的这个水平上,它就是memory。因为Skill的逻辑就是说在最恰当的时间给你最正确的信息,只不过你把文档乘以1万个文档以后,不同的分类的文档了以后,在这么多的文档里面,如何去抓选那一两句最关键的信息,加载到跟当下对话最关联的内容和位置上。这才是最难的。


杨的访谈

杨反复强调,今天所有大模型都建立在同一个第一性原理上:Scaling Law,也就是把能源转化为智能的规律。

杨还专门提到,最早提出Scaling Law的那篇论文里,对比了Transformer和LSTM的区别,结论是Transformer在Scaling这条路上跑得更远。

所以,这三样东西最合理的推测就是:Transformer架构Scaling Law,以及将大语言模型变成产品的强化学习 / RLHF技术。

我们一样一样来看。

Transformer架构。这没什么争议,它出自 Google 2017 年的论文 "Attention Is All You Need"。

Scaling Law。这个就微妙了。杨自己引用的那篇对比Transformer和LSTM的Scaling Law论文,恰恰是OpenAI在2020年发布的。那篇论文可以说是Scaling Law的开山之作,它第一次系统性地揭示了模型参数、数据量和计算量之间的关系,越大越好。

杨自己也说,这是"整个技术发展的基础"。所以在这一块,OpenAI不仅有贡献,而且是奠基级别的贡献。

强化学习(RLHF)。这项技术的学术火种确实早就有了,但在大语言模型上把它真正做产品化、规模化的,OpenAI 的 InstructGPT 和 ChatGPT 功不可没。

可以说,没有 OpenAI 把 RLHF 跟超大规模语言模型粘在一起,就不会有后来 ChatGPT 那种像人一样对话的能力。RLHF 不是 OpenAI 凭空发明的,但把它做成大模型的标准配方,OpenAI 是核心推手

相关推荐
shxjnpl3 小时前
Qwen3-ForcedAligner-0.6B 私有化部署实战:从模型离线、Docker封装到会议原声精准回听
人工智能·语音识别·智能硬件
HZZD_HZZD3 小时前
分时电价_园区峰谷电费优化
大数据·人工智能·能源·制造
星辰AI3 小时前
前端性能优化实战:从首屏加载到交互响应的全链路调优
人工智能·ai·语言模型
Mr数据杨3 小时前
餐厅评分预测实战案例 从结构化特征到回归建模落地
人工智能·数据分析·kaggle竞赛
m0_587383004 小时前
折扣卡CPS系统源码的技术架构与实战开发指南
人工智能·小程序·数据挖掘·系统架构·需求分析
资讯综合4 小时前
河北被动防护网厂家哪家强 5个选型标准帮你选
人工智能
学Linux的语莫4 小时前
LangChain Prompts 提示词模板
数据库·人工智能·langchain
知几蜗牛4 小时前
Agent到底比一次大模型调用多了什么?小白从这张流程图看懂
人工智能
张彦峰ZYF4 小时前
Prefactor 从“看见 Agent”到“拦住 Agent”:实时评估如何重构 AI Agent 的生产可靠性
人工智能·llm·ai agent·evaluate·llm-as-a-judge·prefactor·金融agent
知几蜗牛4 小时前
语音AI开始边听边说,改变的不只是响应速度
人工智能