如何学习agent
不停的问AI,用vibecoding写一个代码agent的cli工具。
从写简单的agent loop开始,工具抽象,skill加载和管理,mcp加载和扩展,上下文管理,长期记忆管理(本地文件或者mem0)
plan and execute模式切换+任务列表管理,rag,审计和回滚,prompt防注入,prompt管理,可观测性OTEL+langfuse,可评估性(swe bench)一个个的往里面加
先不要考虑可观测性和可评估性,输出json本地化log用于debug就可以
关于skill
skill的本质是什么?
一段渐进式披露的prompt, context.
skill最原始的状态就是一段文本来告诉模型做事情的顺序。
一个Skill只能告诉模型先做什么,后做什么,但是,你要给它匹配相应的工具。比如说,我举个例子,你给龙虾配了一个工具,说每天早上起来给我搜索这么多的新闻,早上起来发个日报给我,但是你没有给他配brave的API,他就早上起来搜索不了。
所以,这是一个skill的问题吗?这不是skill的问题,这是skill加工具的问题。但是,为什么skill加工具不能解决所有的事情,是因为你真正要想让它稳定产出的时候,你需要有结构化数据,再强调一遍结构化数据,结构化数据 is everything,
所以skill只能做一定程度的编排和精细化的适配,所以真正好的skill 通常包含四部分,第一个的md文档,第二个是一个运行的脚本,第三个是它需要的工具链,第四个是它的验证机制,这才是一个完整的skill pack.
然后你在你的agent当中做一大堆相应的工具给到他,最后结尾的时候一定要有validation要验证,然后agent要写库要落库,这才是完整的。
其实,可以理解为skill里边儿所暴露出来的工程思维非常有价值,叫渐进披露,对不对?你如果把它拉的时间更长,不是一个MD文档,而是1万换个MD文档。它是在上下文关联的最紧密的时候给你披露那个最正确的部分,只不过你把它做成一个MD文档,它的相关性很容易被明确。
但是,如果你把它放大到规模更大的10倍、1万倍的这个水平上,它就是memory。因为Skill的逻辑就是说在最恰当的时间给你最正确的信息,只不过你把文档乘以1万个文档以后,不同的分类的文档了以后,在这么多的文档里面,如何去抓选那一两句最关键的信息,加载到跟当下对话最关联的内容和位置上。这才是最难的。
杨的访谈
杨反复强调,今天所有大模型都建立在同一个第一性原理上:Scaling Law,也就是把能源转化为智能的规律。
杨还专门提到,最早提出Scaling Law的那篇论文里,对比了Transformer和LSTM的区别,结论是Transformer在Scaling这条路上跑得更远。
所以,这三样东西最合理的推测就是:Transformer架构、Scaling Law,以及将大语言模型变成产品的强化学习 / RLHF技术。
我们一样一样来看。
Transformer架构。这没什么争议,它出自 Google 2017 年的论文 "Attention Is All You Need"。
Scaling Law。这个就微妙了。杨自己引用的那篇对比Transformer和LSTM的Scaling Law论文,恰恰是OpenAI在2020年发布的。那篇论文可以说是Scaling Law的开山之作,它第一次系统性地揭示了模型参数、数据量和计算量之间的关系,越大越好。
杨自己也说,这是"整个技术发展的基础"。所以在这一块,OpenAI不仅有贡献,而且是奠基级别的贡献。
强化学习(RLHF)。这项技术的学术火种确实早就有了,但在大语言模型上把它真正做产品化、规模化的,OpenAI 的 InstructGPT 和 ChatGPT 功不可没。
可以说,没有 OpenAI 把 RLHF 跟超大规模语言模型粘在一起,就不会有后来 ChatGPT 那种像人一样对话的能力。RLHF 不是 OpenAI 凭空发明的,但把它做成大模型的标准配方,OpenAI 是核心推手