如何学习agent

如何学习agent

不停的问AI,用vibecoding写一个代码agent的cli工具。

从写简单的agent loop开始,工具抽象skill加载和管理mcp加载和扩展上下文管理长期记忆管理(本地文件或者mem0)

plan and execute模式切换+任务列表管理,rag,审计和回滚,prompt防注入,prompt管理,可观测性OTEL+langfuse,可评估性(swe bench)一个个的往里面加

先不要考虑可观测性和可评估性,输出json本地化log用于debug就可以


关于skill

skill的本质是什么?

一段渐进式披露的prompt, context.

skill最原始的状态就是一段文本来告诉模型做事情的顺序。

一个Skill只能告诉模型先做什么,后做什么,但是,你要给它匹配相应的工具。比如说,我举个例子,你给龙虾配了一个工具,说每天早上起来给我搜索这么多的新闻,早上起来发个日报给我,但是你没有给他配brave的API,他就早上起来搜索不了。

所以,这是一个skill的问题吗?这不是skill的问题,这是skill加工具的问题。但是,为什么skill加工具不能解决所有的事情,是因为你真正要想让它稳定产出的时候,你需要有结构化数据,再强调一遍结构化数据,结构化数据 is everything,

所以skill只能做一定程度的编排和精细化的适配,所以真正好的skill 通常包含四部分,第一个的md文档,第二个是一个运行的脚本,第三个是它需要的工具链,第四个是它的验证机制,这才是一个完整的skill pack.

然后你在你的agent当中做一大堆相应的工具给到他,最后结尾的时候一定要有validation要验证,然后agent要写库要落库,这才是完整的。

其实,可以理解为skill里边儿所暴露出来的工程思维非常有价值,叫渐进披露,对不对?你如果把它拉的时间更长,不是一个MD文档,而是1万换个MD文档。它是在上下文关联的最紧密的时候给你披露那个最正确的部分,只不过你把它做成一个MD文档,它的相关性很容易被明确。

但是,如果你把它放大到规模更大的10倍、1万倍的这个水平上,它就是memory。因为Skill的逻辑就是说在最恰当的时间给你最正确的信息,只不过你把文档乘以1万个文档以后,不同的分类的文档了以后,在这么多的文档里面,如何去抓选那一两句最关键的信息,加载到跟当下对话最关联的内容和位置上。这才是最难的。


杨的访谈

杨反复强调,今天所有大模型都建立在同一个第一性原理上:Scaling Law,也就是把能源转化为智能的规律。

杨还专门提到,最早提出Scaling Law的那篇论文里,对比了Transformer和LSTM的区别,结论是Transformer在Scaling这条路上跑得更远。

所以,这三样东西最合理的推测就是:Transformer架构Scaling Law,以及将大语言模型变成产品的强化学习 / RLHF技术。

我们一样一样来看。

Transformer架构。这没什么争议,它出自 Google 2017 年的论文 "Attention Is All You Need"。

Scaling Law。这个就微妙了。杨自己引用的那篇对比Transformer和LSTM的Scaling Law论文,恰恰是OpenAI在2020年发布的。那篇论文可以说是Scaling Law的开山之作,它第一次系统性地揭示了模型参数、数据量和计算量之间的关系,越大越好。

杨自己也说,这是"整个技术发展的基础"。所以在这一块,OpenAI不仅有贡献,而且是奠基级别的贡献。

强化学习(RLHF)。这项技术的学术火种确实早就有了,但在大语言模型上把它真正做产品化、规模化的,OpenAI 的 InstructGPT 和 ChatGPT 功不可没。

可以说,没有 OpenAI 把 RLHF 跟超大规模语言模型粘在一起,就不会有后来 ChatGPT 那种像人一样对话的能力。RLHF 不是 OpenAI 凭空发明的,但把它做成大模型的标准配方,OpenAI 是核心推手

相关推荐
不灭的程序员阿澄8 分钟前
把多个 AI 网站装进一个常驻托盘的桌面窗口里,像切换原生 App 一样切换 AI
人工智能·chatgpt
长谷深风11110 分钟前
AI Tool 设计:粒度、参数与错误恢复怎么做
java·大数据·人工智能·ai agent·agent工作流·智能体设计·ai产品设计
张彦峰ZYF20 分钟前
从“打分模型”到“审计智能体”:Agent-as-a-Judge如何重构复杂AI系统的评测范式
人工智能·agent-as-judge·llm-as-a-judge·agentevaluation·deepswe·verifier·agentic search
peijiping22 分钟前
AI多智能体解惑:父子子智能体 vs 团队智能体,为什么主流IDE默认只用前者?
人工智能·ai agent·claude code
aiqianji29 分钟前
教AI短篇小说写作的软件操作简单,该怎么挑选呢?
人工智能·python
Yoyo Chen18039 分钟前
DeepSeek发布多模态模型deepseek-v4-flash-vision-exp:视觉能力正式接入Agent工作流
人工智能·深度学习·microsoft
海兰41 分钟前
【插件】OpenClaw 上下文引擎指南
人工智能·agent·openclaw
Rocky Ding*42 分钟前
【三年面试五年模拟】2026-08-18_哔哩哔哩AI应用岗Agent开发一面面经全解析(含完整答案)
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·ai agent
geneculture1 小时前
基于融智学框架的领军人才实训实操示范基地建设: 课题、课程与项目的系统工程(人机三双协同即人机双脑双智双语协同)
人工智能·融智学的重要应用·哲学与科学统一性·融智时代(杂志)·序位逻辑的实例化·人机三双协同
key_3_feng1 小时前
智能体 Loop 工程:循环架构与状态机
人工智能·loop·智能体