如何学习agent

如何学习agent

不停的问AI,用vibecoding写一个代码agent的cli工具。

从写简单的agent loop开始,工具抽象,skill加载和管理,mcp加载和扩展,上下文管理,长期记忆管理(本地文件或者mem0)

plan and execute模式切换+任务列表管理,rag,审计和回滚,prompt防注入,prompt管理,可观测性OTEL+langfuse,可评估性(swe bench)一个个的往里面加

先不要考虑可观测性和可评估性,输出json本地化log用于debug就可以


关于skill

skill的本质是什么?

一段渐进式披露的prompt, context.

skill最原始的状态就是一段文本来告诉模型做事情的顺序。

一个Skill只能告诉模型先做什么,后做什么,但是,你要给它匹配相应的工具。比如说,我举个例子,你给龙虾配了一个工具,说每天早上起来给我搜索这么多的新闻,早上起来发个日报给我,但是你没有给他配brave的API,他就早上起来搜索不了。

所以,这是一个skill的问题吗?这不是skill的问题,这是skill加工具的问题。但是,为什么skill加工具不能解决所有的事情,是因为你真正要想让它稳定产出的时候,你需要有结构化数据,再强调一遍结构化数据,结构化数据 is everything,

所以skill只能做一定程度的编排和精细化的适配,所以真正好的skill 通常包含四部分,第一个的md文档,第二个是一个运行的脚本,第三个是它需要的工具链,第四个是它的验证机制,这才是一个完整的skill pack.

然后你在你的agent当中做一大堆相应的工具给到他,最后结尾的时候一定要有validation要验证,然后agent要写库要落库,这才是完整的。

其实,可以理解为skill里边儿所暴露出来的工程思维非常有价值,叫渐进披露,对不对?你如果把它拉的时间更长,不是一个MD文档,而是1万换个MD文档。它是在上下文关联的最紧密的时候给你披露那个最正确的部分,只不过你把它做成一个MD文档,它的相关性很容易被明确。

但是,如果你把它放大到规模更大的10倍、1万倍的这个水平上,它就是memory。因为Skill的逻辑就是说在最恰当的时间给你最正确的信息,只不过你把文档乘以1万个文档以后,不同的分类的文档了以后,在这么多的文档里面,如何去抓选那一两句最关键的信息,加载到跟当下对话最关联的内容和位置上。这才是最难的。


杨的访谈

杨反复强调,今天所有大模型都建立在同一个第一性原理上:Scaling Law,也就是把能源转化为智能的规律。

杨还专门提到,最早提出Scaling Law的那篇论文里,对比了Transformer和LSTM的区别,结论是Transformer在Scaling这条路上跑得更远。

所以,这三样东西最合理的推测就是:Transformer架构、Scaling Law,以及将大语言模型变成产品的强化学习 / RLHF技术。

我们一样一样来看。

Transformer架构。这没什么争议,它出自 Google 2017 年的论文 "Attention Is All You Need"。

Scaling Law。这个就微妙了。杨自己引用的那篇对比Transformer和LSTM的Scaling Law论文,恰恰是OpenAI在2020年发布的。那篇论文可以说是Scaling Law的开山之作,它第一次系统性地揭示了模型参数、数据量和计算量之间的关系,越大越好。

杨自己也说,这是"整个技术发展的基础"。所以在这一块,OpenAI不仅有贡献,而且是奠基级别的贡献。

强化学习(RLHF)。这项技术的学术火种确实早就有了,但在大语言模型上把它真正做产品化、规模化的,OpenAI 的 InstructGPT 和 ChatGPT 功不可没。

可以说,没有 OpenAI 把 RLHF 跟超大规模语言模型粘在一起,就不会有后来 ChatGPT 那种像人一样对话的能力。RLHF 不是 OpenAI 凭空发明的,但把它做成大模型的标准配方,OpenAI 是核心推手

相关推荐
deepseek238 小时前
GPT-Synopsys 拆解:从调用 EDA 工具到成为专家用户,芯片设计 Agent 闭环的分工与红线
人工智能·openai·芯片设计
bigdata-余建新8 小时前
week2
人工智能·pytorch·深度学习
yangmu32038 小时前
Codex 提示词优化教程:用四要素把模糊需求变成可执行任务
人工智能·学习
海盗12348 小时前
AI 新闻日报 2026-10-01:OpenAI 把 ChatGPT 变成智能体平台,VS Code 上线多模型编排,国产算力补到内核层
人工智能·chatgpt·机器人·人工智能aigc
龙亘川9 小时前
数字化赋能基层协同治理:亘川智城一网统管平台落地实践思考
大数据·人工智能·智慧城市·开源软件·数据可视化
坏小虎9 小时前
Codex 中的 Current checkout 和 New worktree 怎么选?
人工智能
陈天伟教授9 小时前
DeepSeek Harness 生态里的学术写作插件
人工智能·自然语言处理
浪子明X9 小时前
注意力不是全连接层换名字:多头自注意力的张量实验
人工智能
打工仔折腾 AI9 小时前
从Attention到BERT:双向预训练语言模型到底解决了什么问题
人工智能·后端·python·深度学习·语言模型·bert
正经教主9 小时前
【FDE系列】阶段3:Day 56:评测体系入门 — 建立你的黄金评测集
人工智能·fde