李宏毅老师教学视频传送门
AI Agent (1/3):核心技術 Context Engineering 基本概念解說
https://www.youtube.com/watch?v=urwDLyNa9FU
AI Agent (2/3): AI Agent 之間可以有什麼樣的互動
https://www.youtube.com/watch?v=mmPmNezjCi0
Harness Engineering:有時候語言模型不是不夠聰明,只是沒有人類好好引導
https://www.youtube.com/watch?v=R6fZR_9kmIw\&t=5151s
AI Agent(1/3): 核心技术Context Engineering基本概念解说
概览
AI Agent
Context Engineering
压缩(摘要,Observation Masking,把部分输出存硬盘)
Memory
Context 分为 Prompt 和 Memory
训练做摘要的 LLM
何时做压缩?
Subagent 可以视为自主压缩
过滤
SKILL 按需加载
Agentic Context Engineering

输入是不断地文字接龙
问题:输入地长度是有限的

- AI Agent 决定语言模型看到什么
- AI Agent 帮语言模型管理输入,让输入长度是合适的这件事情叫做 Context Engineering

C 代表环境中发生的全部事情
左边 没有做Context Engineering 输入输出接到语言模型
右边 不是文字接龙,是做一个复杂的操作,F就是Context Engineering / AI Agent做的事情

操作F 的一件重要的事情是压缩
1)摘要
2)将长篇大论的工具输出替换成 "这里有一个工具输出"
轨迹延长(Trajectory elongation)现象的解释:做压缩上下文变短,但是有一些步骤不见了,于是重复执行已经做过的操作,没有节省token

压缩方式可以组合使用,比较好的策略是:前期用 Observation Masking 把工具输出换掉,但Context 最终会变长,这时候做摘要。

与其放一行文字不如把诸如工具输出结果放在硬盘里,如果需要就去读。


C分成两部分 P和M,两者经常混淆
P是会被丢进语言模型的信息
M 是不会被丢进语言模型,存在硬盘里的信息
Context 是AI Agent经历过的一切事情
Prompt 是输入语言模型的部分,即语言模型会看到的部分

用Enforcing learning的方法训练做摘要的LLM

做摘要的模型和做其它事情的比如产生执行工具指令的模型是同一个模型
所以不仅仅强化了做摘要的能力,也强化了语言模型解整个任务的能力,比如语言模型根据摘要来解任务的能力

压缩是在 Context超过一个上限强制执行的
Q: 为什么不让语言模型自己决定?
A: 语言模型不喜欢抹除记忆
如果要模型自己做压缩需要微调,压缩能力需要另外训练

spawn 繁殖
主 Agent 繁殖出一些 Subagent 执行任务

- 主干不能过长 -> 分裂subagent
- Subagent禁止分裂

一开始就不要让context过长,分析是什么样的信息让context过长
Observation: 来自外界的输入,比如语言模型读了一个档案
Reasoning: 语言模型自己说的话


Openclaw 的工具 memory_get 从哪行开始读,读几行


本来F是人类工程师设计的,现在交给LLM

图中的Context通常只是所有Context的一部分

和现在任务有具体关系的不存
AI Agent(2/3): AI Agent 之间可以有什么样的互动


不同的有向图,代表不同的协作方式

纵轴是quality 横轴是动用多少agent
之后还讲了AI能不能尔虞我诈,比如 AI 可以玩狼人杀、剧本杀
AI 可以社交等等
Harness Engineering:有时候语言模型不是不够聪明,只是没有人类好好引导
概览
Prompt -> Context -> Harness
人类通过一些手段来驾驭模型(认知框架、能力边界、行为)
Harness 需要根据语言模型设置
过度责备语言模型可能有害
Life-long AI Agent

Effective 2 Billion 的小模型

木有找到 parser.py(虽然就在同路径)重新写了一个 23333333


Harness 工程:在以代理為核心的世界利用 Codex 推動工程效率
https://openai.com/zh-Hant-HK/index/harness-engineering/
Harness design for long-running application development
https://www.anthropic.com/engineering/harness-design-long-running-apps

现在已经不用说 step by step 也会这样做

更多信息、更系统

多轮对话,驱动工具,驾驭互动

蓝字 手段,红字 控制的对象


Cowork 使用云端沙箱,只要挂载文件夹就要询问人类,更安全了




Claude Sonnet有上下文焦虑
Harness 需要根据语言模型设置

根据feedback改变语言模型的输出也可以认为是一种学习




人类不用 AI Agent 的时候,可以整理 Memory (有很多重复的内容)


有上限

能够自动更新语言模型的参数,可以提高上限

Verbalized feedback调整参数
横轴代表互动次数,实则为另一个语言模型假扮成人类进行互动
互动500次以内的关注重点:少用emoji
互动500~1000次的关注重点:不要拍马屁
互动1000~1500次的关注重点:要求模型讲话直接

没有feedback, AI 自己思考