AI Agent & Harness Engineering 笔记

李宏毅老师教学视频传送门

AI Agent (1/3):核心技術 Context Engineering 基本概念解說

https://www.youtube.com/watch?v=urwDLyNa9FU

AI Agent (2/3): AI Agent 之間可以有什麼樣的互動

https://www.youtube.com/watch?v=mmPmNezjCi0

Harness Engineering:有時候語言模型不是不夠聰明,只是沒有人類好好引導

https://www.youtube.com/watch?v=R6fZR_9kmIw\&t=5151s

AI Agent(1/3): 核心技术Context Engineering基本概念解说

概览

AI Agent

Context Engineering

压缩(摘要,Observation Masking,把部分输出存硬盘)

Memory

Context 分为 Prompt 和 Memory

训练做摘要的 LLM

何时做压缩?

Subagent 可以视为自主压缩

过滤

SKILL 按需加载

Agentic Context Engineering

输入是不断地文字接龙

问题:输入地长度是有限的

  1. AI Agent 决定语言模型看到什么
  2. AI Agent 帮语言模型管理输入,让输入长度是合适的这件事情叫做 Context Engineering

C 代表环境中发生的全部事情

左边 没有做Context Engineering 输入输出接到语言模型

右边 不是文字接龙,是做一个复杂的操作,F就是Context Engineering / AI Agent做的事情

操作F 的一件重要的事情是压缩

1)摘要

2)将长篇大论的工具输出替换成 "这里有一个工具输出"

轨迹延长(Trajectory elongation)现象的解释:做压缩上下文变短,但是有一些步骤不见了,于是重复执行已经做过的操作,没有节省token

压缩方式可以组合使用,比较好的策略是:前期用 Observation Masking 把工具输出换掉,但Context 最终会变长,这时候做摘要。

与其放一行文字不如把诸如工具输出结果放在硬盘里,如果需要就去读。

C分成两部分 P和M,两者经常混淆

P是会被丢进语言模型的信息

M 是不会被丢进语言模型,存在硬盘里的信息

Context 是AI Agent经历过的一切事情

Prompt 是输入语言模型的部分,即语言模型会看到的部分

用Enforcing learning的方法训练做摘要的LLM

做摘要的模型和做其它事情的比如产生执行工具指令的模型是同一个模型

所以不仅仅强化了做摘要的能力,也强化了语言模型解整个任务的能力,比如语言模型根据摘要来解任务的能力

压缩是在 Context超过一个上限强制执行的

Q: 为什么不让语言模型自己决定?

A: 语言模型不喜欢抹除记忆

如果要模型自己做压缩需要微调,压缩能力需要另外训练

spawn 繁殖

主 Agent 繁殖出一些 Subagent 执行任务

  1. 主干不能过长 -> 分裂subagent
  2. Subagent禁止分裂

一开始就不要让context过长,分析是什么样的信息让context过长

Observation: 来自外界的输入,比如语言模型读了一个档案

Reasoning: 语言模型自己说的话

Openclaw 的工具 memory_get 从哪行开始读,读几行

本来F是人类工程师设计的,现在交给LLM

图中的Context通常只是所有Context的一部分

和现在任务有具体关系的不存

AI Agent(2/3): AI Agent 之间可以有什么样的互动

不同的有向图,代表不同的协作方式

纵轴是quality 横轴是动用多少agent

之后还讲了AI能不能尔虞我诈,比如 AI 可以玩狼人杀、剧本杀

AI 可以社交等等

Harness Engineering:有时候语言模型不是不够聪明,只是没有人类好好引导

概览

Prompt -> Context -> Harness

人类通过一些手段来驾驭模型(认知框架、能力边界、行为)

Harness 需要根据语言模型设置

过度责备语言模型可能有害

Life-long AI Agent

Effective 2 Billion 的小模型

木有找到 parser.py(虽然就在同路径)重新写了一个 23333333

Harness 工程:在以代理為核心的世界利用 Codex 推動工程效率

https://openai.com/zh-Hant-HK/index/harness-engineering/

Harness design for long-running application development

https://www.anthropic.com/engineering/harness-design-long-running-apps

现在已经不用说 step by step 也会这样做

更多信息、更系统

多轮对话,驱动工具,驾驭互动

蓝字 手段,红字 控制的对象

Cowork 使用云端沙箱,只要挂载文件夹就要询问人类,更安全了

Claude Sonnet有上下文焦虑

Harness 需要根据语言模型设置

根据feedback改变语言模型的输出也可以认为是一种学习

人类不用 AI Agent 的时候,可以整理 Memory (有很多重复的内容)

有上限

能够自动更新语言模型的参数,可以提高上限

Verbalized feedback调整参数

横轴代表互动次数,实则为另一个语言模型假扮成人类进行互动

互动500次以内的关注重点:少用emoji

互动500~1000次的关注重点:不要拍马屁

互动1000~1500次的关注重点:要求模型讲话直接

没有feedback, AI 自己思考

相关推荐
回眸&啤酒鸭6 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智6 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅6 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein6 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
LaughingZhu6 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台6 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb6 天前
智能网联汽车安全能力框架
人工智能
龙亘川6 天前
明月照湾区,智启新赛道:从顶流文旅IP盛会看智慧文旅升级路径
人工智能·智慧城市·开源软件·数据可视化
飞猫的边缘AI6 天前
边缘AI应用:家用AI摄像头怎么做数据训练?
人工智能·边缘计算·ai算法·边缘ai