AI Agent & Harness Engineering 笔记

李宏毅老师教学视频传送门

AI Agent (1/3):核心技術 Context Engineering 基本概念解說

https://www.youtube.com/watch?v=urwDLyNa9FU

AI Agent (2/3): AI Agent 之間可以有什麼樣的互動

https://www.youtube.com/watch?v=mmPmNezjCi0

Harness Engineering:有時候語言模型不是不夠聰明,只是沒有人類好好引導

https://www.youtube.com/watch?v=R6fZR_9kmIw\&t=5151s

AI Agent(1/3): 核心技术Context Engineering基本概念解说

概览

AI Agent

Context Engineering

压缩(摘要,Observation Masking,把部分输出存硬盘)

Memory

Context 分为 Prompt 和 Memory

训练做摘要的 LLM

何时做压缩?

Subagent 可以视为自主压缩

过滤

SKILL 按需加载

Agentic Context Engineering

输入是不断地文字接龙

问题:输入地长度是有限的

  1. AI Agent 决定语言模型看到什么
  2. AI Agent 帮语言模型管理输入,让输入长度是合适的这件事情叫做 Context Engineering

C 代表环境中发生的全部事情

左边 没有做Context Engineering 输入输出接到语言模型

右边 不是文字接龙,是做一个复杂的操作,F就是Context Engineering / AI Agent做的事情

操作F 的一件重要的事情是压缩

1)摘要

2)将长篇大论的工具输出替换成 "这里有一个工具输出"

轨迹延长(Trajectory elongation)现象的解释:做压缩上下文变短,但是有一些步骤不见了,于是重复执行已经做过的操作,没有节省token

压缩方式可以组合使用,比较好的策略是:前期用 Observation Masking 把工具输出换掉,但Context 最终会变长,这时候做摘要。

与其放一行文字不如把诸如工具输出结果放在硬盘里,如果需要就去读。

C分成两部分 P和M,两者经常混淆

P是会被丢进语言模型的信息

M 是不会被丢进语言模型,存在硬盘里的信息

Context 是AI Agent经历过的一切事情

Prompt 是输入语言模型的部分,即语言模型会看到的部分

用Enforcing learning的方法训练做摘要的LLM

做摘要的模型和做其它事情的比如产生执行工具指令的模型是同一个模型

所以不仅仅强化了做摘要的能力,也强化了语言模型解整个任务的能力,比如语言模型根据摘要来解任务的能力

压缩是在 Context超过一个上限强制执行的

Q: 为什么不让语言模型自己决定?

A: 语言模型不喜欢抹除记忆

如果要模型自己做压缩需要微调,压缩能力需要另外训练

spawn 繁殖

主 Agent 繁殖出一些 Subagent 执行任务

  1. 主干不能过长 -> 分裂subagent
  2. Subagent禁止分裂

一开始就不要让context过长,分析是什么样的信息让context过长

Observation: 来自外界的输入,比如语言模型读了一个档案

Reasoning: 语言模型自己说的话

Openclaw 的工具 memory_get 从哪行开始读,读几行

本来F是人类工程师设计的,现在交给LLM

图中的Context通常只是所有Context的一部分

和现在任务有具体关系的不存

AI Agent(2/3): AI Agent 之间可以有什么样的互动

不同的有向图,代表不同的协作方式

纵轴是quality 横轴是动用多少agent

之后还讲了AI能不能尔虞我诈,比如 AI 可以玩狼人杀、剧本杀

AI 可以社交等等

Harness Engineering:有时候语言模型不是不够聪明,只是没有人类好好引导

概览

Prompt -> Context -> Harness

人类通过一些手段来驾驭模型(认知框架、能力边界、行为)

Harness 需要根据语言模型设置

过度责备语言模型可能有害

Life-long AI Agent

Effective 2 Billion 的小模型

木有找到 parser.py(虽然就在同路径)重新写了一个 23333333

Harness 工程:在以代理為核心的世界利用 Codex 推動工程效率

https://openai.com/zh-Hant-HK/index/harness-engineering/

Harness design for long-running application development

https://www.anthropic.com/engineering/harness-design-long-running-apps

现在已经不用说 step by step 也会这样做

更多信息、更系统

多轮对话,驱动工具,驾驭互动

蓝字 手段,红字 控制的对象

Cowork 使用云端沙箱,只要挂载文件夹就要询问人类,更安全了

Claude Sonnet有上下文焦虑

Harness 需要根据语言模型设置

根据feedback改变语言模型的输出也可以认为是一种学习

人类不用 AI Agent 的时候,可以整理 Memory (有很多重复的内容)

有上限

能够自动更新语言模型的参数,可以提高上限

Verbalized feedback调整参数

横轴代表互动次数,实则为另一个语言模型假扮成人类进行互动

互动500次以内的关注重点:少用emoji

互动500~1000次的关注重点:不要拍马屁

互动1000~1500次的关注重点:要求模型讲话直接

没有feedback, AI 自己思考

相关推荐
RAOY的AI笔记几秒前
GPT-6打破孪生素数猜想最新纪录:AI正在进入数学研究新时代?
人工智能·gpt·算法
wp123_1几秒前
硬件设计笔记:1μH功率电感选型实战——线艺 XFL4020-102MEC 与 国产 pin to pin MVLH4020-1R0M 详细参数测评
笔记·科技·硬件架构·硬件工程
围炉聊科技7 分钟前
Agent 的隐身术:CloakBrowser 反检测拆解
人工智能
长空任鸟飞_阿康8 分钟前
三、《从零手撸 Agent》 · system prompt 与核心参数:调好你的旋钮
人工智能·python·ai·prompt
daad7778 分钟前
AI 能造出更接近香农极限的译码器吗?
人工智能·5g·译码器·香农
a11177611 分钟前
ROS2动力学控制器项目
人工智能·开源
liuyunshengsir11 分钟前
Codex Harness 安全沙箱机制原理:AI 编程代理如何安全地执行命令
人工智能·安全
TMT星球15 分钟前
夏智天枢平台发布,云从科技分享AI应用服务商实践
人工智能·科技·百度
dunge202621 分钟前
ChatGPT Plus / Pro 与 Codex 深度实战指南:2026年9月5日版——从模型能力对比到代码生成工作流全解析
人工智能·chatgpt