AI Agent & Harness Engineering 笔记

李宏毅老师教学视频传送门

AI Agent (1/3):核心技術 Context Engineering 基本概念解說

https://www.youtube.com/watch?v=urwDLyNa9FU

AI Agent (2/3): AI Agent 之間可以有什麼樣的互動

https://www.youtube.com/watch?v=mmPmNezjCi0

Harness Engineering:有時候語言模型不是不夠聰明,只是沒有人類好好引導

https://www.youtube.com/watch?v=R6fZR_9kmIw\&t=5151s

AI Agent(1/3): 核心技术Context Engineering基本概念解说

概览

AI Agent

Context Engineering

压缩(摘要,Observation Masking,把部分输出存硬盘)

Memory

Context 分为 Prompt 和 Memory

训练做摘要的 LLM

何时做压缩?

Subagent 可以视为自主压缩

过滤

SKILL 按需加载

Agentic Context Engineering

输入是不断地文字接龙

问题:输入地长度是有限的

  1. AI Agent 决定语言模型看到什么
  2. AI Agent 帮语言模型管理输入,让输入长度是合适的这件事情叫做 Context Engineering

C 代表环境中发生的全部事情

左边 没有做Context Engineering 输入输出接到语言模型

右边 不是文字接龙,是做一个复杂的操作,F就是Context Engineering / AI Agent做的事情

操作F 的一件重要的事情是压缩

1)摘要

2)将长篇大论的工具输出替换成 "这里有一个工具输出"

轨迹延长(Trajectory elongation)现象的解释:做压缩上下文变短,但是有一些步骤不见了,于是重复执行已经做过的操作,没有节省token

压缩方式可以组合使用,比较好的策略是:前期用 Observation Masking 把工具输出换掉,但Context 最终会变长,这时候做摘要。

与其放一行文字不如把诸如工具输出结果放在硬盘里,如果需要就去读。

C分成两部分 P和M,两者经常混淆

P是会被丢进语言模型的信息

M 是不会被丢进语言模型,存在硬盘里的信息

Context 是AI Agent经历过的一切事情

Prompt 是输入语言模型的部分,即语言模型会看到的部分

用Enforcing learning的方法训练做摘要的LLM

做摘要的模型和做其它事情的比如产生执行工具指令的模型是同一个模型

所以不仅仅强化了做摘要的能力,也强化了语言模型解整个任务的能力,比如语言模型根据摘要来解任务的能力

压缩是在 Context超过一个上限强制执行的

Q: 为什么不让语言模型自己决定?

A: 语言模型不喜欢抹除记忆

如果要模型自己做压缩需要微调,压缩能力需要另外训练

spawn 繁殖

主 Agent 繁殖出一些 Subagent 执行任务

  1. 主干不能过长 -> 分裂subagent
  2. Subagent禁止分裂

一开始就不要让context过长,分析是什么样的信息让context过长

Observation: 来自外界的输入,比如语言模型读了一个档案

Reasoning: 语言模型自己说的话

Openclaw 的工具 memory_get 从哪行开始读,读几行

本来F是人类工程师设计的,现在交给LLM

图中的Context通常只是所有Context的一部分

和现在任务有具体关系的不存

AI Agent(2/3): AI Agent 之间可以有什么样的互动

不同的有向图,代表不同的协作方式

纵轴是quality 横轴是动用多少agent

之后还讲了AI能不能尔虞我诈,比如 AI 可以玩狼人杀、剧本杀

AI 可以社交等等

Harness Engineering:有时候语言模型不是不够聪明,只是没有人类好好引导

概览

Prompt -> Context -> Harness

人类通过一些手段来驾驭模型(认知框架、能力边界、行为)

Harness 需要根据语言模型设置

过度责备语言模型可能有害

Life-long AI Agent

Effective 2 Billion 的小模型

木有找到 parser.py(虽然就在同路径)重新写了一个 23333333

Harness 工程:在以代理為核心的世界利用 Codex 推動工程效率

https://openai.com/zh-Hant-HK/index/harness-engineering/

Harness design for long-running application development

https://www.anthropic.com/engineering/harness-design-long-running-apps

现在已经不用说 step by step 也会这样做

更多信息、更系统

多轮对话,驱动工具,驾驭互动

蓝字 手段,红字 控制的对象

Cowork 使用云端沙箱,只要挂载文件夹就要询问人类,更安全了

Claude Sonnet有上下文焦虑

Harness 需要根据语言模型设置

根据feedback改变语言模型的输出也可以认为是一种学习

人类不用 AI Agent 的时候,可以整理 Memory (有很多重复的内容)

有上限

能够自动更新语言模型的参数,可以提高上限

Verbalized feedback调整参数

横轴代表互动次数,实则为另一个语言模型假扮成人类进行互动

互动500次以内的关注重点:少用emoji

互动500~1000次的关注重点:不要拍马屁

互动1000~1500次的关注重点:要求模型讲话直接

没有feedback, AI 自己思考

相关推荐
yuhulkjv3351 小时前
Grok鸿蒙版导出word格式的终极解法:AI导出鸭如何重构AI内容到文档的最后一公里
人工智能·ai·word·harmonyos·ai导出鸭
ONEYAC唯样1 小时前
2026年中国电子元器件进出口全景分析:AI时代下的供应链重构与产业机会
人工智能
aneasystone本尊1 小时前
学习 Headroom 的输出 token 优化
人工智能
武子康1 小时前
给 Pi 增加能力时,应该写 Prompt、Skill、Tool 还是 Extension?
人工智能·llm·agent
love530love1 小时前
彻底清理 Windows 右键“打开方式“中的重复/失效程序项(PyCharm 多版本残留实战 + 自动化脚本)
运维·人工智能·windows·pycharm·jetbrains·toolbox
必须会一定会1 小时前
Node.js Agent Handoff 仓库扫描 MVP:忽略规则、include 通配与稳定输出实现
人工智能·node.js·ai编程
Fluxart.ai1 小时前
Etsy手工制品换背景,用什么AI能保留手作质感?
前端·javascript·人工智能
蓝速科技1 小时前
蓝速科技会议预约屏深度评测:为何安卓系统是智慧办公长期最优解
运维·人工智能·科技
tachibana21 小时前
怎么让大模型同时给意图节点打分
大数据·人工智能·ai·大模型·llm·prompt