Agent Harness 越堆越烂?600 次实验推翻"自进化",个人场景下更适合"自驯化"

TL;DR

很多人给 AI Agent 加规则、加记忆、加 hook,想着靠 Harness 迭代让模型越来越强。但用久了发现不对劲------规则越堆越多,模型反而开始无视约束,管线越来越臃肿。清华 SEAGym 综述提出了 Harness "自进化"的路线,我拿自己的 Claude Code 配置系统跑了 3 个月、600+ 次 API 实验。结论是:个人场景下,追求"通用变强"会撞上 Harness 腐烂的硬上限。真正可持续的不是"自进化",是"自驯化"------不提升通用能力,只贴合一个人的工作流。

全篇核心数据:机械门把违规率从 55.9% 压到 0.7%,但三段论格式优化对行为的影响约等于零(Δ=−0.02),约束梯度非单调、小模型格式效应归零。文末 5 条可直接复用的工程结论。


1. 先讲痛点:你是不是也在无限加规则?

如果你在用 Claude Code、Cursor、Copilot 这一类 AI 编程工具,下面的体验你可能不陌生:

  • 一开始写了几条 system prompt,AI 很听话
  • 后来发现偶尔不遵守,于是追加规则、追加 memory、追加 hook
  • 再后来规则文件膨胀到几千字,AI 开始选择性忽略某些约束
  • 你分不清它是"忘了"还是"不想遵守"
  • 想精简,但每一条看着都好像有用

我踩这个坑踩了三个月。34 个 growth-log session 里,规则违规率一度到 55.9%------超过一半的 session,AI 在不同阶段违反了至少一条我设置的约束。

后来想办法把违规率压到了 0.7% 。但压下来之后发现了一件更让我困惑的事------AI 确实更遵守"规则"了,但它没有变强 。它只是更像我了。

正好这时候看到了清华那篇 SEAGym。


2. 论文说"自进化",我观察到的更像是"自驯化"

清华 2026 年发的 SEAGym(88 页综述,Zheng et al.)把 Agent Harness 的自更新形式化了:

ini 复制代码
A = (M, H)
A = Agent
M = Model(模型本身)
H = Harness(prompts、memory、tools、middleware、runtime state)

核心观点:Agent 的进步不只靠模型升级,Harness 自己也在迭代 。论文定义了一个更新函数 H_{t+1} = U(H_t),然后给了 6 个评测维度去衡量这种自更新------Update-validation、ID Transfer、OOD Transfer、Replay、Cost、Safety。

论文的框架很完整。对照了一下,我自己一直在跑的东西正好能对号入座。

我系统里有一个自指环(Strange Loop):

lua 复制代码
health-check.py 检测配置新鲜度
       ↓
AI 再生 self-model.md
       ↓
log-regeneration.py 机械验证
       ↓
state-kernel.py 重建状态

50+ 个 session 一直在这个闭环里跑。论文给了我一套词汇去描述我在做的事。

但论文的 U 函数讨论的是 Agent 变强 ------更好的任务泛化、更高的成功率。我跑了三个月的实验数据,看到的是另一个方向

Harness 没有变强。它变贴合了。

规则越积越多 → 发现模型注意力撑不住 → 有意精简 → 保留最重要的那几条 → 最终留下来的,都是对这个人最关键的东西。没有通用能力的提升------只有对一个工作流的深度适配。

论文说的是"自进化"(Evolution)。我做出来的更像是"自驯化"(Domestication)。

而且论文没讨论一个硬约束:Harness 有上限,会腐烂。


3. Harness 腐烂:为什么无限加规则是死路

我现在有 34 个 hooks、14 条 session start 脚本、5 条因果律。每新加一条规则,旧的规则就在模型的注意力分布里被挤出一点点。

模型有 1M 上下文窗口,但有效注意力到大概 70% 就开始衰减。规则文件越长,后半段的约束越容易变成"装饰性文本"------它在上下文里,但模型不处理它。

这就是 Harness rot。清华论文讨论的是 H_{t+1} = U(H_t) 如何让 H 越来越好,但没讨论 H 自己会饱和、腐烂、被迫精简

而且腐烂不只影响规则遵守率------更隐蔽的问题是:腐烂让你以为自己还有安全网,但实际上网已经破了。

所以我做的事不是"不断优化 H 让它更强"。是不断削 H,让它刚好够用。


4. 四组实验数据:门管什么、不管什么

以下实验全部在 DeepSeek V4 Pro 上跑,API 调用,开源可复现。每张表下面有一句通俗解读。

统计指标怎么看(不需要全懂,看括号里的就行):

  • d / d_z(效应量):超过 0.5 就算明显有效,超过 0.8 是强效
  • BF₁₀(贝叶斯因子):超过 100 = 可信,超过 10000 = 非常可信
  • Cohen's κ(评分一致性):0 = 随机瞎猜水平,负数 = 比瞎猜还差

实验 1:门能管到的 100%,管不到的也 100%

目的:测机械门(regex 检查格式标签)对不同类型规则的覆盖度。

34 个 session 的违规记录:部署机械门(L1 gates)前违规率 55.9% ,部署后 0.7%。残差去了哪里?

(P1-1,预注册,5 种任务 × 40 次 = 200 次试验,regex 评分,无 LLM judge 主观偏差)

任务类型 门能扫到? 合规率
格式标签([THINK]: 等) 100%
节标题(## 分析 等) 100%
检查清单 边界 0%
推理链质量 35%
不确定性表达 42.5%

结论 :门能扫到的标签,100% 遵守。门扫不到的东西,合规率掉到 0~42%。门管格式不管内容。


实验 2:更好的 prompt 措辞 ≠ 更好的行为

目的:测三段论格式("大前提→小前提→结论")和祈使句格式("请确保..."),在 token 层面和行为层面的分别效果。

Logprob Probe V3(40 探测点,DeepSeek V4 Pro):三段论比祈使句在 token 概率层面内部化深度高 d=+0.578 ,BF₁₀=282,399(决定性证据)。32/40 探测偏向三段论。

然后跑 GateGuard-OFF(21 探测 × 3 条件:无规则/祈使句/三段论),不测 token 概率,直接测真实行为:

三段论和祈使句的行为表现几乎一样------Δ=−0.02

结论 :三段论能让模型"脑内更重视",但改不了"手上做的事"。行为改变靠门(exit code 阻断),不靠措辞。


实验 3:格式效果不是线性的------约束太多反而压死

目的:测不同输出约束量级下,三段论格式的效果变化。

P2.3(4 个约束等级 × 2 种格式 × 12 探测 = 96 次调用):

约束等级 格式效应 d_z 现象
轻约束 0.596 效应最强------模型有空间展开推理链
无约束 0.315 太自由,格式差异被稀释
重约束 0.297 有小幅反弹------模型回归默认模式
中约束 0.091 效应几乎消失------输出限制压死了推理空间

结论 :不是约束越多越好------非单调曲线。轻约束给模型"呼吸空间",格式效应最大。中约束太重,推理空间被压死。这解释了为什么很多"调 prompt 经验"互相矛盾------你的约束量级决定了格式能不能生效。


实验 4:散文比代码生成更好的推理

目的:测代码式规则(结构化,像配置文件)和散文式规则(自然语言)对推理质量的不同影响。

P1-2(2×2 因子设计:代码/散文 × GateGuard 开/关,240 次试验):

条件 机械合规分 推理质量分
代码+GateOn 5.0 4.2
代码+GateOff 3.15 3.98
散文+GateOn 3.25 4.42
散文+GateOff 3.15 4.17

结论 :机械合规最高(5.0 满分)≠ 推理质量最高。代码式规则 + 门全开 → "清单心态":格式全都对,但推理反而浅了。散文式规则推理分更高。门只管合规,不管思考深度。


跨模型补充

交叉模型实验(P1-1 复测 + 约束梯度复测):Qwen3-8B 和 GLM-4-9B 上格式效应 d_z=0------小模型上三段论完全没效果。格式效应需要模型有足够 capacity 走完三段论的因果推理链。


5. 体系局限:它只是一个雏形

关掉门,很多东西就没了。说几项没过的校验:

  • Causal Swap (n=30):规则移除把替代方案寻求率从 73% 打到 20%(OR=11.0)。但单人评分、无盲法。我自己做 blind check,Cohen's κ = −0.14------比随机还差。
  • 跨模型:8B/9B 上格式效应归零。
  • L4 漂移预测器:8 特征已部署,但预测有效性未验证。
  • 依赖人工监督:每次 session 仍需要我关注 gate 输出、检查 flag、判断再生是否合理。脚本减轻了手动检查次数,但没有消除注意力需求。

就目前而言,它是一个注意力减负工具,不是自主进化系统。


6. 个人开发者落地的 5 条工程结论

如果你的情况跟我差不多------一个人、没有 CI/CD、用 Claude Code/Cursor/Copilot------以下是三个月实验换来的可以直接用的结论:

1. 格式标签 + regex gate 是唯一 100% 有效的手段

[THINK]:[VERIFY]: 这类标签,配合真的在跑的 regex 检查,AI 一定遵守。前提不是"写进 prompt",是"有脚本在扫"。

2. 不要在 prompt 措辞上花太多时间

三段论 vs 祈使句:token 层面深 +0.58 SD,行为层面约等于零。精细措辞的 ROI 远低于写一个 exit-code gate。

3. 规则有硬上限,需要定期精简

我的经验是过了 10-15 条核心约束,每新加一条,旧的退化一点。Harness 不是累积的------是轮换的。定期删,不是定期加。

4. 门只管格式,不管质量

违规率 55.9% → 0.7%,但推理质量分在门开了之后甚至轻微下降。内容质量最终还是要人来判断。

5. 小模型直接上 gate,别折腾格式

8B/9B 上 d_z=0------格式效应需要 model capacity。小模型直接用 exit-code gate,不用研究 prompt 修辞。


总结

清华 SEAGym 把 Harness 自更新这件事形式化了------很有价值。它让我能说清楚我做了三个月的事情。

但论文的框架指向"进化"------Harness 让 Agent 越来越强。我实际观察到的方向是"驯化"------在注意力上限和腐烂约束下,Harness 被慢慢削成一个贴合特定人的形状。它没有变强,它变贴合了。

而且离"自动化"还很远。目前它更像一个注意力减负工具------减少手动检查的次数,但没有消除注意力需求。


以上全部实验代码和论文草稿已开源:paper-validator | hermes-workspace。一行命令复现全部实验:

bash 复制代码
pip install requests && python -m paper_validator claim --claim all --trials 30

参考文献:Zheng et al. (2026) SEAGym: A Survey and Benchmark for Self-Evolving Agent Harness. Shin (2026) The Compliance Gap (arXiv:2605.01771). Lin (2026) Agent Identity Drift (pre-print).


提问交流:你在搭个人 Agent 配置时,有没有遇到过规则越加、模型执行力越差的 Harness 腐烂问题?你是选择继续扩充规则,还是定期精简约束?欢迎评论区聊聊。

相关推荐
ViperL11 小时前
[智能算法]NASSFG-显著特征指导的医学目标检测NAS
人工智能·目标检测·计算机视觉
ShallWeL1 小时前
Orin 上 USB / CSI 相机采集踩坑
人工智能·嵌入式硬件·智能硬件·agi
武子康1 小时前
Pi vs Claude Code vs Codex 正确读法:6 组同模型匹配 + 2.08×/1.46×/1.20×/1.54×/1.22×/1.44× 成
人工智能·ai编程·claude
renhongxia11 小时前
AI安全保卫战:我们如何防止“失控”的智能体?
人工智能·深度学习·安全·机器学习·架构·机器人
江边风声1 小时前
PCB自动化收放板机 在薄板制程中的特殊取放策略——0.05mm芯板怎么稳抓不掉
人工智能·科技·自动化·制造·pcb工艺
lupai1 小时前
汽车维保记录精准版 API 快速接入指南
大数据·人工智能·汽车
橙臣程1 小时前
深度学习4——损失计算
人工智能
煎饼学大模型1 小时前
架构决定上限:Skill 知识架构的三次重构实践
java·重构·架构·skill
王同学的AI学习日记2 小时前
Qwen-Image-3.0技术实测:文字渲染、长上下文与多场景能力深度评测
大数据·人工智能·ai·开源