TL;DR
很多人给 AI Agent 加规则、加记忆、加 hook,想着靠 Harness 迭代让模型越来越强。但用久了发现不对劲------规则越堆越多,模型反而开始无视约束,管线越来越臃肿。清华 SEAGym 综述提出了 Harness "自进化"的路线,我拿自己的 Claude Code 配置系统跑了 3 个月、600+ 次 API 实验。结论是:个人场景下,追求"通用变强"会撞上 Harness 腐烂的硬上限。真正可持续的不是"自进化",是"自驯化"------不提升通用能力,只贴合一个人的工作流。
全篇核心数据:机械门把违规率从 55.9% 压到 0.7%,但三段论格式优化对行为的影响约等于零(Δ=−0.02),约束梯度非单调、小模型格式效应归零。文末 5 条可直接复用的工程结论。
1. 先讲痛点:你是不是也在无限加规则?
如果你在用 Claude Code、Cursor、Copilot 这一类 AI 编程工具,下面的体验你可能不陌生:
- 一开始写了几条 system prompt,AI 很听话
- 后来发现偶尔不遵守,于是追加规则、追加 memory、追加 hook
- 再后来规则文件膨胀到几千字,AI 开始选择性忽略某些约束
- 你分不清它是"忘了"还是"不想遵守"
- 想精简,但每一条看着都好像有用
我踩这个坑踩了三个月。34 个 growth-log session 里,规则违规率一度到 55.9%------超过一半的 session,AI 在不同阶段违反了至少一条我设置的约束。
后来想办法把违规率压到了 0.7% 。但压下来之后发现了一件更让我困惑的事------AI 确实更遵守"规则"了,但它没有变强 。它只是更像我了。
正好这时候看到了清华那篇 SEAGym。
2. 论文说"自进化",我观察到的更像是"自驯化"
清华 2026 年发的 SEAGym(88 页综述,Zheng et al.)把 Agent Harness 的自更新形式化了:
ini
A = (M, H)
A = Agent
M = Model(模型本身)
H = Harness(prompts、memory、tools、middleware、runtime state)
核心观点:Agent 的进步不只靠模型升级,Harness 自己也在迭代 。论文定义了一个更新函数 H_{t+1} = U(H_t),然后给了 6 个评测维度去衡量这种自更新------Update-validation、ID Transfer、OOD Transfer、Replay、Cost、Safety。
论文的框架很完整。对照了一下,我自己一直在跑的东西正好能对号入座。
我系统里有一个自指环(Strange Loop):
lua
health-check.py 检测配置新鲜度
↓
AI 再生 self-model.md
↓
log-regeneration.py 机械验证
↓
state-kernel.py 重建状态
50+ 个 session 一直在这个闭环里跑。论文给了我一套词汇去描述我在做的事。
但论文的 U 函数讨论的是 Agent 变强 ------更好的任务泛化、更高的成功率。我跑了三个月的实验数据,看到的是另一个方向。
Harness 没有变强。它变贴合了。
规则越积越多 → 发现模型注意力撑不住 → 有意精简 → 保留最重要的那几条 → 最终留下来的,都是对这个人最关键的东西。没有通用能力的提升------只有对一个工作流的深度适配。
论文说的是"自进化"(Evolution)。我做出来的更像是"自驯化"(Domestication)。
而且论文没讨论一个硬约束:Harness 有上限,会腐烂。
3. Harness 腐烂:为什么无限加规则是死路
我现在有 34 个 hooks、14 条 session start 脚本、5 条因果律。每新加一条规则,旧的规则就在模型的注意力分布里被挤出一点点。
模型有 1M 上下文窗口,但有效注意力到大概 70% 就开始衰减。规则文件越长,后半段的约束越容易变成"装饰性文本"------它在上下文里,但模型不处理它。
这就是 Harness rot。清华论文讨论的是 H_{t+1} = U(H_t) 如何让 H 越来越好,但没讨论 H 自己会饱和、腐烂、被迫精简。
而且腐烂不只影响规则遵守率------更隐蔽的问题是:腐烂让你以为自己还有安全网,但实际上网已经破了。
所以我做的事不是"不断优化 H 让它更强"。是不断削 H,让它刚好够用。
4. 四组实验数据:门管什么、不管什么
以下实验全部在 DeepSeek V4 Pro 上跑,API 调用,开源可复现。每张表下面有一句通俗解读。
统计指标怎么看(不需要全懂,看括号里的就行):
- d / d_z(效应量):超过 0.5 就算明显有效,超过 0.8 是强效
- BF₁₀(贝叶斯因子):超过 100 = 可信,超过 10000 = 非常可信
- Cohen's κ(评分一致性):0 = 随机瞎猜水平,负数 = 比瞎猜还差
实验 1:门能管到的 100%,管不到的也 100%
目的:测机械门(regex 检查格式标签)对不同类型规则的覆盖度。
34 个 session 的违规记录:部署机械门(L1 gates)前违规率 55.9% ,部署后 0.7%。残差去了哪里?
(P1-1,预注册,5 种任务 × 40 次 = 200 次试验,regex 评分,无 LLM judge 主观偏差)
| 任务类型 | 门能扫到? | 合规率 |
|---|---|---|
格式标签([THINK]: 等) |
✅ | 100% |
节标题(## 分析 等) |
✅ | 100% |
| 检查清单 | 边界 | 0% |
| 推理链质量 | ❌ | 35% |
| 不确定性表达 | ❌ | 42.5% |
结论 :门能扫到的标签,100% 遵守。门扫不到的东西,合规率掉到 0~42%。门管格式不管内容。
实验 2:更好的 prompt 措辞 ≠ 更好的行为
目的:测三段论格式("大前提→小前提→结论")和祈使句格式("请确保..."),在 token 层面和行为层面的分别效果。
Logprob Probe V3(40 探测点,DeepSeek V4 Pro):三段论比祈使句在 token 概率层面内部化深度高 d=+0.578 ,BF₁₀=282,399(决定性证据)。32/40 探测偏向三段论。
然后跑 GateGuard-OFF(21 探测 × 3 条件:无规则/祈使句/三段论),不测 token 概率,直接测真实行为:
三段论和祈使句的行为表现几乎一样------Δ=−0.02。
结论 :三段论能让模型"脑内更重视",但改不了"手上做的事"。行为改变靠门(exit code 阻断),不靠措辞。
实验 3:格式效果不是线性的------约束太多反而压死
目的:测不同输出约束量级下,三段论格式的效果变化。
P2.3(4 个约束等级 × 2 种格式 × 12 探测 = 96 次调用):
| 约束等级 | 格式效应 d_z | 现象 |
|---|---|---|
| 轻约束 | 0.596 | 效应最强------模型有空间展开推理链 |
| 无约束 | 0.315 | 太自由,格式差异被稀释 |
| 重约束 | 0.297 | 有小幅反弹------模型回归默认模式 |
| 中约束 | 0.091 | 效应几乎消失------输出限制压死了推理空间 |
结论 :不是约束越多越好------非单调曲线。轻约束给模型"呼吸空间",格式效应最大。中约束太重,推理空间被压死。这解释了为什么很多"调 prompt 经验"互相矛盾------你的约束量级决定了格式能不能生效。
实验 4:散文比代码生成更好的推理
目的:测代码式规则(结构化,像配置文件)和散文式规则(自然语言)对推理质量的不同影响。
P1-2(2×2 因子设计:代码/散文 × GateGuard 开/关,240 次试验):
| 条件 | 机械合规分 | 推理质量分 |
|---|---|---|
| 代码+GateOn | 5.0 | 4.2 |
| 代码+GateOff | 3.15 | 3.98 |
| 散文+GateOn | 3.25 | 4.42 |
| 散文+GateOff | 3.15 | 4.17 |
结论 :机械合规最高(5.0 满分)≠ 推理质量最高。代码式规则 + 门全开 → "清单心态":格式全都对,但推理反而浅了。散文式规则推理分更高。门只管合规,不管思考深度。
跨模型补充
交叉模型实验(P1-1 复测 + 约束梯度复测):Qwen3-8B 和 GLM-4-9B 上格式效应 d_z=0------小模型上三段论完全没效果。格式效应需要模型有足够 capacity 走完三段论的因果推理链。
5. 体系局限:它只是一个雏形
关掉门,很多东西就没了。说几项没过的校验:
- Causal Swap (n=30):规则移除把替代方案寻求率从 73% 打到 20%(OR=11.0)。但单人评分、无盲法。我自己做 blind check,Cohen's κ = −0.14------比随机还差。
- 跨模型:8B/9B 上格式效应归零。
- L4 漂移预测器:8 特征已部署,但预测有效性未验证。
- 依赖人工监督:每次 session 仍需要我关注 gate 输出、检查 flag、判断再生是否合理。脚本减轻了手动检查次数,但没有消除注意力需求。
就目前而言,它是一个注意力减负工具,不是自主进化系统。
6. 个人开发者落地的 5 条工程结论
如果你的情况跟我差不多------一个人、没有 CI/CD、用 Claude Code/Cursor/Copilot------以下是三个月实验换来的可以直接用的结论:
1. 格式标签 + regex gate 是唯一 100% 有效的手段
[THINK]:、[VERIFY]: 这类标签,配合真的在跑的 regex 检查,AI 一定遵守。前提不是"写进 prompt",是"有脚本在扫"。
2. 不要在 prompt 措辞上花太多时间
三段论 vs 祈使句:token 层面深 +0.58 SD,行为层面约等于零。精细措辞的 ROI 远低于写一个 exit-code gate。
3. 规则有硬上限,需要定期精简
我的经验是过了 10-15 条核心约束,每新加一条,旧的退化一点。Harness 不是累积的------是轮换的。定期删,不是定期加。
4. 门只管格式,不管质量
违规率 55.9% → 0.7%,但推理质量分在门开了之后甚至轻微下降。内容质量最终还是要人来判断。
5. 小模型直接上 gate,别折腾格式
8B/9B 上 d_z=0------格式效应需要 model capacity。小模型直接用 exit-code gate,不用研究 prompt 修辞。
总结
清华 SEAGym 把 Harness 自更新这件事形式化了------很有价值。它让我能说清楚我做了三个月的事情。
但论文的框架指向"进化"------Harness 让 Agent 越来越强。我实际观察到的方向是"驯化"------在注意力上限和腐烂约束下,Harness 被慢慢削成一个贴合特定人的形状。它没有变强,它变贴合了。
而且离"自动化"还很远。目前它更像一个注意力减负工具------减少手动检查的次数,但没有消除注意力需求。
以上全部实验代码和论文草稿已开源:paper-validator | hermes-workspace。一行命令复现全部实验:
bash
pip install requests && python -m paper_validator claim --claim all --trials 30
参考文献:Zheng et al. (2026) SEAGym: A Survey and Benchmark for Self-Evolving Agent Harness. Shin (2026) The Compliance Gap (arXiv:2605.01771). Lin (2026) Agent Identity Drift (pre-print).
提问交流:你在搭个人 Agent 配置时,有没有遇到过规则越加、模型执行力越差的 Harness 腐烂问题?你是选择继续扩充规则,还是定期精简约束?欢迎评论区聊聊。