摘要:AI 编程工具把"写代码"的瓶颈消除了,但瓶颈没有消失------它转移到了"审代码"。本文从 HBR"脑腐"研究、METR 随机对照实验和一线开发者的自述出发,拆解为什么 AI 没让人更轻松、反而更累,以及开发者在 AI 时代保护注意力的四条纪律。
Simon Willison------Django 框架的联合创始人、写了 25 年代码的人------在 2026 年 4 月的 Lenny's Podcast 上说了一句话,当天就在开发者社区炸开:
"我能同时开四个 Agent 跑四个不同的任务。到早上 11 点,我就被榨干了。"
他不是在抱怨。他的语气更像是困惑:工具极其强大了,效率翻倍了,一天能产出上万行代码------但人却比没有这些工具时更累。他还提到,认识一些工程师因为"Agent 还可以再多做一点"而失眠,半夜两点上线开新任务,四点再爬起来看结果。
这不是一个关于"AI 好不好用"的问题。这是一个关于人的认知边界的问题。
哈佛给它起了个名字:AI 脑腐
2026 年 3 月,波士顿咨询公司联合加州大学河滨分校在《哈佛商业评论》上发表了一项研究,调查了 1488 名美国全职员工。研究者给这个现象起了个正式的学术名字:AI Brain Fry(AI 脑腐)。
定义很直接:因超出认知能力地过度使用或监督 AI 工具而引起的精神疲劳。 不是"用累了",是"管累了"。
数据层面:
- 14% 的受访者经历过脑腐。软件开发、营销、IT 是高发群体。
- 高监督工作流(需要持续审查 AI 输出的场景)使人多付出 14% 的心理努力 、增加 12% 的疲劳感 、产生 19% 更多的信息过载感。
- 与此相关,决策疲劳增加 33%。
还有一个反直觉的发现:使用的 AI 工具数有一个甜点------3 个。用 1-2 个,效率实打实提升;用到 3 个,效率达到峰值;超过 4 个,效率不升反降。解释很简单:多任务并行有认知上限,AI 没有改变这个上限,只是让它更容易被触达。
研究者特意区分了两个概念:脑腐不是职业倦怠(burnout)。Burnout 是慢性的、情感层面的枯竭,与"我是否还热爱这份工作"有关。脑腐是急性的、认知层面的榨干------工作记忆、注意力系统、执行控制被推过了短期极限。好消息是,停一停就能恢复。坏消息是,如果你每天都在推过极限,它几乎不可能自然恢复。
METR 实验:越有经验,AI 反而让你越慢
"管累了"还有一个更扎心的数据佐证。
2025 年,METR(模型评估与威胁研究)做了一项至今仍是最严谨的 AI 编程生产力实验。16 名经验丰富的开源开发者,246 个真实任务,随机分配到"允许用 AI"和"禁止用 AI"两组。开发者在自己维护了多年的仓库上工作------平均 10 年历史、100 万行代码。
结果:用 AI 的组慢了 19%。
更耐人寻味的是认知偏差。实验前,开发者预测 AI 能让他们快 24%;实验后------在自己实测慢了 19% 的情况下------他们仍然相信自己快了 20%。43 个百分点的感知偏差。
METR 分析了屏幕录制数据,慢在哪很清楚:AI 确实减少了"积极编码"的时间,但省下来的时间被三件事吞掉了------审查 AI 输出、反复调整提示词、以及等待 AI 生成过程中的"闲置/开销"。在 246 个任务中,开发者只接受了 44% 的 AI 生成内容而不做修改。剩余 56% 的输出产生了净浪费------花时间读了、改了、最后发现不如自己重写。
实验还有一个关键变量:任务类型。对于陌生领域的新功能开发(greenfield),AI 确实是加速器------模型在这些场景中最接近训练数据的分布。但对于有经验开发者在自己深耕多年的代码库上做维护和 bug 修复,AI 的效果最差------模型缺少只有人类开发者才有的隐性上下文:为什么这段代码写得这么奇怪,是因为三年前绕过了一个框架 bug。
自动驾驶汽车的副驾驶:一种新的累
有篇分析文章打了一个精准的比方:自己开车累,但坐在一辆每几分钟犯小错的自动驾驶汽车副驾驶座上------那是一种完全不同的累。
你自己开车时,注意力消耗是线性的,你知道每一步该做什么。坐在自动驾驶汽车副驾驶座上,你不敢放松------因为下一个路口可能是它判断失误的那个。你不敢走神------因为每几公里它就会轻微偏离车道,而你需要在最后一秒伸手纠正。这是一种永久的低强度警觉。
AI 编程工具给人的就是这种感觉。你不是在写代码,你是在持续地、低强度地、无终止地警觉:这段它改对了没,那个 import 它为什么加了,这个异常处理它有没有吞掉,那个方法它是不是改出了新的边界问题。
从神经学角度看,Simon Willison 提到的"半夜两点上线开新任务"也有解释。他把每次 Agent 运行比作拉老虎机的拉杆。"你不知道下一次会不会吐出令人兴奋的结果。"这在神经学上叫间歇性正强化------赌场里让人停不下来、刷社交媒体让人停不下来的同一个机制。AI Agent 天然是这个机制的完美载体:90% 的时间平凡,10% 的时间惊艳------那 10% 足以让你不断拉杆。
你的工作没减少,只是变形了
另一个关于"为什么更累"的洞察来自加州大学伯克利分校。
研究者在 2025 年花 8 个月每天泡在一家中型科技公司,持续观察 40 名员工怎么用 AI。出发时的假设是:AI 会释放时间和心力。实际看到的是:AI 让"做更多"变得可行。设计师开始写代码。工程师开始写文档。产品经理开始画前端原型。没有人要求他们这样做------但 AI 降低了启动成本,做更多就成了一种自然的肌肉反应。
"你以为因为 AI 变得更有效率,可以省下时间少干点活。但实际上,你不会少干。你干的一样多,甚至更多。"------这是研究中一位工程师的原话,也是整个 Berkeley 研究的核心结论。
同样的模式在另一个数据中也能看到。Stack Overflow 2025 年的调查:84% 的开发者在用 AI 工具 ,但只有 29% 信任 AI 的输出 (2024 年这个数字还是 40%)。信任在下降,使用率在上升。Sonar 2026 的数据更极端:96% 不信任 AI 代码,但 46% 的新代码是 AI 生成的。
你不信任它,但它又替你写了差不多一半的代码。这个张力本身就是一种认知负荷。
从"作者"变成"编辑"是有成本的。自己写代码时,思维是线性的------你在构建一个东西。编辑 AI 写的代码时,思维是跳跃的------你在反向工程别人的意图,而且这个"别人"可能自己也说不清意图。每行 AI 代码都是一个需要你做决策的提案:对不对、安不安全、合不合架构。
四条纪律
问题说清楚了,但"别用 AI"不是答案。这个问题该走的方向不是"退回去",而是在有了 AI 之后学会一种新的注意力管理方式。
第一,把"决策预算"当 sprint 点数一样管理。 一天审查 AI 生成的 PR 不要超过一个具体数字。这不是偷懒,是基于认知科学的硬约束。脑腐研究告诉我们,高监督工作的认知消耗比主动工作高 14%------这意味着你对 AI 产出的每个"同意"或"拒绝",都比你自己动手写那个功能消耗更多的脑力。你一天能做出的"好决策"是有上限的。
第二,热认知和冷认知分开。 审查 AI 代码是热认知------需要高度专注、大量工作记忆的思维活动。这类任务不应该放在下午,更不该放在晚上。早上精力最好的时段留给 AI 审查,而不是先开两个 Agent 跑着然后去回消息。Simon Willison 11 点被榨干,一定程度上也是因为他在早上把四个 Agent 同时灌进了工作记忆。
第三,关闭平行 Agent。 脑腐研究的 3 个工具甜点不是随便得出的数字。同时持有多个进行中的 AI 任务,即使不逐行审查,也不可避免地发生认知切换成本。一次只对一个 Agent 启动一个任务,"先完成再下一个",而不是"都跑着,我看看哪个先出结果"。
第四,主动建立 AI 断联时段。 每天至少留出连续 2 小时不开 AI。这不是效率问题,是维持"自己写代码的能力"这一基本盘。认知心理学有个概念叫 use-it-or-lose-it------当你长期不主动调用某种认知能力时,这种能力会退化。用自己的脑子、自己想解决方案,即使最终你还是会用 AI 来实现,那个"我先用自己的脑子过一遍"的步骤,决定了你会不会某一天发现自己已经不会"自己的脑子过一遍"了。
AI 还没学会感知你的疲劳。你得自己学会
这些工具没有停机按钮,因为它们的创造者不太需要为"使用者的认知极限"做产品设计。一个 Agent 可以永无止境地跑下去,一个人不行。
这不是一篇反 AI 的文章。我自己也在大量用这些工具。但效率不该以认知破产为代价。如果 AI 帮你多写了 50% 的代码,你为此多消耗了 100% 的决策精力------这笔账,总有一天你是会算的。
不是嫌它慢。是管它管累了。 认清这一点,是 AI 时代开发者的第一门自我保护课。
作者:唐悦玮 | 从后端出发,用 AI 拓展到全栈的工程师。