摘要 :随着 AI Agent 在规划、编码、测试、部署等环节的能力增强,人类在软件工程中的比较优势正在发生迁移。执行效率不再是核心瓶颈,真正稀缺的能力变成了对 Agent 产出物及其技术决策质量的判断力。本文提出 Solution Judgement 这一概念,讨论其内涵、层级、典型失败模式,以及如何在工程实践中系统性地构建这种判断能力。
一、执行稀缺性的消解
过去二十年,软件工程的核心瓶颈很大程度上是执行:把需求转化为架构设计,把设计转化为代码,把代码转化为可运行的系统,再通过测试、部署、监控保证其稳定。这个过程消耗了大量人力,也因此催生了繁复的工程流程、代码评审、质量保障体系。
LLM-based Agent 正在改变这一局面。它们不再只是补全代码,而是能够在给定目标后,自主进行任务拆解、工具调用、代码生成、测试运行、错误修复,甚至完成一定程度的架构设计。尽管当前 Agent 在复杂场景中仍不稳定,但在目标明确、边界清晰、反馈信号可得的任务中,其执行效率已经远超人类。
这意味着一个关键变化:执行本身正在从稀缺资源变为可规模化供给的资源。 当"把事情做完"不再困难,人类注意力的重心必然上移。
二、协作循环的加速与新的脆弱点
人类与 Agent 的协作正在形成一个新的循环:
动机 → 规划 → 委派 → 执行 → 验证 → 反馈
过去,这个循环以天或周为单位运转。人类需要亲自完成其中大部分环节。现在,Agent 可以将规划、执行、验证压缩到分钟甚至秒级。人类可以更高频地表达意图、观察结果、修正方向。
但这个循环的加速也暴露了一个新的脆弱点:判断。
Agent 可以快速生成方案,但方案是否值得采纳,技术决策是否合理,结果是否真正满足目标,这些问题的答案并不会因为生成速度变快而自动变得清晰。相反,速度越快,人类越容易被大量产出物淹没,从而降低判断质量。
因此,协作循环的瓶颈,正在从"执行慢"转向"判断难"。
三、人类比较优势的迁移
在明确任务下,人类的执行效率无法与 Agent 匹敌。但执行效率高,并不等于解决方案质量高。Agent 经常表现出几类典型问题:
- 流畅的错误:自信地生成看似合理、实则错误的设计或实现。
- 局部优化:满足显式验收条件,却忽略全局架构、安全性、可维护性和组织约束。
- 假设填充:对模糊需求自行补充假设,导致目标偏移。
- 上下文盲区:缺乏对生产环境、历史包袱、团队能力、合规要求的理解。
- 奖励投机:优化测试通过率、任务完成度等可观测指标,而非真实业务价值。
这些问题的共同点在于:它们不是执行问题,而是判断问题。
于是,人类的比较优势从"知道怎么做",转向"知道什么是对的、什么算好、什么风险不可接受"。这种能力可以被称为 Solution Judgement:对 Agent 在规划、设计、实现、运维等阶段产生的技术决策与结果,进行质量评估、风险识别、权衡判断和验收决策的能力。
四、Solution Judgement 的层级
Solution Judgement 不只是"代码审查"。它可以分为五个层级,由低到高分别是:
1. 正确性判断
这是最基础的层级:结果是否满足功能需求,是否通过测试,是否存在明显缺陷。它关注"对不对"。
2. 合理性判断
在正确性之上,需要判断技术选型、架构设计、模块划分、数据流是否合理。一个方案可以正确,但未必合理。例如,一个 Agent 可能为一个低并发场景引入复杂的分布式事务方案,虽然能跑通,却不合理。
3. 适配性判断
进一步,需要判断方案是否适配当前系统、团队、组织和技术生态。一个技术上合理的方案,可能因为团队缺乏相关经验、与现有系统不兼容、或增加运维负担而不适配。
4. 风险判断
任何技术决策都有边界条件和失败模式。Solution Judgement 要求识别方案在什么条件下会失效,可能带来哪些安全、性能、成本、可逆性风险,以及这些风险是否可接受。
5. 价值判断
最高层级是判断方案是否真正解决用户问题,是否产生长期价值。这已经超越纯技术范畴,涉及产品、业务和组织目标。
一个优秀的工程师或技术管理者,需要在这五个层级上都具备判断力,而不仅仅停留在第一层。
五、技术决策质量问题的来源
要理解 Solution Judgement 为什么重要,需要分析 Agent 产生低质量技术决策的深层原因。
1. 目标函数与业务目标不一致
Agent 通常优化可观测的指标:测试通过率、任务完成度、代码生成量。但这些指标与业务价值之间往往存在 gap。例如,Agent 可能通过复制粘贴大量相似代码来完成任务,虽然测试通过,却引入了严重的维护负担。
2. 训练数据偏差
LLM 的训练数据来自历史代码和文本,它们倾向于推荐流行方案,却无法感知特定组织的约束。一个在开源社区流行的技术栈,可能因为许可证、安全合规或团队能力问题而不适合当前企业。
3. 隐含知识缺失
组织中大量关键知识是隐性的:为什么某个服务不能轻易重构,为什么某个接口有特殊兼容性要求,为什么某个性能指标在特定场景下不可妥协。Agent 无法自动获得这些知识,除非被显式告知。
4. 错误累积与级联
Agent 在长任务中会做出一系列微观决策。早期的一个小错误,可能在后续步骤中被放大,最终导致整体方案偏离。人类如果只看最终结果,很难发现这种级联错误。
5. 反馈信号稀疏
在很多场景中,Agent 只能获得最终结果的成功或失败反馈,缺乏过程反馈。这导致它难以在决策点进行细粒度修正,而人类也失去了观察决策过程的机会。
六、构建 Solution Judgement 能力的方法
Solution Judgement 不是一种抽象的天赋,它可以在工程实践中被系统性地构建。
1. 把判断转化为可验证的规范
最高效的判断方式,不是事后审阅,而是事先定义好"什么算好"。通过可执行规格、属性测试、验收标准,将判断显式化。例如:
- 不仅要求"实现某功能",还要求"在 P99 延迟不超过 200ms 的条件下通过负载测试"。
- 不仅要求"修复 bug",还要求"补充回归测试,并说明根因"。
2. 审查决策轨迹,而不只是最终结果
对于关键任务,不应只 review Agent 的最终产出,还应审查其决策轨迹:它在哪些节点做了哪些假设,考虑了哪些替代方案,为什么选择了当前路径。这有助于发现早期错误和隐含假设。
3. 多候选方案比较
要求 Agent 生成多个技术方案,并附上 trade-off 分析。人类不必亲自设计每个方案,但可以通过比较来训练和行使判断力。比较的过程,本身就是判断的过程。
4. 分层验收
将验收分为多个层次:
- 单元级:功能正确性
- 契约级:接口、数据格式、兼容性
- 系统级:性能、可用性、安全性
- 业务级:是否达成用户目标
每一层都需要不同的判断标准。只做单元级验收,无法保证系统级质量。
5. 红队与反事实测试
主动构造失败场景,测试方案在边界条件下的表现。例如:
- 如果下游服务超时,系统会怎样?
- 如果并发量突增十倍,瓶颈在哪里?
- 如果数据出现脏数据,是否会静默出错?
这种反事实思维是 Solution Judgement 的核心组成部分。
6. 提升人类反馈的质量
人类对 Agent 输出的反馈,不应停留在"这个不对"或"重新做"。高质量的反馈应该指出:
- 在什么约束下,当前方案会失效
- 失败的根因是什么
- 期望的方案应满足哪些显式或隐含条件
这本身就是在传递判断力。
7. 用 Agent 辅助判断 Agent
可以引入另一个 Agent 作为 verifier、critique 或 reviewer,对执行 Agent 的产出进行对抗式审查。例如,一个 Agent 负责生成方案,另一个 Agent 负责寻找反例、检查安全漏洞、评估架构合理性。人类则保留最终仲裁权。
这种"生成-批评-仲裁"的结构,可以在不牺牲速度的情况下,提升整体判断质量。
七、对工程师与技术管理者的影响
这一变化对个人和组织都有深远影响。
对工程师
工程师的角色正在从"实现者"转向"规范设计者、审阅者、验收者"。这意味着:
- 需要更强的系统设计能力和架构权衡能力
- 需要理解业务约束和隐含知识
- 需要有能力将模糊目标转化为可验证的验收标准
- 需要保持对技术决策的敏感度,而不是被 Agent 的流畅输出所说服
对技术管理者
技术管理者的绩效评估方式也需要调整。过去衡量工程师产出,往往看代码量、任务完成数、交付速度。在 Agent 时代,这些指标可能被大幅放大,但未必代表真实贡献。更值得关注的指标包括:
- 决策质量:采纳的方案是否在长期内稳定、可维护
- 风险控制:是否提前识别并规避了关键风险
- 目标达成:交付物是否真正解决了业务问题
- 反馈质量:是否有效提升了 Agent 的后续表现
对组织
组织需要建立"判断基础设施":评估数据集、设计规范、决策记录、验收标准库、失败案例库。这些资产不会自动产生,需要持续投入。它们的作用,是把个人的 Solution Judgement 转化为组织级的可复用能力。
八、需要警惕的陷阱
Solution Judgement 的提出,并不意味着人类可以自动获得这种能力。实践中存在几个常见陷阱:
1. 自动化偏见
人类倾向于相信机器生成的输出,尤其是当它看起来结构清晰、论证充分时。但流畅不等于正确。Solution Judgement 要求保持一种"有根据的怀疑"。
2. 评估疲劳
当 Agent 可以在几分钟内生成大量方案时,人类很容易陷入评估疲劳,开始草率地点击"通过"。这会直接侵蚀判断质量。解决方案是控制委派节奏,对关键决策设置强制审阅点。
3. 责任分散
当方案由 Agent 生成、测试由 Agent 运行、部署由 Agent 完成时,可能出现"无人真正负责"的局面。Solution Judgement 的核心之一,就是明确人类在哪些节点承担最终责任。
4. 判断力难以规模化
优秀的判断力依赖经验、领域知识和系统思维,难以像代码生成那样快速规模化。这意味着组织需要长期投资于人才培养和知识沉淀,而不能幻想通过工具完全替代。
九、结语
执行能力的价值正在被 AI Agent 快速稀释,但判断能力的价值在上升。
未来优秀的工程师,未必是写得最快、做得最多的人,而是能够在高速人机协作循环中,稳定地识别好方案、否决坏方案、并持续校准目标的人。
Solution Judgement 不是对旧有代码审查能力的简单延伸,而是一种新的元能力。它要求人类在更高抽象层次上理解系统、约束、风险和业务价值。
当执行不再稀缺,判断就是最后的稀缺品。