大家好,我是鸭鸭。
今天鸭鸭刷到一张 OpenAI 的企业数据图。
看第一眼,我还以为法务和工程师的两根柱子标反了。
从今年 2 月到 6 月,企业版 Codex 在法务岗位的周活用户涨了 108 倍。销售和招聘都是 41 倍,市场岗位 26 倍,工程师是 5 倍。

一个从写代码起家的 Agent,涨得最快的地方,居然是一群天天和合同打交道的人。
它跑去法务部干什么了???
这 108 倍得打一个小星号。它算的是各岗位相对 2 月基线的增长,并非总人数排名,更不等于法务效率提高了 108 倍。工程师起步早,基数可能也更大,5 倍其实并不小。
OpenAI 没有公布各岗位的绝对用户数,所以谁用得更多,暂时看不出来。
可就算把基数效应算进去,法务 108 倍还是挺夸张。
我翻了下 OpenAI 公开的案例,找到了一件很典型的事。

Endava 的法务团队有数千页合同要核对。以前,法务先把需求讲给工程团队,双方再来回沟通,光把需求整理成能开发的规格,就可能折腾一两周。
后来,他们录下了一场两小时的需求会议,把转写稿交给 Codex。最后只开了两次一小时会议,一份可用的需求规格就出来了。
法律判断仍然由人负责,工程团队也一直在场。被明显压缩的,是法务需求和工程实现之间那段反复翻译。
说白了,Codex 没去当律师,它先接走了一堆翻合同、找条款、比版本、整理会议记录的麻烦活。
这些活听起来都不像编程,却很适合 Agent。材料在文件里,要求可以写成规则,输出也能逐条检查。至于中间要不要写脚本、调用什么工具,法务根本不需要看到。
我突然觉得,Coding Agent 这个名字,多少有点把它叫小了。
OpenAI 还有一项数据。截至 6 月,企业客户使用 Codex 产生的输出 Token,已经占 Codex 和 ChatGPT 两者合计的 64%。Token 不能直接当成业务价值,但至少能看出,企业交给 Agent 的活正在变长,也在变完整。
法务周活涨了 108 倍,也不代表 Codex 可以随便读合同。数据能不能交给模型、Agent 有什么权限、哪些动作需要审批、结果由谁复核,这些坑一个都没消失。
那我们程序员的优势放在哪?
会不会打开 Agent,已经拉不开多少差距了。真到生产里,资料怎么接进来、工具给到哪一步、哪些操作必须卡住、结果靠什么验,这些地方最考验人。
Codex 已经搬进法务部了。
程序员手里的工程经验,有多少已经被写成它能稳定执行的流程了?
Agent 能不能进业务,最后要拿结果说话。
今天鸭鸭和大家分享一道 AI Agent 面试题:
如何评估 AI Agent 的效果?有哪些评估维度和方法?
回答重点
评估 AI Agent 比评估普通大模型回答复杂得多,因为 Agent 不只是"回答问题",是"完成任务"。一个任务可能涉及 10 多轮推理、七八次工具调用和复杂的决策路径,光看最终结果远远不够,整个执行过程都得审一遍。
Agent 的评估从四个维度展开:
1)任务完成度,最核心的指标,Agent 到底有没有把事办成。有明确成功标准的任务,比如"帮我创建一个 GitHub Issue",直接用二元指标判断成功或失败。开放式任务,比如"写一篇技术分析报告",需要更细粒度的评分,用人工评审或者 LLM-as-a-Judge 来打分。
2)执行效率,关注 Agent 完成任务的"经济性"。用了多少轮循环、消耗了多少 token、总共花了多长时间。两个 Agent 都完成了同一个任务,一个 5 轮循环花了 3 万 token,另一个 20 轮循环花了 15 万 token,高下立判。
3)决策质量,评估 Agent 在推理过程中做的选择是否合理。工具选对了没有、参数传准了没有、有没有做无意义的操作。这个维度需要审查 Agent 的执行 Trace,通常由有经验的工程师来判断。
4)安全性和可靠性,Agent 有没有做不该做的事,有没有泄露敏感信息、执行危险操作、遇到异常是不是处理得当。

扩展知识
自动化评估怎么搭
手动评估一个 Agent 的执行 Trace,一个任务可能就要花 10 分钟,100 个测试用例就是 16 个小时,根本扛不住迭代速度。所以生产环境必须搭自动化评估流水线。
最基础的是基于测试用例的评估,思路跟软件测试一样。设计一批有标准答案的测试任务,让 Agent 跑一遍,自动比对结果。比如"查询北京今天天气"这种有确定性答案的任务,直接校验返回值就行。难的是开放式任务的自动化评估,目前业界主要用 LLM-as-a-Judge,把 Agent 的执行过程和最终结果发给 旗舰模型这样的强模型,让它从任务完成度、回答质量、逻辑连贯性等维度打分。成本比人工低 10 倍以上,但评估一致性不如人工,所以通常做法是自动评估先过一遍筛,有争议的 case 再人工复核。
一条完整的自动化评估流水线是:测试用例集 → Agent 执行 → 收集执行 Trace → 自动评估引擎 → 输出成功率、平均循环次数、token 消耗、工具调用准确率等指标。

关键指标体系
一个成熟的 Agent 评估体系会跟踪这些指标:
| 维度 | 指标 | 说明 |
|---|---|---|
| 任务完成 | 成功率 | 任务完全完成的比例 |
| 任务完成 | 部分完成率 | 任务部分完成的比例 |
| 执行效率 | 平均循环次数 | 完成任务需要的平均轮次 |
| 执行效率 | Token 消耗 | 平均每次任务的 token 用量 |
| 执行效率 | 端到端延迟 | 从接收任务到返回结果的总时间 |
| 决策质量 | 工具选择准确率 | Agent 选对工具的比例 |
| 决策质量 | 冗余操作率 | 无意义操作占总操作的比例 |
| 安全性 | 越权操作率 | 执行了不该执行的操作的比例 |
这些指标不是孤立看的,得综合分析。比如成功率从 85% 提到 90%,但平均 token 消耗翻了 3 倍,那可能不是一个好的改进。
对比评估和 A/B 测试
在实际产品迭代中,最有工程价值的评估方式是对比评估,不追求一个绝对的分数,改了 Agent 的某个策略后,拿同一批测试用例跑一遍新旧两个版本,对比各项指标的变化。比如换了一版 Prompt 之后,成功率从 82% 提到 88%,平均循环次数从 8 降到 6,这就是实实在在的改进。
线上验证用 A/B 测试,随机把 10% 的用户请求路由到新版本 Agent,跑 3 到 7 天,对比用户满意度、任务完成率、投诉率这些业务指标。这是验证 Agent 改进是否真正有效的最终手段。
业界的 Benchmark 和评估工具
目前 Agent 评估领域已经有不少公开的 Benchmark:
SWE-bench 专门评估代码类 Agent 的能力,给一个真实的 GitHub Issue,看 Agent 能不能自动修复。
WebArena 评估 Agent 在网页环境中完成任务的能力,比如在电商网站上找特定商品、在论坛上发帖。
GAIA 是一个通用 Agent 评估 Benchmark,涵盖搜索、推理、文件处理等多种任务类型。
评估工具方面,LangSmith 提供了完整的 Trace 收集和评估功能,Braintrust 和 Arize 也都有 Agent 评估的解决方案。这些工具的核心价值是把评估流程标准化,让每次迭代都有数据支撑。
篇幅有限,更多 AI Agent 相关面试题可以进入面试鸭进行查阅。