Codex 跑进法务部,周活居然暴涨了 108 倍???

大家好,我是鸭鸭。

今天鸭鸭刷到一张 OpenAI 的企业数据图。

看第一眼,我还以为法务和工程师的两根柱子标反了。

从今年 2 月到 6 月,企业版 Codex 在法务岗位的周活用户涨了 108 倍。销售和招聘都是 41 倍,市场岗位 26 倍,工程师是 5 倍。

一个从写代码起家的 Agent,涨得最快的地方,居然是一群天天和合同打交道的人。

它跑去法务部干什么了???

这 108 倍得打一个小星号。它算的是各岗位相对 2 月基线的增长,并非总人数排名,更不等于法务效率提高了 108 倍。工程师起步早,基数可能也更大,5 倍其实并不小。

OpenAI 没有公布各岗位的绝对用户数,所以谁用得更多,暂时看不出来。

可就算把基数效应算进去,法务 108 倍还是挺夸张。

我翻了下 OpenAI 公开的案例,找到了一件很典型的事。

Endava 的法务团队有数千页合同要核对。以前,法务先把需求讲给工程团队,双方再来回沟通,光把需求整理成能开发的规格,就可能折腾一两周。

后来,他们录下了一场两小时的需求会议,把转写稿交给 Codex。最后只开了两次一小时会议,一份可用的需求规格就出来了。

法律判断仍然由人负责,工程团队也一直在场。被明显压缩的,是法务需求和工程实现之间那段反复翻译。

说白了,Codex 没去当律师,它先接走了一堆翻合同、找条款、比版本、整理会议记录的麻烦活。

这些活听起来都不像编程,却很适合 Agent。材料在文件里,要求可以写成规则,输出也能逐条检查。至于中间要不要写脚本、调用什么工具,法务根本不需要看到。

我突然觉得,Coding Agent 这个名字,多少有点把它叫小了。

OpenAI 还有一项数据。截至 6 月,企业客户使用 Codex 产生的输出 Token,已经占 Codex 和 ChatGPT 两者合计的 64%。Token 不能直接当成业务价值,但至少能看出,企业交给 Agent 的活正在变长,也在变完整。

法务周活涨了 108 倍,也不代表 Codex 可以随便读合同。数据能不能交给模型、Agent 有什么权限、哪些动作需要审批、结果由谁复核,这些坑一个都没消失。

那我们程序员的优势放在哪?

会不会打开 Agent,已经拉不开多少差距了。真到生产里,资料怎么接进来、工具给到哪一步、哪些操作必须卡住、结果靠什么验,这些地方最考验人。

Codex 已经搬进法务部了。

程序员手里的工程经验,有多少已经被写成它能稳定执行的流程了?

Agent 能不能进业务,最后要拿结果说话。

今天鸭鸭和大家分享一道 AI Agent 面试题:

如何评估 AI Agent 的效果?有哪些评估维度和方法?

回答重点

评估 AI Agent 比评估普通大模型回答复杂得多,因为 Agent 不只是"回答问题",是"完成任务"。一个任务可能涉及 10 多轮推理、七八次工具调用和复杂的决策路径,光看最终结果远远不够,整个执行过程都得审一遍。

Agent 的评估从四个维度展开:

1)任务完成度,最核心的指标,Agent 到底有没有把事办成。有明确成功标准的任务,比如"帮我创建一个 GitHub Issue",直接用二元指标判断成功或失败。开放式任务,比如"写一篇技术分析报告",需要更细粒度的评分,用人工评审或者 LLM-as-a-Judge 来打分。

2)执行效率,关注 Agent 完成任务的"经济性"。用了多少轮循环、消耗了多少 token、总共花了多长时间。两个 Agent 都完成了同一个任务,一个 5 轮循环花了 3 万 token,另一个 20 轮循环花了 15 万 token,高下立判。

3)决策质量,评估 Agent 在推理过程中做的选择是否合理。工具选对了没有、参数传准了没有、有没有做无意义的操作。这个维度需要审查 Agent 的执行 Trace,通常由有经验的工程师来判断。

4)安全性和可靠性,Agent 有没有做不该做的事,有没有泄露敏感信息、执行危险操作、遇到异常是不是处理得当。

扩展知识

自动化评估怎么搭

手动评估一个 Agent 的执行 Trace,一个任务可能就要花 10 分钟,100 个测试用例就是 16 个小时,根本扛不住迭代速度。所以生产环境必须搭自动化评估流水线。

最基础的是基于测试用例的评估,思路跟软件测试一样。设计一批有标准答案的测试任务,让 Agent 跑一遍,自动比对结果。比如"查询北京今天天气"这种有确定性答案的任务,直接校验返回值就行。难的是开放式任务的自动化评估,目前业界主要用 LLM-as-a-Judge,把 Agent 的执行过程和最终结果发给 旗舰模型这样的强模型,让它从任务完成度、回答质量、逻辑连贯性等维度打分。成本比人工低 10 倍以上,但评估一致性不如人工,所以通常做法是自动评估先过一遍筛,有争议的 case 再人工复核。

一条完整的自动化评估流水线是:测试用例集 → Agent 执行 → 收集执行 Trace → 自动评估引擎 → 输出成功率、平均循环次数、token 消耗、工具调用准确率等指标。

关键指标体系

一个成熟的 Agent 评估体系会跟踪这些指标:

维度 指标 说明
任务完成 成功率 任务完全完成的比例
任务完成 部分完成率 任务部分完成的比例
执行效率 平均循环次数 完成任务需要的平均轮次
执行效率 Token 消耗 平均每次任务的 token 用量
执行效率 端到端延迟 从接收任务到返回结果的总时间
决策质量 工具选择准确率 Agent 选对工具的比例
决策质量 冗余操作率 无意义操作占总操作的比例
安全性 越权操作率 执行了不该执行的操作的比例

这些指标不是孤立看的,得综合分析。比如成功率从 85% 提到 90%,但平均 token 消耗翻了 3 倍,那可能不是一个好的改进。

对比评估和 A/B 测试

在实际产品迭代中,最有工程价值的评估方式是对比评估,不追求一个绝对的分数,改了 Agent 的某个策略后,拿同一批测试用例跑一遍新旧两个版本,对比各项指标的变化。比如换了一版 Prompt 之后,成功率从 82% 提到 88%,平均循环次数从 8 降到 6,这就是实实在在的改进。

线上验证用 A/B 测试,随机把 10% 的用户请求路由到新版本 Agent,跑 3 到 7 天,对比用户满意度、任务完成率、投诉率这些业务指标。这是验证 Agent 改进是否真正有效的最终手段。

业界的 Benchmark 和评估工具

目前 Agent 评估领域已经有不少公开的 Benchmark:

SWE-bench 专门评估代码类 Agent 的能力,给一个真实的 GitHub Issue,看 Agent 能不能自动修复。

WebArena 评估 Agent 在网页环境中完成任务的能力,比如在电商网站上找特定商品、在论坛上发帖。

GAIA 是一个通用 Agent 评估 Benchmark,涵盖搜索、推理、文件处理等多种任务类型。

评估工具方面,LangSmith 提供了完整的 Trace 收集和评估功能,Braintrust 和 Arize 也都有 Agent 评估的解决方案。这些工具的核心价值是把评估流程标准化,让每次迭代都有数据支撑。

篇幅有限,更多 AI Agent 相关面试题可以进入面试鸭进行查阅

相关推荐
Larcher2 小时前
从 SDD 到可交付:我如何用规范驱动 AI 做出一个 Chrome 翻译插件
前端·后端·架构
choumou_M2 小时前
SpringBoot_5:商品秒杀场景的并发实践(初步)
java·spring boot·后端
陈明勇2 小时前
Go 1.27 重磅发布:泛型方法落地、分配性能跃升,JSON v2 正式可用
后端
Zane19943 小时前
create_task 和直接 await 到底有什么不一样?asyncio 的 Task、gather 与并发数量控制
后端·python
喜欢吃豆3 小时前
5 分钟,让网页里站着一个会说话的 3D 数字人
后端
Python私教3 小时前
创业团队做管理系统,别先堆页面:我把 14 个问题做成了需求门禁
后端·python·架构
攻城有术3 小时前
专项攻克-SpringBoot启动后 Bean的实例数量问题
java·spring boot·后端
JimmtButler3 小时前
功能明明正常,架构为什么还是会腐化?<第一章>
后端·架构
用户077911816613 小时前
记一次 yfinance 源码调试:SOCKS5 代理下 Chart API 正常,历史数据却一直超时
后端