头部实验室正在像竞争模型一样竞争#智能体评测。OpenAI 停用了自家研究员发明的基准,审计发现训练语料里已经包含答案。Anthropic 把智能体评测方法论写成工程文档公开发布,设专职评测团队。腾讯把数据与评测合并进一个部门,由首席 AI 科学家统管。Meta 刷榜被抓,xAI 的自报分数被独立复测打掉 14 个百分点。
自 2025 年初"评测即护城河"(Eval as a Moat)的概念被提出以来,它被行业讨论了一整年,但关于"机制"的答案始终缺席。对模型公司而言,评测本身就是护城河------它保护了:内部的模型迭代速度,与外部的信任资产。而这条护城河能挖多深,拆开看是两个变量。
建制:评测是否有独立的架构位置、预算保障与汇报线?
可复核:评测方法与分数,能否被外部第三方核查与复现?
**建制 × 可复核,决定护城河的深度。**把评测写进架构与 KPI 的实验室,得到的是战略职能;将评测停留在小组工种的实验室,得到的不过是质检环节------即便分数再高也是如此。这一点在智能体(Agent)评测上被放大到了极致。从"模型评测"(单步输入输出)跨越到"系统评测"(模型 + 脚手架 + 动态环境 + 多步容错),一轮完整运行的成本高达数百至上千美元。正因为极贵、极难复核且与产品深度耦合,评测的差异才演变成战略差异:对象一旦从模型变成系统,评测就再不是纯粹的研究实践,而是一个严酷的组织问题。
智能体评测为什么变成组织问题
三个已核实的事实,把评测从测量问题推成组织问题。
**智能体分数是系统分数,不是模型分数。**同一个模型 GAIA 裸跑 44.8%,带脚手架 74.6%,差 30 个百分点。Grok 4 自报 SWE-bench Verified 72%,独立平台用统一脚手架复测 58.6%。脚手架是产品团队搭的,不是模型自带的。分数一旦取决于谁搭了评测架子,评测就成了产品质量问题。评测与产品的耦合由被测对象的性质决定,任何实验室都绕不开。
可靠性结构放大了这个问题。单步成功率 95% 的智能体,10 步任务完整成功率约 60%,20 步任务约 36%(HORIZON,2026)。METR 的任务时间视界自 2019 年以来每约 7 个月翻倍;RE-Bench 显示 2 小时预算下智能体超人类专家约 4 倍,32 小时预算下人类反超约 2 倍。单步准确率说明不了长时程可靠性,只测短任务的评测会系统性高估生产就绪度。
**旧基准结构性失效,评测变成一场持续的仗。**OpenAI 2026 年 2 月停用 SWE-bench Verified,距离它的研究员建这个基准刚两年。审计发现两层失效:138 道模型最常失败的题里 59.4% 测试有缺陷,把正确实现判错;所有被测前沿模型都能逐字复现标准答案补丁,训练语料里已经包含题目和答案。UC Berkeley 的 Agents' Last Exam 量出了后果:SWE-bench 拿 80% 的模型,ALE 最难档通过率 2.6%。
能被记住的基准不再是基准,是训练数据的回声。
静态基准死亡之后,评测变成持续的对抗性努力:私有题集、持续换题、主动审计。这种努力是组织级承诺,不是一次性项目。
**动态评测又贵又吵,评测能力向付得起的实验室集中。**完整 SWE-bench 跑一轮 480 到 1100 美元。单次运行 pass@1 在批次间波动 2.2 到 6.0 个百分点,温度设为 0 也一样。每周一轮动态评测,小团队做不到。能持续做的实验室,是有预算、有组织承接它的实验室。评测正因为难做,才成为竞争资产。
Eval Driven Development(Eugene Yan,2023)和 criteria drift(Shankar 等,2024)出自泛 LLM 评测语境,早已证明评测标准无法在开发前完整前置、评测应驱动系统设计;这两个命题在智能体上被进一步放大。那些争论从未需要回答:谁来搭脚手架、谁来维护环境、谁来付 1100 美元一轮的账单。智能体评测继承了这些问题,并把答案逼进了组织架构。
姚顺雨《The Second Half》(2025 年 4 月)主张 AI 上半场是发明方法、爬 benchmark,下半场应转向定义问题、重新设计评测设置:"evaluation becomes more important than training"。他的理由是智能体特有的:评测默认自动运行,现实里 #agent 全程与人交互;评测默认任务独立同分布,现实里工程师在同一仓库越做越熟。文章写于他仍在 OpenAI 时,五个月后他加入#腾讯,理论先于实践。2025 年 2 月的 "eval as moat" 概念把这场方法论讨论拽进了战略语境。
分析框架:建制 × 可复核
跨厂商对照之后,智能体评测能否成为战略能力,与组织形态精确重合。分数说明不了战略价值。三种组织形态反复出现。
**集中建制。**腾讯把数据与评测合并为一级部门,AI Data 部的职责原文是"大模型数据及评测体系建设",由首席 AI 科学家锚定。评测放在数据部门而非质检部门,发现短板与生产补短板数据在同一条 KPI 下,"评测提了问题、数据没改"的组织摩擦被结构消除,不靠协调。
**双组织共享 OKR。**字节的 #Seed(模型)与 Flow(产品)共享 2026 年度最高优先级目标"攀登 AI 高峰",共建评测回路,火山引擎 B 端 MaaS 在顶层闭合商业化回路。字节是国内自建开源基准数量最多、透明度最高的实验室。
**分布式治理。**Anthropic 设专职 evals 团队拥有基础设施,产品侧贡献任务,eval-driven development 写进官方工程实践。公开方法论是全行业最清晰的:task、trial、grader、transcript 四个基本要素,硬性区分 pass@k(k 次尝试成功一次)与 pass^k(连续 k 次全成功),后者才对应生产可靠性。没有"数据+评测"的集中建制,但方法论与治理渗透最深,RSP 把评测与缩放治理绑定。
对照组两家什么都没有。Meta 的评测能力分散在各团队,Llama 4 刷榜争议由 LeCun 在离开 Meta 后的采访中亲口确认(2026 年 1 月);xAI 没有公开评测方法论,自报分数与独立复测相差约 14 个百分点。两家都停留在团队职能层,都在可信度上付出了代价。
护城河从来不是分数,也不是技术,是建制 × 可复核。分数可以刷,技术可以买,建制与可复核抄不走。
案例深挖:腾讯
十家实验室里,腾讯是唯一一家理论、建制、基准构造、反馈通路四层都有公开证据的。真正的连结者是姚顺雨:他曾立下理论路标,又成为腾讯首席 AI 科学家把理念落地。#姚顺雨 在 OpenAI 主导 Computer-Using Agent(Operator),加入腾讯三个月后官宣首席 AI 科学家,主导 Hy3(2026 年 4 月 preview、7 月正式版),7 月起统管合并后的基础模型部。
五条可执行的构造约束
**分布重定义。**真实 prompt 分布替代 benchmark 题面分布。公开榜题目表述精确、上下文长、单轮为主;真实用户提问模糊、简短、不断追问。改写发生在采样层,决定训练数据构成,不只是报告数字。
**反污染构造。**CL-bench 要求每题所需新知识完全自包含于上下文。消融掉上下文,GPT-5.1 在 CL-bench 上通过率不到 1%;GPT-5.4 在 CL-bench Life 上从 19.3% 跌到 1.7%。靠记忆能答出的题按构造不合格。对比行业通行的"承诺不打榜",这是结构性免疫,且可外部验证(arXiv:2604.27043)。
**rubric 二值判定。**CL-bench 含 31607 条人工评分细则,平均每题 16.6 条,全部通过才算解决,推理轨迹不计分。对应产品语境:只有交付算数,"像不像"不构成判据。
**人进回路。**官方评测工具列四条通道并列:自建题、最新考试、人工评测、产品众测。Hy3 正式版用 270 位专家基于真实工作的盲测。
**边界写明。**公开的"真实评测"仍是专家仿真,CL-bench Life 单例手工制作约 13 小时,不含真实用户轨迹回放。基于真实用户轨迹的评测(元宝灰度、URM)存在,方法论未公开。
媒体转述与官方口径有一处出入。报道说 Hy3 preview 自建"50+ benchmark";腾讯官方表述是 Hy3 在"50 多个业务中获得广泛反馈"。两个"50+"指称不同对象,一个是评测集,一个是业务。
四条反馈通路,强度不一
**产品反馈到奖励模型。**与#元宝 团队深度合作,用 URM(User-Feedback Reward Model)对用户真实反馈建模,RLHF 做细粒度优化。存在性可证实,信号构成与去偏方法未公开。
**rubric 到训练信号。**CL-bench 论文主张把 rubric 转成训练信号、课程式难度递进。没有实施证据。它带着一个未回答的风险:rubric 同时是训练信号和测试标准,自建集会被过拟合,和其他基准一样。腾讯未公开自建评测的训练/测试隔离与污染控制,这是最严重的方法论缺口。
**组织建制。**AI Data 部数据与评测同部门同汇报线,是评测驱动训练最结构化的落地形式。晚点 LatePost 转述姚顺雨内部讲话:混元此前过度追榜,把打榜语料放进训练数据导致污染,新指令是"不要打榜"。去打榜化是对一次具体污染事故的纠偏,重建数据体系是结果,不只是换 KPI。
**发布即评测。**姚顺雨称发布预览版模型的核心目的之一是获取真实世界用户反馈、修复榜单发现不了的底线问题。preview 是受控分布采集实验。
可追踪的指标链条存在:多轮指令遵循内部指标从 17.4% 降到 7.9%;上下文学习 CL-bench 从 19.2 升到 26.7,建 eval 在先、定路线在后的时间顺序可外部核查;工具调用鲁棒性跨脚手架标准差控制在 4 个百分点内。全部为腾讯自报,无第三方复测。
判定:理念与原型之间
从产品网络到数据到泛化的链条,三环可证、一环未证。分布接入可证:Hy3 上线元宝、CodeBuddy、#WorkBuddy、ima、QQ、腾讯文档、腾讯乐享,单一模型团队挂载六类分布。反馈变信号存在,机制不透明。组织契约半公开:官网 Co-design 栏目署名产品侧负责人(co-design 一词由汤道生在 2026 年 6 月 5 日对谈中抛出,姚顺雨接述其中评测环节),姚顺雨自述派后训练最强骨干帮元宝做后训练,可识别的资源让渡。能力迁移与"网络体系"只是主张:姚顺雨称与元宝协同的能力可迁移到 ima 和 WorkBuddy、数据跨产品泛化,没有迁移度量、没有消融实验、数据回流路径与合规边界零披露。他的原话:"怎么把产品数据用好,怎么把回流,怎么把 Eval 做好,有很多细节,我就不赘述"。这句拒绝披露是可核查事实,也是本案例最大的证据缺口。

分层判定:方法论从理念到可复现构造,跑通(证据强);建制化,跑通(中强);eval 到训练指标反馈环,局部跑通(中,全自报);产品反馈到奖励信号,存在但机制不透明(中偏弱);跨产品能力泛化,理念加个案(弱)。
腾讯处在理念与原型之间。制度已立、局部回路在跑、全链路未证。五个缺口:自建评测的训练/测试隔离未公开;内部指标的样本量与口径未公开;跨产品数据回流与合规边界零披露;能力迁移无量化;CL-bench 分数在 preview 自报与正式版二手报道间不一致,官方未解释。
跨厂对照
十家实验室放进"建制 × 可复核"框架,落在四个象限。


**战略层。**腾讯与 Anthropic 走得最远,路径相反:集中建制加产品网络,对比方法论渗透加分布式治理。字节凭共享 Seed×Flow OKR 与开源基准外显,与腾讯并列国内第一梯队;腾讯靠内部超级应用产品网络,字节靠开源基准加 B 端商业化。
**强工程能力,未进战略层。**OpenAI 把 eval 升为"企业 AI 能力"范式(frontier 与 contextual 双层、GDPval 生态化),跑 Specify→Measure→Improve 循环,配四家外部评测方(METR、Apollo、英国 AISI、美国 CAISI),并完成了行业唯一一次制度化弃用:停用自家发明的 SWE-bench Verified、推荐替代品。内部评测归属不透明,战略重心向外,打包能力卖给客户。Google 的评测工具最强(Vertex Eval、ADK 的 in-order match/exact match 等轨迹指标、Gemini Evals Playbook),透明度习惯最好:Gemini 3.1 Pro 文档披露完整口径,还修正了官方 SWE-bench Verified harness 的 3 个 bug,给自家成绩加了 0.6%。评测仍是云平台功能,不是组织级职能。智谱的 ZClawBench 是质量最高的真实场景自建基准之一,取材 OpenClaw 大量真实用例、题库与轨迹公开,AutoGLM 以任务完成度作 RL 奖励;没有披露独立评测部门。Kimi 内部基准群工程扎实,取材内部工程需求与线上事故,对外证明靠第三方匿名榜,无建制证据。
四个工程能力,零个战略职能。
**理念完整,机制滞后。**林俊旸"模型即产品"是全行业对这句理念最完整的表述。2026 年 3 月前,Qwen 与千问 APP 分属不同事业群、无共享 OKR、无商业化 KPI,评测从未成为跨团队能力。重组方向正确,链条仍待证。
**反面样本。**Meta 是悖论。GAIA2/ARE 动态环境平台是技术前沿:800 个真人撰写场景、写操作验证器与人类标注一致率 0.98、评测信号直接喂 RLVR 训练(arXiv:2509.17158)。Llama 4 发布侧制造了 2025 年最大的刷榜争议。随后 Muse Spark 的评测觉察率(模型识别出自己正在被测的概率)公开基准上 19.8%、内部评测 2.0%,差约 10 倍,Apollo Research 独立确认。技术前沿与评测失范同厂并存,恰好演示了建制有和没有的区别。xAI 是第二个样本:自报与独立复测相差约 14 个百分点,加上 Business Insider 披露的 WebDev Arena 刷榜。没有公开方法论的自报数字直接消耗信任。
DeepSeek 没有公开评测装置,模型层曾被 SuperCLUE 指出训练数据与评测数据重叠。Qwen 与 Kimi 的自报成绩对脚手架依赖明显,同一模型在不同评测设置下差 10 分以上。国内第三方评测(SuperCLUE、OpenCompass、FlagEval)全部停留在外部被评角色,没有一家与实验室共建 agent 基准,这是国内评测口径统一的结构性限制。
证据边界
引用的每个内部指标都是自报,没有一个被第三方复测。腾讯的 17.4% 到 7.9%、19.2 到 26.7、4 个百分点内都算。关键方法未公开:URM 信号构成、训练/测试隔离、数据回流路径。外部评测方的合作机制(METR 不收报酬、实验室提供算力)只有 OpenAI 一家在系统卡片层面完整披露,其余实验室的外部安排不可见。
"建制"的判断依据组织架构公告、官方工程博客、可核查的对谈实录。对没有公开建制证据的实验室,结论是"无证据",不等于"不存在"。置信度:一手官方与学术来源为高,官方但间接或第三方转述为中,单一非权威来源不进论据链。
可复核有一个未解决的问题:Apollo Research 以评测觉察度过高为由拒绝对 Anthropic Opus 4.6 出具正式对齐评估,而 Anthropic 是跨厂对比里方法论最透明的实验室。模型知道自己在被评测并调整行为,这个问题没有实验室解决过。
结语
两样东西让评测成为护城河,也正是开头的两个变量:建制 × 可复核。建制,把评测从团队职能变成组织能力,决定评测发现的问题能不能变成训练数据的修复动作;可复核,把评测从内部叙事变成外部信任资产,决定分数有没有人信。没有建制的评测技术(Meta)不会自动升级,没有可复核的评测分数(xAI)不会复利。
从业者的最小可用配置由此收敛成三件:私有任务集,从源头切断训练记忆;细则化判分,确定性判分器优先、LLM 评委兜底;多跑统计,报告均值与方差,单次运行 2 到 3 个百分点的提升与噪声不可区分。这三件把评测从一次性考试变成可累积、可复核、可追责的资产。技术先进与否不是决定因素,先建的人复利更早。
格局未定。腾讯全链路未证,Anthropic 缺集中建制,字节 B 端回路刚闭合,OpenAI 内部归属是黑箱。这个判断的失效条件:某家厂商把外部评测合作做成行业强制标准,或 AI Act 类监管把评测审计变成市场准入要求,建制的相对优势会被合规拉平。在那之前,评测是少数实验室真正拥有的战略能力,其余实验室拥有的是分数。
来源索引
按对论证的承重程度分四组。核心证据均为一手公开可复核来源;中文二手转述已标注,仅用于组织信息与发言佐证。
核心证据(承重论断,一手可复核)
-
OpenAI,SWE-bench Verified 停用审计,官方博客(2026-02)→ 支撑"旧基准结构性失效"
-
UC Berkeley RDI,Agents' Last Exam:arXiv:2606.05405(2026-06)→ 支撑"基准分与落地能力差距"
-
GAIA 基准报告:裸模型 44.8% vs 带脚手架 74.6% → 支撑"系统分数≠模型分数"
-
《On Randomness in Agentic Evals》:arXiv:2602.07150(2026-02)→ 支撑"评测方差"
-
CallSphere 实测(2026-05):完整 SWE-bench 单轮 480-1100 美元 → 支撑"动态评测成本"
-
HORIZON 研究(2026)+ METR 时间视界报告(2025-04)与 RE-Bench(2024-11)→ 支撑"长时程可靠性结构"
-
腾讯 CL-bench:arXiv:2602.03587 / arXiv:2604.27043;GitHub Tencent-Hunyuan/CL-bench → 支撑"反污染构造"
-
Meta ARE/GAIA2:arXiv:2509.17158 → 支撑"Meta 技术前沿与失范并存"
-
Meta Muse Spark Safety & Preparedness Report(2026-04),Apollo Research 第三方确认 → 支撑"评测觉察率 10 倍差距"
-
vals.ai 复测:Grok 4 独立 58.6% vs 自报 72% → 支撑"xAI 自报落差"
谱系与语境
-
姚顺雨《The Second Half》:ysymyth.github.io/The-Second-Half/ (2025-04-10)
-
Eugene Yan,EDD 命名:eugeneyan.com/writing/llm-patterns/
-
Garry Tan "evals are the real moat":x.com/garrytan/status/1892952656940880036 (2025-02-21)
-
Shankar 等 criteria drift:arXiv:2404.12272(UIST 2024)
-
Anthropic《Demystifying evals for AI agents》:anthropic.com/engineering/demystifying-evals-for-ai-agents (2026-01-09)
腾讯锚点(官方与对谈实录)
-
Hy3 preview:hy.tencent.com/research/hy3-preview (2026-04-23)
-
Hy3:hy.tencent.com/research/hy3 (2026-07-06)
-
汤道生×姚顺雨对谈实录:new.qq.com/rain/a/20260605A084EM00 (2026-06-05)
-
AI Data 部职责:2025-12-17 腾讯架构调整报道(多家媒体交叉确认)
厂商佐证(部分为中文转述,中置信度)
-
OpenAI evals-drive-next-chapter:openai.com/index/evals-drive-next-chapter-of-ai (2025-11-19)
-
OpenAI GPT-5 System Card(四家外部评测方:METR/Apollo/UK AISI/US CAISI)
-
Google Vertex AI Evaluation / Gemini Evals Playbook
-
Meta Llama 4 刷榜:LeCun 2026-01-02 采访确认
-
xAI WebDev Arena 刷榜:Business Insider 调查报道
-
智谱 ZClawBench:docs.z.ai/guides/llm/glm-5-turbo (2026-03-16)
-
林俊旸"模型即产品":AGI-Next 2026 圆桌(2026-01-11)
-
字节 Seed×Flow / 梁汝波 OKR:腾讯新闻 2026-07-02;字节 Seed 官方博客
-
Kimi 基准群:kimi.com/resources/kimi-k2-7-code (2026-06)
置信度说明:高=一手官方/权威媒体可复核;中=官方但间接或第三方转述。所有厂商内部指标均按自报口径处理。
关注我,一起交流👇
边界层笔记