谁在给大模型出题、卖题、判卷:一门 300 亿估值的生意,和它正在漏掉的部分
摘要 :AI 数据公司 AfterQuery 五个月估值涨 10 倍,突破 32 亿美元。这门生意在卖什么?本文对照伯克利 Agents' Last Exam 公开数据与2026 年行业报道,拆解数据公司从"人工标注"转向"专家推理过程"的商业逻辑,并指出一件被估值掩盖的事实------顶级 Agent 在真实专业任务上的通过率仍低于 1%。垂直行业的数据困境不在技术,而在授权与专家时间。 > > 关键词:AI 数据, 强化学习环境, Agent 评测, 数据污染, 专家网络, 后训练
📋 目录
- [📋 一、先看一组刺眼的数字](#📋 一、先看一组刺眼的数字) - [⚙️ 二、数据公司到底在卖什么](#⚙️ 二、数据公司到底在卖什么) - [📊 三、Rubric 与环境:两道不同的题](#📊 三、Rubric 与环境:两道不同的题) - [⚠️ 四、评测、卖数据、刷榜:边界在哪](#⚠️ 四、评测、卖数据、刷榜:边界在哪) - [🎯 五、垂直行业的数据困境,不是技术问题](#🎯 五、垂直行业的数据困境,不是技术问题) - [💡 六、数据污染:正在发生的两类失效](#💡 六、数据污染:正在发生的两类失效) - [🚀 七、留给专业领域的机会窗](#🚀 七、留给专业领域的机会窗)
📋 一、先看一组刺眼的数字
先不谈商业模式,先看一组更硬的数据。
2026 年 6 月,伯克利 RDI 发布了 Agents' Last Exam(ALE)------一个面向真实专业工作的智能体评测基准。它的规模是这样的:
| 维度 | 数值 | 来源 | |---|---|---| | 覆盖子行业 | 55 个(按 O*NET/SOC 2018 职业分类) | 官方项目页 | | 任务池总量 | 1,500+(目标 5,000) | arXiv:2606.05405 | | 公开任务 | 147 个(ALE-V1) | GitHub 官方仓库 | | 参与专家 | 300+ 位行业专家,44 家学术机构 | 官方致谢 | | 合作机构 | 高盛、摩根士丹利、摩根大通、PIMCO、Meta、Adobe 等 | 官方致谢 |
然后是这个数字:
在最难档(last-exam tier)上,包括 Fable 5、GPT-5.5、Composer 2.5 在内的所有前沿 Agent,平均完整通过率低于 1%。
对照组更能说明问题。在 ALE 的命令行子集 ALE-CLI 上,表现最好的 Agent 通过率 25.2%;而在 Terminal-Bench 和 SWE-bench-Pro 上,同样的系统能做到 82.0% 和 59.1%。
同一批模型,同一批评测框架,代码类任务接近饱和,真实专业任务几乎全军覆没 。
而在公开代码榜单上刷到 80%、90% 的模型,扔进真实工作流里连 1% 都过不了。这道落差,就是本文要拆的东西。⚙️ 二、数据公司到底在卖什么
💰 2.1 估值从 3 亿到 32 亿,发生了什么
AfterQuery 是最能说明这门生意热度的样本。
| 时间 | 事件 | 数字 | |---|---|---| | 2025 年 2 月 | Spencer Mateega(23)与 Carlos Georgescu(22)创立 | 仍是两个大学生,无产品 | | 2026 年 4 月 | A 轮融资 | 3,000 万美元,投后估值 3 亿 | | 2026 年 9 月 | 新一轮(据 Forbes 报道,未完成) | 估值 32 亿 ,五个月涨约 10 倍 | | 2026 年 7 月 | Mateega 公开表示 | 年化收入已达 1 亿美元(4 月披露时)的数倍 |
YC 合伙人 Gustaf Alströmer 称其"从成立到独角兽最快",全程约 18 个月。
同期同行的数字:Scale AI 在 Meta 2025 年 6 月入股时估值超 290 亿美元 ;Mercor 2025 年 10 月融资估值 100 亿美元,2026 年 8 月据 The Information 报道正与英伟达洽谈 200 亿美元估值。
🔍 2.2 但他们卖的不是"标注"
最初的 AI 数据生意是众包标注:给图片分类、给回答打分。Scale AI 靠这套做到了 Alexandr Wang 成为行业第一位亿万富豪。
现在卖的东西完全变了。 AfterQuery 的做法是:付费请医生、律师、工程师、财务分析师,把他们解决专业问题的完整推理过程 写下来,再拿这些逐步记录训练模型的判断力。
创始人的原话是"将世界顶尖从业者的模式、决策与推理过程加以程式化"。平台目前聚集近 10 万名经过验证的专业人士,团队约 30 人。
商业上的验证来自一个具体案例。英伟达 2026 年 6 月发布 Nemotron 3 Ultra 技术报告,使用了 AfterQuery 提供的办公与职场任务数据。在一项消融实验中,加入这批数据后,模型在 GDPval 上的分数从 35.3 提升到 46.7。 AfterQuery 是该报告中唯一被点名的数据合作方。
GDPval 覆盖美国 GDP 最大的九个行业、44 种职业、1,320 项真实工作任务。
🏷️ 2.3 这个行当其实有四种基因
硅谷 101 那期对谈里,Scale AI 的何允中把数据公司分了类,这个分类比"谁家标注质量高"有用得多:
| 类型 | 代表 | 核心资产 | |---|---|---| | 招聘出身 | Mercor、Handshake | "短时间内找到足够量专家"的专家网络 | | 传统众包数商 | Scale AI | 不只数据,还有人 ------积累的质检经验 | | 研究工程新秀 | Bespoke Labs | 代码或工具调用的环境 | | 数据经纪人 | 掌握版权素材或行业关系的人 | 独家素材 |
一个关键判断藏在分类里:专家是自己培养的全职员工,还是网络灵活招募,决定了产能、质量和质检方式。人员越灵活,统一质量越难保障。
这个区别对任何要做垂直领域数据的人都是核心问题------自有专家团队慢但可控,外包网络快但会垮。📊 三、Rubric 与环境:两道不同的题
🎯 3.1 数据交付物已经从"单条回答"变成"整套任务"
这是本期对谈信息量最大的判断,来自何允中:
现在 Agent 不只回答文字,还会修改数据库、调用工具、生成文档或操作应用。数据交付物因而变成一整套任务:它在什么环境中工作、能用哪些工具、有何沙箱、怎样验证结果。
于是后训练数据至少分成三类,用途完全不同:
| 数据形态 | 验证方式 | 适用 | |---|---|---| | 正确答案清楚 | 确定性检查(程序化测试) | 监督微调 | | 带 rubric(评分标准) | 专家标准 + 弱验证模型 | 强化学习 | | 带环境 + 轨迹 | 环境奖励 + 防reward hacking | 长程任务训练 |
数学和代码较容易得到对错信号;医疗、金融、历史问答或指令遵循可能有较好答案,但无法只靠字符串匹配。
📏 3.2 Rubric 是把隐含判断写成标准
专家可以把判断写成 rubric------类似教授给助教的阅卷标准。逻辑是:弱一些的验证模型只需按专家标准检查,就有机会监督更强的生成模型 。前提是专家真正把隐含知识表达出来。
但孙一铀(伯克利 ALE 研究者)明确不同意"rubric 已经做尽了":
工程产出可能有多种正确解法,游戏也不只一个合格成品。若评测只拿一个标准答案比对,正确但不同的输出会被误判。
这是多解问题,工程和游戏领域特别明显。
🔄 3.3 两者的分工:环境提供行动空间,rubric 判断质量
孙一铀的一句话把关系讲清了:
环境是 Agent 执行工作的地方,rubric 是评价它做得怎样的方式,两者并不对立。
两者的边界还在演进:随着 Agent 承担更大项目,人的角色从执行转向决策,评价决策就更难------上市公司的战略选择每天都在变,无法像检查代码那样收集固定标准答案。
未来的数据可能需要记录当时做决定的背景、约束和过程,而不只是交一个结果。
⚠️ 3.4 一个容易被忽略的技术前提
何允中提到一个约束,值得单独拎出来:
rubric 与验证器合起来必须带有比待训练模型更多的知识,否则难以提供有效监督。
这是一条硬性要求:验证器不能比被验证的模型更笨。用弱模型监督强模型,前提是弱模型的知识足够覆盖评判标准。这也解释了为什么"专家"不是可选项------专家的价值不在于标注便宜,在于他真的知道答案。
⚠️ 四、评测、卖数据、刷榜:边界在哪
🚫 4.1 核心矛盾:设计评测的人也知道怎么提分
这件事的结构性矛盾在对话里被摊开了。
做评测与卖训练数据很接近,而懂得设计某个领域评测的人,通常也知道哪些数据可以帮助改进 ,所以商业需求自然出现。
何允中的区分很清晰:
针对一个有意义的能力维度训练,与把试卷直接交给考生,是两回事。
孙一铀更直接:
我认为评测题本身不能拿去卖给训练方,否则评测权威和后续模型比较都会受损。
他的补充也重要:ALE 第一版很多题在发布时几乎没有模型做得出来,这不一定使评测失效------长期任务本来就需要为未来能力留空间。并且刷榜不一定是贬义词:如果榜单足够贴近真实工作,针对它提高成绩可能会改善用户体验。问题在于是否污染测试集,以及分数能否迁移到别的任务。
📐 4.2 判断评测好坏的两条路径
何允中给了个可操作的判据:
| 路径 | 说明 | 例子 | |---|---|---| | 路径一 | 揭示重要的通用认知缺口,改进后能带动多个任务 | 抽象推理类基准 | | 路径二 | 对应很多用户真正关心的场景,即使范围窄也有价值 | 个人助理类评测 |
按这两条路径看,ALE 属于路径一,但补上了 ALE-CLI 这样的命令行子集,算是往工程落地靠。
⚠️ 4.3 榜单流行有偶然性
一个容易被忽视的机制。硅谷 101 团队做过 SWE-Atlas,包含代码仓库问答、重构、测试等不同部分------较早发布的问答部分先被第三方评测平台收录,于是突然吸引更多训练关注,更复杂的部分未必同样显眼 。
何允中的结论:
公开技术报告里常出现哪些榜单,不完全反映研究价值。
🎯 五、垂直行业的数据困境,不是技术问题
🔒 5.1 代码能规模化,医疗芯片不能
何允中解释了差异的根源:
代码行业有大量公开素材,技术团队又懂软件,少数工程师可以较快生成许多环境。但后训练数据至少有两道工作:先采购原材料 ,再把它加工成模型可训练、可验证的任务。
| 领域 | 卡在哪里 | |---|---| | 代码 / 工具调用 | 公开素材丰富,技术团队懂软件,能快速生成环境 | | 芯片设计 | 涉及商业软件许可(EDA 工具) | | 云运维 | 要模拟 AWS 一类系统 | | 医疗病例 | 涉及敏感信息 | | 私有代码库 / 企业工作流 | 权利与授权 |
"私有代码库、专业数据库、企业工作流的权利与授权,可能比写任务脚本更难。"
这是整期对谈里对做垂直领域的人最重要的一句话。壁垒不在技术能力,在法律与商务谈判。
💰 5.2 一个具体的数字:数百万元的源码
孙一铀给了个很具体的例子。他们研究生命科学领域工作流时,按子学科把任务树展开,发现现有公开评测只触及很小一部分。
某个游戏开发项目若需要真实游戏源码,版权所有者可能开出数百万元 的价格。
而且学术和商业的定价结构完全不同:
| 合作方式 | 吸引到的专家类型 | 成本结构 | |---|---|---| | 学术合作(署名 + 共同研究) | 学者 | 吸引力来自学术声誉 | | 商业购买(按小时) | 资深工程师 | 时间定价,成本显著更高 |
🏢 5.3 数商与模型实验室的关系:既竞争又共生
孙一铀认为学术署名、共同研究和商业时薪吸引到的人不同,各有作弊风险 ,不能互相替代。
何允中则给出了大实验室做这件事的战略动机:实验室同时向企业派驻人员和索取数据,企业会担心利益冲突。自产与外采可以并存。
💡 六、数据污染:正在发生的两类失效
🔍 6.1 OpenAI 停止报告 SWE-bench 的原因
SWE-bench Verified 分数被停止报告,公开理由有两点:测试脚本可能误判功能正确的解法 ,以及模型可能在训练中见过某些开源修复 。
何允中把"数据污染"拆成了四类,这四类的排查成本差别极大:
| 类型 | 性质 | 排查成本 | |---|---|---| | 题目本身不清楚 | 题目质量问题 | 低 | | 测试要求过严 | 题目质量问题 | 低 | | 问题无解 | 题目质量问题 | 低 | | 训练材料泄入测试集 | 污染 | 公开代码容易查;专业任务难 |
关键差异在最后一行:
公开代码被模型提前接触,相对容易查;专家提交的专业任务若根本没做过、却编得很像真的,可能要另请同领域专家花几周验证,成本高得多。
🎄 6.2 一个更隐蔽的失效:专家投稿造假
ALE 确实遇到过这种情况:
ALE 确实遇到过少数为取得作者署名而用 Agent 合成大量低质、甚至编造材料的投稿。
署名能吸引专业人士,也会改变投稿动机;按时薪付款同样可能诱发敷衍。
孙一铀的结论很直接:
研究者不仅要审答案,也要设计提交过程和复核机制,让造假比认真完成更难。
何允中补充了一条:不能简单要求一个验证者说"正确"就结束,因为验证者也有激励 。
@@IMG_LOCAL_mermaid-1.png@@
🎮 6.3 Reward hacking:最该被认真对待的失效
何允中给的方法论值得记下来:
可以让更强模型或专门的红队尝试作弊,并同时检查完成质量、使用步数和 token 预算。
只看最终分数不够,必须同时监控"完成质量 + 步数 + token 预算"三个维度 ------ 因为走捷径的解法通常更短更省。
🚀 七、留给专业领域的机会窗
💡 7.1 这门生意的终局判断
何允中给出的结论很清醒:
未被整理成任务的专业知识仍然很多,市场可能继续扩大;但竞争者增加、模型能力变化快,靠某类现成题长期收钱会越来越难。数商更像研发公司......它不能像拥有庞大用户网络的平台那样轻易吃老本,能否形成持续发现问题的研发飞轮 更重要。
翻译一下:卖数据集的生意在退,做研究的公司在进。
孙一铀的补充指出了下一版的真实瓶颈:
困难不仅在写评测,还在获得真实、高质量的专业项目与专家判断。
🎯 7.2 对做垂直领域 AI 的人意味着什么
把这一期的判断落到实际操作上,可以得到几条:
| 启示 | 依据 | |---|---| | 数据壁垒在授权,不在技术 | 真实源码可能开价数百万元;私有数据库的权利比写脚本更难 | | 专家时间是最贵的成本 | 学术靠署名,商业按时薪,成本结构完全不同 | | 先把判断标准写出来,再谈数据量 | rubric 必须比被验证模型知识更多 | | 自建专家团队 vs 外包网络要早定 | 人员越灵活,统一质量越难保障 | | 验证要监控三个维度 | 完成质量 + 步数 + token,防 reward hacking | | 从现在开始建评测 | ALE 第一版很多题发布时几乎无人能过,是刻意为未来留空间 |
最后一条最容易被忽略,也最重要。伯克利把 1,500 个任务锁在私有池里、每约 6 个月轮换一次公开集,就是为了防止污染。这说明评测建设的时间尺度是年,不是季度 ------ 等你想建的时候,公开领域的数据已经被采完了。💬 你手里最难拿的那类数据是什么?
这一期最实在的收获,其实是那句"权利与授权比写脚本更难"。
想问你:你正在做的领域里,最难拿的那类数据,是权属问题还是没人愿意写?
这两种障碍对应的解法完全不同 ------ 前者是谈判,后者是激励设计。评论区说说具体卡在哪,我按类型帮你拆。出处说明:本文根据《硅谷 101》E253 期(主持人 Yiwen 对话 Scale AI 后训练与评测研究负责人何允中、伯克利 Agents' Last Exam 研究者孙一铀)内容整理并扩展,节目全长约 58 分钟。文中数据分别来自:ALE 官方项目页与 GitHub 仓库、arXiv:2606.05405 论文、AfterQuery 官方公告与 Forbes 报道(经 BigGo 财经、bnext 转载核实)、英伟达 Nemotron 3 Ultra 技术报告(消融实验数据)、Mercor 与 Scale AI 融资报道。文中对嘉宾观点的转述保留了"当时说法"的性质,未经二次确认的行业数字未作为结论使用。
