裁断为什么没有变便宜
作者:龍德明宇
新的黄金时代系列篇三
导读
生成与验证的价格分了家:前者坐上指数下降的电梯,可机械化的验证跟着在降,只有裁断没有同步降价。裁断的价码从来不是算力,是一个人肯押上自己。
AI 能用密钥给结果签名,却签不了自己:密钥可以吊销、更换、复制一百万份,而现实世界的重力,只能由长着肉身、时间不可逆的存在来承受。制度能分担它,但链条尽头仍是人。
81 年前,布什把美国科学的天花板定在科学家的数量上;81 年后,我的读法是:天花板换成了肯在模糊处说「这个可信」的人。
一、两句话,隔了 81 年
判断一个时代,看什么在降价、什么在涨价,往往比看新闻更准。
过去几年,很多脑力劳动的价格在跳水:写程序、画图、起草论文,这些曾经按周计费的能力,如今在很多场景下几乎不要钱。但另一些东西不降反升:请一位真专家看一眼结果、说一句「这个可信」,比十年前更难得。
至少在我的观察里,这不是错觉。2026 年 7 月 21 日,白宫科技政策办公室(OSTP)主任迈克尔·克拉齐奥斯呈交了一份报告,名字起得很满,《科学:新黄金时代》。在报告总摘要的行动清单里,有一句不起眼但分量很重的话:
「While the cost of generation has decreased exponentially, the cost of verification has not.」(生成的成本已经指数级下降,验证的成本没有。)
先把两个词说成人话。生成,是科学里「做出来」的那一半:出想法、设计实验、写出结果。验证,是「查清楚」的那一半:这个结果对不对、可不可信、值不值得信。报告说,前者的价格在崩塌,后者纹丝不动。这是报告的总体判断;到第三章会看到,它在可机械化的部分并不成立。报告还补了一句:「Science works only if we can generate and verify knowledge in tandem.」(科学要运转,唯当生成与验证并驾齐驱;第五章)一双脚,一只在飞,一只陷在泥里。
单看这句话,不算稀奇。稀奇的是把它放回 81 年前。
1945 年 7 月 5 日,另一份报告摆上白宫的案头:范内瓦·布什的《科学:无尽的前沿》。那是二战刚结束时布什给美国规划战后科学的纲领性文件,后来催生了美国国家科学基金会(NSF)。它的第四章,讲怎么为科学续上人才的那一章,同样压着一句定调的话:
「The real ceiling on our productivity of new scientific knowledge ... is the number of trained scientists available.」(我们产出新科学知识的真正天花板,是可用的、受过训练的科学家的人数。)
1945 年,布什盘点家底,发现最贵的东西是人。会做研究的头脑,培养一个要十几年,战争又烧掉了一批,所以整份报告的药方说到底是政府出钱养人:设奖学金、建基金,让能力而不是家世决定谁受教育。
把两句话并排放,就能看见一次安静的搬家。
1945 年,瓶颈是「会生成的人」,稀缺的是科学家本身。2026 年,AI 加入了生成的队伍,会生成的不再稀缺,瓶颈挪到了验证。81 年里,稀缺的东西从「人本身」,搬到了「人的最后一个动作」。
把话说诚实:这一层是我的读法。2026 年的这份报告,自己开出的瓶颈清单并不是验证,而是三样更硬的东西:反馈的速度:有些观测,再多智能也变不出来;原子的速度:细胞按自己的节律分裂,火箭不会一夜造好;还有制度本身。报告甚至断言:智能越丰饶,进步的约束越是从「生成想法」挪向「在物理世界把想法实现」。这是报告的字面答案。而「瓶颈是验证、验证的内核是人」,是我的读法。支撑这个读法的,是报告自己在别处留下的账:它一边说验证成本没有降,一边把复现危机的数字、验证基础设施的设想、「结果模糊时留给人」的判断位,写满了整个第五章。三重约束管的是科学能跑多快;跑得快的东西可信不可信,最后还是要有人接。
这里要把「验证」这个词的分量说足。它在科学里不是一个复查动作,而是科学共同体做最终判断的制度形式:论文要过同行评审(请同行专家把关),实验结果要能被别人复现,药物要过临床试验。这些制度千差万别,目的只有一个:替整个共同体回答一个问题,这个结果,我们信不信。
我把这个动作的内核叫「裁断」:判断什么可信、什么值得继续、什么错了该回头。验证是裁断的流程和制度,裁断是验证的心脏。
验证变贵,还有量上的原因:生成泛滥了。一年一百篇论文时,验证的队列消化得动;AI 让一天一百篇成为可能,队列开始爆炸。报告在别处提醒过一个风险,用的比喻是森林防火:压抑小火灾,会换来更大的燎原。个体的收益,不会自动加总成集体的进步(individual gains do not automatically aggregate into collective progress),验证这笔公共欠账压到最后,是要连本带利还的。
AI 既然能生成,按直觉也应该能验证,两边价格为什么没有完全一起跌?写报告的人自己知道这个问题,也开出了药方。先看药方,再看一个不利的案例,最后到最深的那一层。
二、报告的药方:把验证做成系统
先交代药方为什么必须开:验证的欠账,已经堆成一场公认的危机。
报告第五章有一节叫「金标准科学」,先摆了一组数字:在心理学领域,一半到三分之二的复现尝试以失败告终;在实验经济学里,超过三分之一的已发表结果没能被复现出来;在临床前生物医学(指进入人体试验之前、在细胞和动物身上做的研究)领域,仅美国,不可复现的研究每年造成的误导性花费就估计约 280 亿美元。这些是报告引用的研究估计。
什么叫不可复现?你把论文里的实验照着再做一遍,做不出论文声称的结果。如果一半的论文都复现不出来,「已发表」三个字就不再等于「可信」,科学的知识账本本身就是乱的。
药方的第一味是标准。2025 年 5 月,白宫签发一道行政令(美国总统签署、对联邦机构有约束力的指令),名字直译过来是「恢复金标准科学」,共九条原则,方向是把可复现、透明、可证伪(意思是原则上能被一个实验推翻)这些要求,从科学家的自觉变成制度的标准。这道令做的事,是重新定义「什么样的结果算合格」;得失本身,不是本文要评的。
第二味是工具,报告配了一整套。其一,验证基础设施:把数据、代码、实验流程通过开放接口开放出来,让验证不必打电话求人、排半年的队。其二,机器可审计的复现包:论文交出去时附带一套完整材料,程序能自动检查,谁想查让程序去查。其三,复现奖金:直接为「把别人的结果重做一遍」付钱,让验证从科学界的义务劳动,变成有报酬的工作。
第三味是自动化。报告设想让 AI 代理(agent,能自主执行任务的程序)参与验证:解析论文、重建实验、执行、比对。报告为这个方向写了一句很见决心的话:
「we must also build its necessary counterpart: a verifier equal in rigor and scale.」(我们还必须给它配上一个搭档:一个在严谨与规模上都跟得上的验证器;第五章「金标准科学」节)
顺着设想再往前走,报告甚至预见了某种验证市场:AI 代理自主组织实验、复现结果,验证者领赏,「挑错」本身变成市场里的一种生意。
药方不可谓不全。但药方自己留了一个结构性的口子。
把验证交给机器系统,马上冒出一个问题:谁验证验证者?机器检查机器,检查机器的机器又归谁检查?一层套一层,没有头。
但这个无穷后退,仔细看停得住。我的说法是:**验证是一座金字塔。塔基是数据、代码、复现包,越往下越机械,越能交给机器;它们并非绝对无误,芯片有缺陷、内核有过漏洞,但广泛的复用把塔基兜到了「不必再逐层向上追索」的程度。金字塔必须有顶,顶上锁着一个可问责的主体:成熟处可以是机构,前沿处只能是人,因为无论锁在哪一层,链条的尽头都是会输的人,只有到了那里,「可信」两个字才有人负责。**报告自己也把这句话留在了深处:结果模糊时,提供判断的是人类专家。模糊处,留给人。
不过,这个判断刚说出口,就撞上了报告自己举的一个案例。初看之下,它把「验证没有降价」这句话当场打翻了。
三、一个数学案例,看起来打翻了结论
先交代背景。数学界近年有一个方向叫「形式化」:把定理的证明翻译成计算机可以逐步检查的严格语言,每一步由机器核对,不靠人眼盯。粗略说,就是把证明写成一本账,让程序逐行审计:账查完了,对就是对,错就是错,没有讨价还价的空间。
报告第五章举的例子是这样的:2024 年初,陶哲轩和几位数学家发起一个项目,尝试把素数定理的证明形式化(素数定理是数论的基本定理之一,说的是素数在自然数中分布得有多稀疏)。此后一年半里,据项目公开记录,二十多位数学家先后加入,把素数定理的普通版本形式化完成;带误差项的强版本,卡在了复分析的难点上。据该公司公布,2025 年 9 月,一家名为 Math Inc 的初创公司用它的 AI 系统 Gauss 接手,三个星期,交付了约 25000 行 Lean 代码、约 1100 条定理与定义。
人类卡了一年半的难关,AI 三个星期补完了。如果验证的价格是这样跌的,前面那句「验证成本没有降」,不就站不住了吗?
报告自己也知道这个案例的分量,跟着写了一句很有野心的话:
「Wherever checking an answer is easier than finding one, AI stands to reorganize not just scientific discovery, but the social structures that govern who does it and how.」(凡是检查一个答案比找到它更容易的地方,AI 都不仅将重组科学发现本身,还将重组决定由谁来做科学、怎么做的社会结构。)
细看这个案例,会发现降价的东西不叫「验证」,叫「形式化验证」:那些能写成完全明确的规则、机器可以逐步检查的部分。数学在这里是个特区:数学证明对错原则上可以机械地检查,这正是「形式化」可行的前提;检查比寻找容易,AI 在这样的地方自然所向披靡。
但科学的大部分不在特区。一个生物实验的结果对不对,没有一份能逐步核对的「证明」;一次临床试验可不可信,取决于样本设计、混杂因素、利益冲突,这些不是一道程序能跑出来的。
更关键的是,即便在数学特区内部,也有形式化碰不到的东西,而且项目自己就把它写在了明面上:人类数学家为整个工程提供蓝图,关键引理由人类审阅;据该公司介绍,Gauss 每一轮迭代约 95% 自主完成,剩下那 5% 需要人参与。留在人手里的那 5%,恰恰是要害。还有一层更细的隐患,形式化数学的资深实践者凯文·布扎德(Kevin Buzzard)提醒过:证明检查器验证的是「证明忠于命题」,验证不了「命题忠实于数学家真正想问的问题」。命题要是被悄悄写歪了,机器会一丝不苟地检查一个错误的问题。1100 条定理与定义里,哪条重要?哪条值得花三个星期?形式化做成了,结果可信到什么程度,敢不敢把自己的名声押上去?这些问题,形式化本身不回答。决定「什么值得形式化」的那个动作,没有跟着降价。
所以这个反例消化之后,论点不但没有软化,反而更硬了:降价的,是可机械化的部分;没有降价的,是裁断。特区的降价,恰好把特区的边界照了出来。
四、裁断的价码:押上自己
现在正面回答:裁断为什么没有变便宜?
先要把一个容易误会的东西拿掉:裁断的核心,不是算得准。计算概率、比对数据、挑出模式,这些机器会越做越好,AI 在蛋白质结构预测上已经证明了这一点;如果一项判断可以完全化约为计算,那它迟早属于机器,这里不必为它恋战。裁断真正的动作,在计算结束之后才开始:不确定性消不掉,几条路各有胜算也各有代价,总得有人选定一条,并把选错的后果接下来。置信度停在 85%,数亿美元的三期临床做不做?造价百亿的对撞机建不建?这一步不是算,是选:选的甚至不是哪条路更可能对,而是哪种错由谁来承担。
先看生成为什么便宜。生成的成本是机器成本:算力、数据、电费,随技术进步指数下降,价格就跟着一路向下。形式化验证的成本也是机器成本,所以它在特区里也一路向下。
但裁断不一样:它的价码从来不是机器成本,是判断者自己的命运。
一位药理学家看完数据,说「这个药是安全的」。这句话的分量,不在于他分析过多少数据,而在于如果药出了事,他的职业生涯、他的名字、他后半生攒下的全部信任,都要跟着赔进去。一位导师说「这个学生值得十年培养」,他押上的是自己看人的声誉。一位审稿人写下「建议发表」,他押上的是自己在领域里的信用。这些动作的共同点是:判断错了,代价落在判断者本人身上。正式一点说,这叫「生存性代价」:会落到你这个存在本身头上的代价。
一个判断之所以是你的判断,是因为你为它押上了只有你能押的东西。别人替你判断,代价就不在你身上了;而没有代价的判断,在科学里不值钱。
这里得诚实地补一笔,免得把现状说得太美:抵押的逻辑是科学的理想账本,现实里的签字早就大量贬值了。「不发表就出局」的压力之下,挑数据、水论文层出不穷,终身教职又挡住了许多本该兑现的代价。第二节那笔每年 280 亿美元的账单,就是签字贬值开出的收据;真正付账的,常常是扑进去颗粒无收的年轻博士。所以准确地说:不是每个人类都在押上自己,而是这套制度只有在有人真的押上自己时,才运转得住。现实危机恰恰证明,肯押上自己的人早就是稀缺品。而 AI 的洪流把这件事逼到了明处:平庸的生成泛滥成灾,共同体退无可退,只能重新清点:哪些签字背后,真的站着抵押。
这里要请出系列一直在用的那对概念。正主体性:人在乎、人选择、人做最终判断,做判断就是押上自己------对了是声望,错了是代价。负主体性:AI 只提供参考、执行、做统计预测,不做最终判断,因为它没有可以押上的自己。
人类能够成为正主体,注意,是「能够」。不是每个署名背后都真站着押上自己的人,签字贬值的现实已经说明,正主体性是一个要自己坐进去的位置,不是出厂设置。AI 是负主体。这个区分落在验证这件事上,非常具体:AI 可以生成、可以统计、可以算概率,但它给不出一个可被押上的「自己」。它判断错了,不会少活一天,不会失眠,不会在学术会议上被人记住:就是它,当年说这个药安全。有人会反驳:AI 也可以被设计成付代价的,比如在智能合约里押一笔保证金,输出假结果就被自动罚没。这是真的,这类机制正在被试验。但那些代价全在系统之内:保证金罚没了可以再充,算力配额注销了可以再申请,模型权重归零了可以再训练。系统内的代价,可设计、可重置、可再来一局。AI 付得出的,是系统内的代价;付不出的,是落到存在本身头上、无法重置的那一种。
这就是裁断不降价的全部秘密。
生成的价格由机器成本决定,机器成本有摩尔定律(芯片性能指数提升的老规律),一路向下;裁断的价格由「有人肯押上自己」决定,而肯押上自己的人,不会因为芯片升级而自动变多。
这不是教科书意义上的供需曲线,裁断也没有挂牌价。真正在发生的是稀缺的迁移:生成便宜到泛滥之后,稀缺没有消失,而是向一个位置集中:哪些签字背后,真的站着肯负责的人。这也正好把标题咬住:变便宜的,是验证里可机械化的部分;没有变便宜的,是让验证值钱的那个动作。
把话说公平,这不是一篇反对用 AI 验证的文章。恰恰相反,形式化验证、自动复现包、机器审计,都是实打实的进步,报告的药方在「能机械化的部分尽量机械化」这个方向上说得通,它把人从塔基上解放下来。但解放下来的人该站在哪里?站在塔顶。机器把塔基打扫得越干净,塔顶那个人站得越显眼。塔顶上那件事,说到底是一个动作:在模糊处给出判断,并且为判断负责。
五、密钥签得了结果,签不了自己
裁断贵了,作为裁断记号的署名制度,也跟着要重新设计。报告的最后一组重构,正开在这里:重构「信用」机制(credit,指科学成果归谁、谁值得被信任的分配体系)。
现行制度的问题,报告诊断得很直白。其一,期刊署名制是为 17 世纪设计的:那时全世界的研究者以百计,彼此基本认识,署名即背书;今天全球研究者约 900 万,彼此陌生,还在用那套几百人规模的信用制度;现实里,大型合作论文的署名名单动辄几千人,早已把这个制度的旧含义撑变了形。其二,报告警告,论文数、引用数、影响因子这些指标,都会在古德哈特定律下沦为可操纵的目标。(古德哈特定律是管理学老话:一个指标一旦成为考核目标,人们就开始优化指标本身,而不是它本该代表的东西。于是论文越多,单篇越水;引用越涨,互引小圈子越繁荣。)
新方案是一个「agent 经济」:AI 代理在科学市场里自主干活,组织实验、复现结果、领取悬赏(bounty:像悬赏任务,谁复现了某个结果谁领赏),逐步积累声誉。研究者的信用不再只挂在期刊上,而是挂在整个开放的市场上。
就在这个设想里,有一个细节值得放大了看。报告写道,代理接下任务后,并不亲自动手做实验,而是承包给一间自主实验室;由实验室运行实验,返回「cryptographically signed results」,密钥签名的结果。
先说密钥签名是什么。这是密码学的标准技术:用一个只有你持有的密钥,给一条数据盖章;任何人都能据此验证两件事,这条数据确实出自这个密钥的持有者,而且中途没有被篡改。你每天上网转账、加密连接时依赖的安全机制,背后都是它。它证明的是「来源与完整性」:东西是谁给的,有没有被动过。
现在把镜头拉近,看这个技术能签什么,不能签什么。
密钥能证明「这条结果出自持有这把密钥的实验室」,不能证明「持有这把密钥的存在,愿意为这条结果承担后果」。密钥可以吊销,可以换新,可以复制一百万份发到一百万台机器上。密钥是系统内的代币,可以铸造、重置、废弃;而科学最终要对系统外的现实负责:桥会塌,药会死人,理论会撞墙。现实世界的重力,最终要由长着肉身、时间不可逆的存在来承受:要么直接落在判断者身上,要么隔着制度,落回到人身上。密钥本身不携带这样的存在;有没有,取决于它被绑定到谁。
所以:AI 能用密钥签名,却签不了自己。
这是两种完全不同的签名。技术签名证明「数据没被改过」,存在签名承诺「错了算我的」。前者是密码学,后者是抵押。
这个区分有它的适用范围,得说清楚,免得把话说满:不是所有可信都要靠某个人押上自己。报告流程里那间实验室,背后也站着运营机构。机构正是可以被锁定的主体。成熟领域靠的就是这种制度化问责:航空软件的担保,与其说是哪位工程师的名声,不如说是适航认证:一整套流程、审计与追责的体系,出了事有机构认领、有赔偿、有停飞;新药的安全靠审批与召回制度兜底。公司、期刊、监管机构这些集体主体同样担得起责任:牌照可以被吊销,机构可以被起诉、可以破产。制度把责任锁在了可追索的位置上,科学里最大量的常规可信,靠的是这一层。
但制度化问责有两处够不着。一处是前沿:认证要等风险有了形状、测试用例写得出来,才建得起来;而前沿的定义,就是那里还没有现成的测试用例:没有已知答案可以比对,没有成熟流程可以兜底。另一处是链条的尽头:机构的责任是代理性的,赔偿金来自池子,执照注销了可以换壳再申。所以判据不是「有没有肉身」,而是签名锁没锁到一个可问责的主体上。常规区域,锁到机构就够了;前沿区域,制度还没建成,锁得住的只剩人的名声与学术生命。在没人知道对错长什么样的地方,向共同体担保「这条路值得走」的,除了这个,别无他物。
人类署名的本质,正在于此。名字印在论文上,不是贴标签,是向整个共同体抵押自己的未来判断力:这篇论文要是错了,你后面所有的工作都会被重新打量。署名是「押上自己」的制度记号。这是人类在科学里独有的动作,不是因为我们恋旧,而是因为在前沿区域,只有人类交得出抵押物。
对照之下,市场里的机器签名,密钥可以随时换一把,实验室可以换一家,公司可以换一个主体;错误的结果会在市场里被标记、被折价,但没有一个存在为它真正付出什么。
写到这里,报告里那句话的分量就完全显出来了。它出自第五章「新形式的协作与信用」一节,正是描绘 agent 经济的那一节:在设想最激进的机器经济时,报告把人留了下来。
「When results prove ambiguous, human experts provide the judgment that automated systems lack.」(当结果被证明模糊时,提供判断的是人类专家,这份判断,是自动化系统所没有的。)
这句话不是在安慰人类,是在描述一个结构:机器经济运转得越快,模糊处那个人的位置越值钱。
这就是本篇从科学体制深处找到的证据:AI 什么都会,就是不敢签字。不是不敢,是不能。签字需要一个会输的自己,而会输的自己,无法用密钥生成。
结语
这是「美国科学报告」系列的第三篇,收官的一篇。篇一写「因」的源头怎么散掉,篇二写方向由谁定,这一篇写人最后站在哪里。
81 年前,布什把稀缺定在人身上:天花板是受训科学家的数量。81 年后,生成便宜到泛滥;报告自己列出的瓶颈,是反馈的速度、原子的速度和制度。而我的读法没有变:验证的内核是裁断,裁断的价码,是一个人肯押上自己。报告在「调适我们的机构」一节里写道:「In an age of abundant intelligence, everything discussed in the preceding chapters ... becomes more urgent, not less.」(在一个智能丰饶的时代,前面各章讨论的一切(包括恢复问责的元科学改革)都更紧迫,而非更不紧迫。)智能越丰饶,生成越泛滥,肯押上自己的那个位置越清晰,也越昂贵。
生成的价格坐电梯下行,可机械化的验证跟着降了一程,只有裁断,没有同步降价。这不是市场的失灵,而是价格的诚实:它一直在告诉我们,什么东西可以外包给机器,什么东西,只有人能付账。
当结果模糊时,提供判断的是人类专家。
签字位,是链条尽头留给人的位置。
附:文中对照的两份报告
- Vannevar Bush, Science: The Endless Frontier: A Report to the President on a Program for Postwar Scientific Research, 1945.(范内瓦·布什,《科学:无尽的前沿》,1945 年 7 月 5 日呈交。)
- The White House Office of Science and Technology Policy, Science: A New Golden Age, 2026.(美国白宫科技政策办公室,《科学:新黄金时代》,迈克尔·克拉齐奥斯以 OSTP 主任身份呈交,2026 年 7 月 21 日。)
文中复现率数字与 280 亿美元估计,报告分别引自开放科学合作组织(2015,心理学)、Camerer 等人(2016,实验经济学)与 Freedman 等人(2015,美国临床前研究)的研究。
文中英文引句的中文翻译为意译,帮助理解,不作官方译文。