同事烧光了所有 AI 顶配额度,就为了验证一句话

我有个同事,所有 AI 工具都开顶配套餐。就这样,额度还是不够烧------他的用量曲线,比我们业务的增长曲线都陡。

他在干嘛呢?

日夜不停地让 AI 优化我们的系统。 白天让它批判架构,晚上让它批判自己白天改过的架构。人歇了,任务不歇,第二天早上收一批"优化建议",继续投喂。

我问他图什么。他说了一句听起来特别有道理的话:

"有位大师说过------不断批判它,它最终能达到最优。"

哪位大师?他也想不起来了。但这句话本身,我承认,第一次听是有杀伤力的。批判驱动进步,这不就是科学方法吗?何况 AI 不知疲倦、批判成本几乎为零------用无限的批判逼近最优解,听上去像永动机一样美。

而永动机的问题从来不是"听上去"那一步。

两周后,我看了看他的"最优系统"

三个现象,每一个都值得裱起来。

第一,反复横跳。 周一,AI 批判某个模块耦合太重,建议拆;周三,AI 批判拆得太散,建议合;周五,又批判合得太死,建议拆。同一段代码,两周里被"优化"出了一个轮回。为什么?因为没有外部基准的批判,只是换个角度的偏好。你让它批判,它就给你批判------要多深刻有多深刻,要多犀利有多犀利。犀利不等于对。

第二,复杂度通胀。 每一轮优化,系统都会多一层抽象:加个接口、抽个基类、引入一个新模式。两周下来,原来三层的结构变成了七层。这是 AI 批判的一个隐蔽倾向:"加东西"显得深刻,"删东西"不显功力------批判的产出物天然偏向复杂化,因为复杂看起来更像"优化过了"。

第三,也是最致命的:指标真空。 我问他,优化了这么多轮,快了多少?稳了多少?省了多少?

他答不出一个数字。

没有记分牌的比赛,打得再热闹,也没有比分。

那句话到底错在哪

我后来想明白了,那句"不断批判它,它最终能达到最优",不是错在批判------批判确实是进步的引擎,这一点哲学家们早就说透了(这套思想最像的出处是波普尔的"猜想与反驳":知识靠批判生长)。

它错在悄悄偷换了一个前提:批判要有效,必须能被检验;而检验,需要外部的现实。

科学家的猜想被实验检验,实验室不归猜想的人管。而我同事的 AI 呢?它自己提批判、自己评好坏、自己宣布"这版更优"------运动员、裁判、记分员,全是它一个人。这种批判循环不会收敛到最优,只会收敛到"AI 自己觉得顺眼",而它每天觉得顺眼的东西还不一样。

我干了二十年研发,见过人肉版的同款故事:没有验收标准的重构,永远在重构。AI 只是把这个循环的转速提高了一百倍------方向不对的时候,转速越快,烧钱越快。

让 AI 优化真正收敛的四件事

我自己也重度让 AI 优化系统------我的几个自动化机器人每周都在被 AI 批判和改进。区别只在四件事:

① 先立记分牌,再放它跑。 一套评测集(真实场景的问题+期望结果)、几个硬指标(延迟、成本、错误率)。"优化"之前先跑一遍留底,优化之后再跑一遍------变好变坏,数字说话,不听 AI 自评。

② 目标函数必须人来定。 "帮我优化一下"是全世界最贵的提示词------优化什么?延迟、成本、可读性还是扩展性?这些目标经常互相打架。你不定目标,AI 就自己发明一个,而它发明的目标通常是"看起来更高级"。

③ 每轮留档,输了回滚。 版本 n 和版本 n+1 用同一套评测对打,赢了才留下。听起来笨,但这是防"越改越差"的唯一手段------没有对照的迭代,不叫迭代,叫漂移。

④ 批判可以外包,裁决不能。 让 AI 生成一百条批判,没问题,这是它的强项;但哪条批判值得听、这一版算不算更好,拍板的必须是人。裁判下场踢球的比赛,比分没有意义。

你看,这四件事没有一件是新发明------评测、目标、对照、终审,工程学的老规矩而已。AI 没有推翻这些规矩,它只是把违反规矩的代价变得更贵了:以前瞎折腾浪费的是自己的时间,现在瞎折腾,是按 token 计费的。

最后

那位同事的额度这个月又烧光了。这篇文章发出去之后我打算转给他------我赌他的回复是:"有道理,我让 AI 批判一下你这篇文章。"

真要是这样,我竟无法反驳。

但我想把那句话补完整,送给所有在用 AI 干活的人:

"不断批判它,它最终能达到最优"------成立的前提是:批判有记分牌,裁决有人。

没有裁判的批判,只是昂贵的原地打转。AI 时代最贵的从来不是顶配额度,是没有方向的勤奋。