为啥Agent在coding表现这么好,但是在别的领域就是差的不少?

过去有不少agent的业务结果或预研项目落地,但是实际发现agent在其他领域并没有想象中可以大量解放人类的生产力。做demo可以,但是要实际解决用户的业务问题,还是困难(用户很愿意尝鲜,但是大概率留存率很低)。

那么问题来了,为什么agent在coding领域这么好用? 这是我们首先要探究的问题,然后在推导其他领域还差哪些内容?

以下内容是我个人的推演和判断


1. 知识的可形式化程度

coding的训练语料实在太优质了......如果你以前有做过NLP(现在看起来多么远古的词汇),自己有清洗过语料,你大概可以明白我在说什么。

编程语言是人类做过的最彻底的知识压缩工程。

x + 1 的语义不依赖上下文、不依赖时区、不依赖读者的文化背景。函数签名、类型检查、作用域规则------这些东西拼成一张有向图,每条边都是明确的。Transformer 的 self-attention 在这张图上跑,不像读维基百科那样需要猜"这个词在这个句子里到底是什么意思"。

插一句,代码预训练还有个有意思的副作用:训练过代码的模型,在数学推理和逻辑题上表现也会变好。不是因为模型变聪明了------是因为代码里的 token 关系是硬约束,"这个符号和那个符号之间只有这几种变换方式"。处理过几百万个函数之后,模型对"什么东西能跟什么东西组合"有了一种统计层面的直觉。这在纯文本预训练里是很难学到的。

出了编程,这件事就崩了。

一个医生在病历上写"疑似""不排除""建议进一步检查"。一种常见的误解是觉得这是知识还不够精确的表现。不是的。在一个非线性的、多变量的、个体差异巨大的系统面前,"大概""可能""视情况而定"就是知识最精确的形态了。

法律同理。"合理注意义务"------这个词从诞生到现在,没有任何两个人给过完全一致的定义。它之所以模糊,不是因为立法者语文不好,是因为立法者知道规则不可能穷尽所有情况。

把这种知识强行压缩成确定性规则,丢失的不是"表达的精度"。丢失的是信息本身

我画个对比:

编程 医疗 法律 企业管理
x + 1 永远等于 x + 1 同样的症状 + 同样的药 = 可能不同的结果 同一个条款 + 不同法官 = 可能完全相反的判决 同一个决策 + 不同公司 = 可能一个成王一个破产
上下文无关 强上下文依赖(基因、年龄、心理状态...) 强上下文依赖(管辖区、判例、法官倾向...) 强上下文依赖(企业文化、利益格局、时机...)
可压缩 不可压缩 不可压缩 不可压缩

此外,我前一阵跟人聊的时候,被指出漏掉了一个关键点。GitHub 不只是一个"有很多代码"的地方。

GitHub 上的高质量仓库,自带强化学习需要的全部信号结构。

一个维护良好的开源项目,它的 commit 历史不是一堆文本。它是:

bash 复制代码
需求 → 第一次尝试 → CI 报红 → 修了 → 又报错 → 换思路 → 通过 → merge
                                                    │
                                    附带 PR review 里的专家判断
                                                    │
                                              附带 star/fork 的社群投票
  • 单元测试 = 标注了什么叫"正确"。不是模糊的评分,是可执行的断言。
  • PR review = 留下大佬的判断。"这个写法有线程安全问题""那个抽象过度了"。大佬们在教模型什么是好的代码。
  • star / fork = 分布式质量投票。一个 10 万 star 的项目和一个 3 个 star 的项目,模型不需要人来告诉它哪个更靠谱。

一个被 merge 的 PR 本质上不是一个文本样本。它是一组附带了奖励信号的行为轨迹action → outcome → reward 的完整链条。模型不是从孤立代码片段里学语法的,是从几千万条"这么做→得到这个结果"的因果链里学推理的。

现在想一下其他领域的"大数据"是什么结构。

病历。几亿份。但每一份是一张快照------入院状态、给药记录、出院结果。没有"当时如果换 B 方案会怎样"的反事实。没有主治医生在病历上写"我选 A 药不选 B 药,是因为这个患者三年前的某个指标让我怀疑 β 受体阻滞剂对他不敏感"。那些最关键的决策逻辑,在医生的脑袋里,不在病历上。
判决书。几千万份。引用网络勉强提供了一点结构------"本案参见某某判例"。但没有"这份合同后来引发纠纷了吗"的 outcome 标签。没有"这个条款当时为什么用这种措辞而不是那种"的解释性注释。
ERP 里的数据。每一行都在告诉你"发生了什么"。没有一行告诉你"为什么这样决定"或者"后来证明是对是错"。

这些领域不是数据少。是数据的结构不对

它们是事件的被动日志。不是学习的主动载体。你可以在上面做预训练,让模型学会格式、术语、表面模式。但你要做强化学习------让 Agent 通过试错自我改进------需要 action → outcome → reward 的因果链。而这个链在大多数行业数据里是断掉的。

模型被卡在"模仿人类输出"这一层。它跨不过"从自己的错误中学习"那道门------因为没有数据能告诉它,什么算错误。


2. 验证速度和客观性

"在真实世界里,有没有一个'编译器'替你判断对错?"

编译器和测试框架,是我认为编程世界中最被低估的两样东西。

你在 Cursor 里写了一行代码,编译器在几毫秒之内告诉你:对,或者错。二进制信号。单元测试同理------断言通过是绿的,失败是红的。

别小看"几毫秒"和"零噪声"这两个属性。

人评价人的工作,永远有偏见、有疲劳、有语境偏差。RLHF 试图把人类偏好变成训练信号------但每一条人类标注都在往模型里注入标注者的文化预设、对任务的理解偏差、甚至当天下午的血糖水平。而且人太慢了。一个高级工程师 review 一段代码最快几分钟。编译器是几毫秒。差了一百万倍。

Agent 变强的核心机制是强化学习------它尝试一个动作,环境给一个奖励信号,它调整策略再试。 信号必须足够快、足够干净、足够大规模,这个循环才能转起来。

编程天然有编译器当裁判。AlphaGo 有围棋规则当裁判。数学题有正确答案当裁判。这是 RLVR(基于可验证奖励的强化学习)能在这三个领域爆发的原因。

出了这三个领域,裁判在哪?

医生开了处方,怎么验证?等。几周到几个月的临床结果。信号被患者基因、生活习惯、用药依从性搅得几乎无法归因------这个患者好了,是因为药对症,还是因为他同时戒了烟?没人能确定。

律师写了一份合同,对错的判断可能要等到几年后有人真的打官司。而同一个条款在三个不同法官手里可能得出三个结论。

在这些领域,"正确"这个概念本身就是不可二值化的。不是说"还没发明出客观裁判"------是说"客观裁判"在这个问题上的概念就不成立。它是多方诠释的、情境耦合的、尺度连续的。你不能用一个离散的 reward 函数去逼近一个本质上不可二值化的量。

没有纯净反馈,强化学习的闭环就断了。这就是为什么除了编程、数学和棋类游戏之外,几乎所有 AI 应用都停在"生成草稿等人改"的阶段。不是不想自动化。是没有裁判。


3. coding基本可以无限试错

纯净信号让 Agent 知道什么是好的。但真正让它变强的是可以安全地犯错

AlphaGo 在打败李世石之前,跟自己下了几百万盘棋。每一步都可能是臭棋。每一盘都可能输。但模拟器不在乎。把 AlphaGo 放到一个"输一盘从悬崖上推下去"的环境里训练------它什么都学不会。

编程的试错成本几乎为零。

bash 复制代码
git checkout -b experiment   # 开分支,随便搞
git branch -D experiment     # 搞错了,删分支。主干毫发无损

Docker 同理------AI 在里面写了一个死循环、内存泄漏、rm -rf /,关掉容器,什么都没发生。

这个属性的数学表达是:探索和交付是两个完全解耦的阶段。 Agent 可以在隔离环境里试错几百万次,找到最优解,再交付到真实世界。

大部分人类活动解耦不了这两件事。

物理世界没有 ctrl+z。小马智行等的自动驾驶在深圳武汉之类的城市一直在跑无人驾驶的出租车,看起来像是物理世界也能"撤销"了------但你看它的成本结构。背后是一个巨大的保险单和一个完整的法务团队,这是"用钱和律师把试错成本包起来了"。普通的工厂、医院、律所哪有这种条件?

组织决策更麻烦。你试一个裁员方案------做错了,被裁的人走了,留下的人被恐惧改变了。品牌声誉这种东西,积累以年计,崩塌只需要一次。没有版本号,没有 rollback,没有 revert commit。每一次"试点"都是实盘------你可以缩小试点范围,但那只是缩小爆炸半径,不等于试错成本为零。

这就是为什么 RLVR(可验证奖励 + 强化学习)除了编程和数学之外几乎无法开展。可验证奖励的前提是:验证环境的运行成本为零。AlphaGo 需要无限围棋棋盘。编程 Agent 需要无限沙箱。大多数人类活动领域里,那个"免费试错的平行宇宙"不存在。


4. 现实世界中,权力和责任都是复杂的

这个约束不是认知问题。

在编程里,责任被技术系统无声地承担掉了:

sql 复制代码
编译器 + 类型系统   → 吃掉语法责任。代码有语法错误?直接拒签。不需要人批准。
测试套件 + CI      → 吃掉逻辑责任。回归没通过?自动挂红,merge 被挡。不需要人判断。
Git + Docker       → 吃掉试错责任。改坏了瞬间恢复。没有人需要站出来说"我搞砸了"。

出了编程,这三层全没了。AI 给了一个建议,需要人来判断对不对。AI 做了一个决策,需要人来验证可不可行。AI 犯了一个错,需要人来承担代价。

而这个代价,没有人愿意付。

不是我悲观。这是一个很理性的计算。

医生不用 AI 开药的真正原因,不是 AI 不准。某个影像诊断 AI 的准确率已经超过人类放射科医生了。问题是出了医疗事故,坐牢的是医生,吊销执照的是医生。AI 不坐牢。

律师不用 AI 直接给客户发合同,不是 AI 不专业。是漏掉一个关键条款赔几千万的,是被诉渎职的,是律师。AI 不交执业保险。

企业中层对 AI 流程优化消极应付,不是他们保守。是"优化"完他的团队人少了、预算少了、权力弱了------但部门 KPI 还在他身上。AI 不替他扛年度述职。

这个激励结构是致命的。AI 做对决策,收益分散给所有人。AI 做错决策,代价完全集中在签字的那个人身上。 而那个人对 AI 的决策过程可能根本不理解,也控制不了,也无法在监管问询时解释。这是一个负凸性的风险收益结构。任何理性人的最优响应都一样:不签。

这是一个在给定博弈约束下必然出现的均衡。

这个死穴,不在技术的解空间里。它需要法律主体资格------让代码承担刑事责任在概念上就不成立。它需要自由意志假设------没有任何法律体系能建在"这个算法选择了作恶"的归因之上。它需要社会共同体对惩罚有共识------而惩罚一个非人实体提供不了任何道德满足感或威慑效果。

这些不是用越来越大的模型规模能解决的伦理问题!


5. 跨领域对照:用五个约束扫一遍

把这五个约束排成一张表,扫一眼就清楚了:

约束 编程 芯片 EDA / 形式化证明 金融量化 IoT / 工业控制 医疗诊断 法律服务 企业管理
知识可形式化程度
验证速度和客观性
试错可逆
权力和责任被系统吸收

几个观察:

芯片 EDA / 形式化证明是唯一接近编程的。逻辑综合器 = 编译器,形式化验证 = 测试套件,仿真环境 = 沙箱。这也是为什么 AI 在芯片设计(Verilog 生成、布局布线优化)和数学证明(Lean 4 + AlphaGeometry)上进展这么快。

金融量化看起来像编程,但实际上有两个问题。 第一是信号不纯------盈利不等于策略正确,可能是随机噪声。古德哈特定律会干掉任何被大规模采用的策略。第二是责任------有牌照的基金经理可以被追责。AI 的策略崩了,吊销谁的牌照?

IoT / 工业控制有三个问题。 API 返回 200 OK 不代表阀门真的关了("虚假成功"问题)。物理损坏不可逆。设备商、软件商、操作员之间的责任链从来没扯清楚过。

医疗和法律AI在严肃场景中基本都要人把关。 知识不可压缩,语料没有因果链,信号不可二值化,试错不可逆,责任全部在人身上。这也是为什么这两个领域当前最务实的 AI 应用形态,都停在"辅助检索 + 初筛标记"的层级。不是不想往上走。是往上走的每一层,都需要一个人在下面垫着。

企业管理是最难的一个。 这一块全炸了。但你也会观察到,企业管理里 AI 的渗透正在发生------会议纪要、邮件摘要、代码生成------都是碎片化的"点状提效"。一旦试图从"点"串成"链"(端到端的流程自动化),那些塌掉的约束就会把所有相关人员"责任谁扛"这个终极问题弹出来。然后事情就卡住。


6. 几个零散的补充思考

6.1 历史上的每次"不可能"后来都被打脸了,这次会不一样吗?

翻译需要文化理解 → DeepL 和 GPT 改了行业。围棋需要直觉 → AlphaGo 碾压人类冠军。蛋白质折叠需要科学家洞察力 → AlphaFold 两年破解了半个世纪的难题。

每次有人断言"XX 是人类独有的能力",历史反例的清单都在加长。所以我对"XX 领域本质上不可 Agent 化"这种判断非常谨慎。经验性的困难描述("当前还不行")是诚实的,本质论("永远不可能")需要哲学层面的证明------而从来没有人成功提供过。

但责任这件事,跟前几个不一样。 知识、直觉、洞察力------都是认知层面的东西。识别模式,建立关联,在搜索空间里找最优解。我们曾经以为这些是人类独有的,后来发现统计学习可以逼近它们。责任不是认知属性。它是一个社会学构件。这不是"现在的 AI 不够聪明,以后会解决"的问题------是"解决这个问题的前提条件不在技术的工具箱里"。

6.2 Agent 在其他领域的渗透方向

我觉得大概率不是"全面替代",是渐进侵蚀。先在做错的代价最低、边界最清晰、验证最快的子任务里扎根,再往上游渗透。

  • 法律:"AI 做法律研究 + 合同初筛,人类律师做策略 + 出庭 + 签字"。
  • 医疗:"AI 做影像初筛 + 异常标记,人类医生做最终诊断 + 告知患者 + 签字"。
  • IoT:是"AI 做异常预警 + 参数建议,PLC 执行底层控制,人在红区把关 + 签字"。

你发现没有,每个链条的最后一个动作都是同一件事 ------ 人兜底,人担责。

6.3 责任分配不是技术问题

有一种思路是"用保险解决"------给 AI 决策买保险,出了事保险公司赔。Waymo 已经在这么做了。但这种方案有两个硬伤:

  1. 可保性。保险的精算基础是可量化的风险。AI 的决策错误在多数领域还没积累出足够成熟的损失分布。保险公司不知道怎么定价。
  2. 可扩展性。Waymo 能这么干是因为它背后有 Alphabet。普通医院、律所、工厂------你让它们每年花几百万给 AI 买保险试试看。

保险只是在责任的外部包了一层金融缓冲。它没有改变"AI 不是法律主体"这个根本约束。它只是把"谁扛"的问题从"我不签"变成了"我付不起保费"。

以上,全是个人判断。欢迎在评论区指正。

相关推荐
nix.gnehc1 小时前
工具表之外 -- 派生、注入与两条原语
agent
鱼与宇4 小时前
前端Web(html+css+js+vue3)
前端
HIT_Weston4 小时前
181、【Agent】【OpenCode】TuiThreadCmd(类型增长)(编译&运行时)
人工智能·agent·opencode
雪芽蓝域zzs5 小时前
(六)打包优化 + Nginx 部署完整配置 + 项目收尾
前端·vue.js
研☆香5 小时前
聊一聊前端的常见字 关键字
开发语言·前端·javascript
东风破_6 小时前
JWT 1:从一个登录请求开始,理解 React 项目里的 API 层与 Mock
前端·后端
东风破_6 小时前
JWT 3:为什么 Token 要放进 Authorization?Axios 拦截器到底解决了什么?
前端·后端
东风破_6 小时前
JWT 5:路由守卫是什么?把整个 JWT 登录鉴权流程串起来
前端·后端