一天搭出 80% 的 Agent,然后卡在 95% 到死

demo 太好做了。一个有经验的工程师,通用大模型加一个简单 Prompt,一天能搭出一个"挺好用"的原型。这不是错觉,也不是你天赋异禀,是这一层本来就不难。0 到 80% 这段路,模型已经替你把最重的活干完了。

很多人就是在这里误以为 AI 落地很容易。demo 跑通的那一刻,你会觉得剩下 20% 也就是 polish 一下的事。

但 demo 只覆盖最常见的路径。生产系统要面对的是长尾、异常、合规和责任边界------这三样东西在 demo 阶段根本不会出现,因为你自己挑的测试用例,当然挑能跑通的。

真正难的是 80% 到 95%。

模型会在特定场景下出错。行业术语理解偏了,边界情况处理崩了,用户问了个 demo 里没有的问法,整个对话就歪掉。你要做的事情突然变得很不"AI":Prompt 优化、规则补充、数据标注、测试集构建。这些活加起来,比搭 demo 那一天重得多。

这里有个反直觉的点:AI 测试不像传统软件测试。传统测试是确定性输入配确定性输出,跑通了就是跑通了。AI 测试面对的是概率系统和长尾分布,"改好 A 又坏 B"是常态。这不是你代码烂,是系统的性质就是这样。你修一个 case,另一个 case 的概率分布就动了,原本稳的地方开始抖。

95% 到 99% 又是另一个量级。

1% 的错误也能酿事。客服答错一次,可能就是一次品牌事故;金融、医疗、政务里错一次,可能触发合规。系统接得越多,权限、审计、回滚、人工接管这些东西的复杂度是乘法上去的,不是加法。到这一步,你需要的是上万级真实对话数据,是一个团队一个季度的活,不是一个人一个周末。

FDE 做的就是这一段。不是 0 到 80%,是 80% 到 99%。客户愿意为 FDE 付费,不是因为他没看到 demo------demo 他自己也能搭------而是因为 demo 到生产之间有一条很长的沟。这条沟里全是长尾、合规和责任,demo 不会告诉你它有多深。

那为什么上限是 99% 而不是 100%?

LLM 本质是概率系统,输出空间是开放的,永远存在不可预见的边缘案例。从 99% 推向 99.9%,边际成本指数级涨,边际收益递减。高风险场景那 1% 本就不该让 AI 覆盖,应该走人工审核和回滚兜底。

99% 不是技术妥协,是工程经济学的最优解:AI 覆盖可规模化的 99%,人工守住不可自动化的 1%。硬要追 100%,你花的钱和那 1% 的损失不成比例。

这也能解释一个看起来矛盾的现象:超过 70% 的企业已经在至少一个职能里试了生成式 AI,但超过 60% 还停在试点或实验阶段。模型能力明明一直在涨,为什么大家不动了?

卡住的不是模型能力。卡住的是最后那 20% 的生产化工程。模型每次升级,拉大的不是"技术能做到"和"做不到"的距离,是"技术能做到"和"组织用得起来"的距离。企业引入 AI 要穿越三个阶段------个人提效、组织转型、业务重构------每个阶段动辄以年为单位。demo 跑通是第一阶段的事,后两个阶段跟模型好不好没关系。

所以 demo 的意义不是替代生产系统,是提前暴露风险。健康的 FDE 模式不是把 demo 当结束,是把 demo 当成进入生产验证和经验积累的起点。

一天搭出 80% 是正常发挥。卡在 95% 到死,也是正常发挥。中间那段不是你不行,是活本来就在那里。

相关推荐
leonkay1 小时前
C# 锁机制——【2】深入原理
开发语言·后端·spring·c#·个人开发
江湖十年1 小时前
在 Go 中使用 dyno 包处理动态对象
后端·面试·go
八角丶1 小时前
Node 网络编程 —— TLS 模块
javascript·后端·node.js
山岚的运维笔记1 小时前
mysql 专业笔记 -- 第 8 章:使用变量
运维·数据库·笔记·后端·学习·mysql·dba
平头哥AI3 小时前
Day 01 | go run 跑通第一个 Go 程序,go build 留下一个能拷走的 exe
开发语言·后端·golang
ZGG0034 小时前
线程池详解:从 7 大参数到生产避坑
java·数据库·后端
geovindu5 小时前
CSharp: Wordcloud
开发语言·后端·c#·.net·.netcore·词云
geovindu6 小时前
CSharp: Command Pattern
开发语言·后端·c#·.net·.netcore·命令模式·行为模式
tedcloud1237 小时前
OpenLogi 怎么搭建?用 Rust 打造一个轻量的 Logitech 外设管理工具
linux·运维·服务器·开发语言·后端·rust·开源