一天搭出 80% 的 Agent,然后卡在 95% 到死

demo 太好做了。一个有经验的工程师,通用大模型加一个简单 Prompt,一天能搭出一个"挺好用"的原型。这不是错觉,也不是你天赋异禀,是这一层本来就不难。0 到 80% 这段路,模型已经替你把最重的活干完了。

很多人就是在这里误以为 AI 落地很容易。demo 跑通的那一刻,你会觉得剩下 20% 也就是 polish 一下的事。

但 demo 只覆盖最常见的路径。生产系统要面对的是长尾、异常、合规和责任边界------这三样东西在 demo 阶段根本不会出现,因为你自己挑的测试用例,当然挑能跑通的。

真正难的是 80% 到 95%。

模型会在特定场景下出错。行业术语理解偏了,边界情况处理崩了,用户问了个 demo 里没有的问法,整个对话就歪掉。你要做的事情突然变得很不"AI":Prompt 优化、规则补充、数据标注、测试集构建。这些活加起来,比搭 demo 那一天重得多。

这里有个反直觉的点:AI 测试不像传统软件测试。传统测试是确定性输入配确定性输出,跑通了就是跑通了。AI 测试面对的是概率系统和长尾分布,"改好 A 又坏 B"是常态。这不是你代码烂,是系统的性质就是这样。你修一个 case,另一个 case 的概率分布就动了,原本稳的地方开始抖。

95% 到 99% 又是另一个量级。

1% 的错误也能酿事。客服答错一次,可能就是一次品牌事故;金融、医疗、政务里错一次,可能触发合规。系统接得越多,权限、审计、回滚、人工接管这些东西的复杂度是乘法上去的,不是加法。到这一步,你需要的是上万级真实对话数据,是一个团队一个季度的活,不是一个人一个周末。

FDE 做的就是这一段。不是 0 到 80%,是 80% 到 99%。客户愿意为 FDE 付费,不是因为他没看到 demo------demo 他自己也能搭------而是因为 demo 到生产之间有一条很长的沟。这条沟里全是长尾、合规和责任,demo 不会告诉你它有多深。

那为什么上限是 99% 而不是 100%?

LLM 本质是概率系统,输出空间是开放的,永远存在不可预见的边缘案例。从 99% 推向 99.9%,边际成本指数级涨,边际收益递减。高风险场景那 1% 本就不该让 AI 覆盖,应该走人工审核和回滚兜底。

99% 不是技术妥协,是工程经济学的最优解:AI 覆盖可规模化的 99%,人工守住不可自动化的 1%。硬要追 100%,你花的钱和那 1% 的损失不成比例。

这也能解释一个看起来矛盾的现象:超过 70% 的企业已经在至少一个职能里试了生成式 AI,但超过 60% 还停在试点或实验阶段。模型能力明明一直在涨,为什么大家不动了?

卡住的不是模型能力。卡住的是最后那 20% 的生产化工程。模型每次升级,拉大的不是"技术能做到"和"做不到"的距离,是"技术能做到"和"组织用得起来"的距离。企业引入 AI 要穿越三个阶段------个人提效、组织转型、业务重构------每个阶段动辄以年为单位。demo 跑通是第一阶段的事,后两个阶段跟模型好不好没关系。

所以 demo 的意义不是替代生产系统,是提前暴露风险。健康的 FDE 模式不是把 demo 当结束,是把 demo 当成进入生产验证和经验积累的起点。

一天搭出 80% 是正常发挥。卡在 95% 到死,也是正常发挥。中间那段不是你不行,是活本来就在那里。

相关推荐
子兮曰4 天前
jev-ultrafast 深度解析:7 秒订机票的浏览器 Agent 是如何炼成的
前端·后端·agent
子兮曰4 天前
Jev 爆发一周:7 秒 Agent 背后的 System One 生态与三场争议
前端·后端·ai编程
爱勇宝4 天前
ZCode 开源 24 小时:一份没有历史的账本,回答不了"有没有偷代码"
前端·后端·chatglm (智谱)
胡写代码4 天前
别再前后端各写一套表单校验了
java·后端
大勇前进4 天前
原生 PHP 还是 Laravel?小项目到底要不要上框架
后端
yuzhi_liu4 天前
我用 LangGraph4j 实现 Multi-Agent Supervisor
后端
alsmile4 天前
Node-RED 之外,国产规则引擎的新方案:基于标准语法,Go 先行实现
后端·开源·go
大白804 天前
PHP 内存溢出排查思路:看懂报错日志,精准定位问题
后端
二月龙4 天前
PHP 接口返回统一响应封装,让前后端对接更省心
后端
盖伦发发4 天前
软件工程SOLID 五大设计原则
后端·软件工程