截至 2026 年 9 月,按 Anthropic 官方文档,Claude Opus 5 的上下文窗口是 1M token,每百万输入 token 收费 5 美元,每百万输出 token 收费 25 美元。按我的估算,这个窗口能一次装下一个中小规模的代码库,或者一家企业的整套制度文件。同一年 5 月 11 日,OpenAI 宣布成立由其控股的 OpenAI Deployment Company(部署公司)。崔牛会《FDE 落地中国白皮书》整理过这家公司公开描述的合作过程。第一步是诊断高价值机会,挑出少量优先的工作流;接着构建生产系统,把模型连到客户的数据和工具上,嵌进客户的控制措施和业务流程。
做模型的公司,在模型之外另建了一家做部署的公司。模型一次能读完一整套制度文件,企业为什么还要请 FDE(Forward Deployed Engineer,前线部署工程师)这样的人进现场?我的判断是,模型补上的是通用能力,企业缺的是模型无法取得的部分,包括自己的数据口径、业务流程和权限,也包括出了错由谁负责。模型越强,通用能力越便宜,项目成败越取决于这部分。
先认几个词
- 责任区:崔牛会白皮书的用词,指软件能力和业务结果之间的一段距离,需要有人负责把前者变成后者。
- 五个连接:同一份白皮书的框架,指 AI 进入企业必须接上的五个方面,从数据一直到经营结果。
- 80/95/99:腾讯研究院《FDE 模式行业观察与实践》总结的经验规律,描述 AI 应用覆盖的用例从 80% 提到 95%、再提到 99% 时,难度和投入怎样变化。
- 三道成本门槛:同一份报告的说法,指行业知识蒸馏、定制开发和复合型人才供给三项成本。
- 最小经济可行项目:《全球 FDE 发展研究报告》的用词,指在经济上刚好值得做的最小项目。
- 稳定认知中心:同一份报告的用词,指一个人或一个责任单元,始终掌握从现实问题到生产结果的完整认知,并承担端到端责任。
- 资产专用性:《关于 FDE 的 100 个问题》借用的经济学概念。书里的用法是,任务需要高度专业化的知识时,市场上的标准化服务很难满足。 :::
试点停在哪一步
腾讯研究院报告引用未具名的多家机构统计称,超过七成企业已在至少一个职能中尝试生成式 AI,但超过六成仍停留在试点或实验阶段。报告没有写明这组数字出自哪家机构,我只把它当作方向性的信号。
范冰《前线部署工程师》引用了另一组数字。MIT(Massachusetts Institute of Technology,麻省理工学院)NANDA 实验室 2025 年 7 月发布的报告《The GenAI Divide: State of AI in Business 2025》称,在其调研的企业生成式 AI 项目中,约 95% 没有产生可衡量的财务回报;报告依据是 52 家组织访谈、153 份高管问卷和 300 多个公开项目。没有可衡量的财务回报,不等于项目失败。这份报告的样本也不是随机抽样,不能直接外推到中国企业。
两组数字的口径不同,一组说停在试点,一组说没有财务回报,我不把它们合成一个比例。两份资料对原因的解释可以对照着看。据范冰的转述,MIT 的报告认为问题不在模型,这些项目里的系统不会记住用户的反馈,不保存上下文,也没有嵌进工作流程。腾讯研究院报告把从 Demo 到生产分成成熟度 L0--L4 五级,多数项目在 L1(原型验证)和 L2(试点运行)之间夭折。报告列的三类卡点都在组织一侧:试点用户没有纳入考核,数据质量问题在 Demo 阶段被回避,审批流程没有提前办好。
腾讯研究院报告还判断,AI 能力进展的速度快于企业采用的速度,模型每升级一次,技术能做到的和组织用得起来的,距离就拉大一次。这是一个判断,报告没有给出测量这段距离的数据。
标题里的「越需要有人」要先说清楚。我指的是两件事。一件是项目成败越来越取决于模型之外的上下文和责任,这部分只能由人补上。另一件是值得做的项目变多了,每个项目至少要有一个掌握全貌、对结果负责的人。每个项目派多少人是另一个问题,崔牛会白皮书的判断是 FDE 人数可能下降,部署系统会更复杂。「进现场」也不等于驻场,崔牛会白皮书和腾讯研究院报告都把重点放在接近真实业务上,驻场只是手段之一。

同一个模型,为什么在两家公司效果不同
崔牛会白皮书第一章从传统企业软件讲起。传统软件处理确定性的问题,需求可以写成流程,流程可以配置成系统,系统上线后经过培训和验收就算交付完成。软件公司交付功能,客户负责把功能变成价值。同样的输入在任何一家客户那里都得到同样的输出,所以功能有没有上线,可以当作项目成功的标准。
大模型改变了这个前提,模型的输出是概率性的。白皮书指出,同一个模型放进两家公司,会因为数据质量、业务语境和权限结构不同,也因为员工的用法和反馈机制不同,给出完全不同的结果。企业无法再用功能有没有上线来判断项目成败,一次性的实施也完成不了交付。白皮书把软件能力和业务结果之间空出来的这一段叫作责任区,FDE 是组织对这段责任区的回应。
白皮书把 AI 进入企业要完成的工作拆成五个连接,每个连接对应一个要回答的问题。
| 连接 | 要回答的问题 |
|---|---|
| 数据 | 哪些数据可信、完整,能不能被系统调用 |
| 业务语义 | 同一个词在不同部门和场景里指什么 |
| 工作流程 | AI 在哪个节点介入,由谁触发,影响谁 |
| 组织责任 | AI 出错时由谁判断、纠正和承担后果 |
| 经营结果 | 项目改善的是收入和成本,还是效率和决策质量 |
白皮书认为,这五个连接无法只在产品总部完成。我的理解是,五个问题的答案都属于某一家企业。有的答案写在系统里,有的只存在于员工的做法里,还有的要由有权限的人来决定。产品总部看不到这些答案,模型也读不到没有写下来的部分。白皮书的卷首语描述过这种失效。演示中表现好的 Agent(智能体)进入组织后,可能因为数据不全和目标不一致而失效,也可能因为权限不清、出错没人担责而失效。
数巅智能在白皮书里给过一个例子。企业数据很难真正标准化,即使在同一个行业,「利润」这样的指标也会因为企业口径、业务规则和历史系统不同而算法不同。场景越依赖这种组织内部的语义,越需要有人进入现场,把数据、指标和分析方式翻译成 AI 能理解的结构。
我举一个假设的场景。业务人员让模型找出上个季度利润最高的产品线,模型会按它能看到的字段去算。这家企业算利润时要不要扣除分摊的管理费用,退货冲减哪个月的收入,都是具体的规则。这些规则可能写在财务制度里,也可能只存在于某个老系统的计算逻辑里。规则不同,排名就可能不同。模型可以把几种算法都算一遍,判断不了哪一种是这家企业认可的口径。

模型变强,为什么反而让这部分更重要?崔牛会白皮书的解释是,模型的推理和编码能力持续提高,企业之间的差异不会消失。差异会更多集中到模型无法从公共语料中学到的部分,也就是企业自己的数据和流程,客户关系和决策习惯,以及行业经验。白皮书由此认为,FDE 的出现与模型不够强无关。模型越强,通用能力越容易获得,真实的上下文和业务判断越稀缺。
我的推断是,这个变化来自一个事实。前沿模型通过 API 对外销售,一家企业能调用的模型,它的竞争对手也能调用。模型这一部分对大家都一样,项目结果的差别只能来自模型之外。模型部分拉平得越多,结果的差别就越集中在上下文和责任上。
FDE Frontier 与 FDE时代联合发布的《全球 FDE 发展研究报告》从另一个方向得出了相近的结论。报告认为,模型能力越强,可进入的细分流程越多;可进入的流程越多,需要识别和组织的企业差异也越多。按这个逻辑,通用能力和企业定制会一起增长。崔牛会白皮书的依据是 16 个采访项目,全球 FDE 报告的依据是自己的机制分析,两份资料之间没有引用关系。
Demo 做到八成以后,剩下的难在哪里
腾讯研究院报告的 80/95/99 规律描述了另一段距离。报告把企业级 AI 应用的难度分成三段。
| 区间 | 团队在做什么 | 难点 |
|---|---|---|
| 0 到 80% | 通用大模型加简单提示词,有经验的工程师一天内能搭出看起来好用的原型 | 太容易,让很多人误以为 AI 落地很容易 |
| 80% 到 95% | 大量优化提示词,补充规则,标注数据,建评测集 | 模型在特定场景出错,行业术语理解不准,边界情况处理不了 |
| 95% 到 99% | 依靠 FDE、专用平台和上万级真实对话数据 | 客服答错一次可能变成品牌事故,金融、医疗和政务场景的错误可能触发合规风险;接入越多,权限和回滚越复杂;修好一处,另一处又出错 |
报告把上限定在 99%,理由有三个。大模型是概率系统,输出空间开放,总有预料不到的边缘情况。从 99% 推到 99.9%,边际成本指数级上升,收益却在递减。高风险场景里的那 1% 不该交给 AI,应该由人工复核和回滚机制处理。报告据此说,客户愿意为 FDE 付费,是因为「Demo 到生产之间有一条很长的沟」。这组数字是经验归纳,报告没有给出测量数据,我把它当作描述难度分布的一种方式,不当作研究结论。
模型变强会改变哪一段?我的推断是,前两段会变短。更强的模型出错更少,Demo 做得更快,也更完整。第三段的工作量取决于三件事:这家企业的长尾有多长,错一次的代价有多大,出了错能不能被发现和撤回。三件事都是企业自己的属性。模型变强能减少出错的次数,决定不了哪些错不能出,也不会替企业建好人工复核和回滚。

报告还观察到,很多客户在 Demo 阶段兴奋,到生产阶段失望。我由此推出两个后果,资料没有给出数据。Demo 越完整,客户对上线的期待越高,落差越大。另一方面,做一个 Demo 的成本下降以后,启动的项目会变多,走到第三段的项目也会变多。第三段需要的人,要掌握这家企业的上下文,也要能对结果负责。评测集怎样建、怎样用,见 第 13 讲。
Opus 5 补得上哪一段,补不上哪一段
回到开头的 Claude Opus 5。截至 2026 年 9 月,按 Anthropic 官方文档,Opus 5 的上下文窗口是 1M token,单次最大输出 128K token;通过 Messages API,它可以使用工具调用和结构化输出。放到部署现场,模型可以一次读完大量制度文件和代码,可以调用工具查询客户系统,也可以按固定格式输出结果,交给规则代码校验。五个连接里,数据和工作流程两项的一部分技术工作,模型已经能承担。
模型的上下文窗口装得下的,是有人放进去的内容。Opus 5 做不到的有三件:
- 读不到没有写下来的上下文。利润口径如果有一部分只存在于财务人员的做法和老系统的计算逻辑里,窗口再大也读不到。
- 裁决不了口径冲突。两份制度文件对利润的算法不一样,模型可以把差异列出来,用哪一种要由有权限的人决定。
- 承担不了结果。《全球 FDE 发展研究报告》设计 FDE 责任单元时写明,Agent 只承担可编排的执行,不构成责任主体;最终裁决、独立复核和生产工程边界三类责任必须由人承担。
Anthropic 自己的开发文档给过一份判断清单。截至 2026 年 9 月,文档建议从能满足需求的最简单方案开始;决定用 Agent 之前检查四个条件,任何一条不满足,就留在更简单的方案:
- 任务复杂度:任务是否多步骤,难以预先写清;
- 价值:结果是否值得更高的成本和延迟;
- 可行性:模型能否胜任这类任务;
- 出错代价:错误能否被发现和挽回,例如有没有测试、评审和回滚。
按我的读法,四个条件里只有可行性主要取决于模型。任务能不能预先写清,要看这家企业的流程有没有人理清楚;结果值不值得,要看业务的账;错了能不能挽回,要看客户那边有没有复核和回滚。模型升级扩大的是可行性,另外三个条件的答案要到客户的业务里去找。
模型能力和部署能力的区别在这里。模型能力是给定输入以后,模型能做到什么。部署能力是找到该给的输入,定义这家企业认可的正确输出,把结果嵌进流程,并对结果负责。模型升级提高的是前者,后者要有人在客户的业务里完成。
这门课的读者多数在国内,这里要说明一个限制。按 Anthropic 官方支持地区列表(截至 2026 年 9 月),中国大陆不在 Claude API 的服务范围内;2025 年 9 月起,Anthropic 还按股权结构限制中资控股企业使用其服务。国内企业客户的生产系统通常选择国产模型或私有化部署。这里拿 Opus 5 只作能力参照,国内的模型选型见 第 22 讲。
写代码变快以后,交接为什么成了瓶颈
上下文为什么要由同一个人或同一个单元掌握,《全球 FDE 发展研究报告》给了解释。传统交付把责任分给咨询和架构,再分给开发、交付和运维。报告认为每交接一次,就会损耗四样内容:语言转换中丢失的意思,没有说出口的设计意图,接手的人重建上下文的时间,以及沟通等待。
报告接着作出一个反直觉的判断,AI 带来的实现速度越快,这种认知断裂对整体效率的制约越明显。用一组假设的数字看比例怎么变。一个需求从提出到上线,实现要 6 周,交接和等待要 2 周,交接占总时长的四分之一。实现压到 2 周,交接和等待还是 2 周,交接就占了一半。数字是假设的,只用来说明比例;实现到底快了多少,项目层面没有数据。
能找到的研究只测到任务层面。据《全球 FDE 发展研究报告》引用,Cui、Demirer 与 Jaffe 等人 2025 年的研究汇总了三项随机现场试验,共 4,867 名软件开发者,使用 AI 编码助手的开发者完成的任务数增加 26.08%。这是完成任务数,不能换算成项目的人月、周期或质量,报告自己也这样限定。
实现变快还有第二个效应。团队一个月能出更多版本,每个版本都要对照同一个经营问题检查一遍。报告认为,各部门掌握的局部认知即使分别正确,也难以支撑高频版本对同一个问题的持续校正。版本越多,交接越多,损耗随交接次数累加。
报告因此主张由同一个责任主体掌握全程,从问题定义和架构取舍,到需求与验收,再到运行反馈和下一轮修改。报告把这个主体叫作稳定认知中心,它可以是一名 FDE,也可以是首席 FDE 带领的责任单元。问题和设计的责任,验收和结果的责任,都不能在交接中被切断。
崔牛会白皮书里的数巅智能说过相近的话。数巅把产品经理接需求、写需求文档,研发再去实现的传统链条称为信息传递损耗,认为要由一个前线连接者把多层接力变成端到端的直接连接。两份资料之间没有引用关系,结论方向一致。
模型变强,压短的是实现。实现越短,交接占的比重越大,能掌握全程的人就越稀缺。

这份工作为什么买不来,自己做也难
《关于 FDE 的 100 个问题》(作者署名磊叔)用经济学解释了这件事。科斯问过企业为什么存在,答案是市场交易有成本。书里接着引入资产专用性,任务需要高度专业化的知识时,市场上的标准化服务很难满足,企业自己做更稳妥。作者认为 AI 部署的专用性很高,每家公司的数据、流程和合规要求都不同,AI 能力又变化很快。书里没有写资产专用性这个概念由谁提出。
按这个逻辑,企业应该自己做。自己做的难处,《全球 FDE 发展研究报告》写得具体。员工掌握业务流程和行业经验,通常缺少软件架构思维和工程技能,也不承担生产级系统的责任。AI 能帮员工生成代码和搭原型,也能改局部功能,补不上系统边界和技术取舍,也补不上验收标准、安全要求和持续运行能力。
从市场上买也不合适。同一份报告分析过两种传统供给。标准软件产品必须围绕共性设计,进不了企业独有的流程和例外。传统咨询和定制开发能深入现场,但业务和技术之间要多次转述,周期长,固定成本高,上线后的责任还可能分散在不同供应商那里。
两头都不合适,就需要一种中间形态。《100 个问题》把 FDE 称为「嵌入式的混合治理」,它有内部员工的上下文深度,又保留外部专家的灵活性。作者也写明了这个解释的边界:AI 能力标准化到一定程度,专用性会下降。
需求一侧有一组小样本数据可以对照。崔牛会对企业 CIO(Chief Information Officer,首席信息官)做过一次定向探索性调研,报告没有公开样本量,按比例推算可能只有 15 份。在问 CIO 最需要 FDE 解决哪些问题的多选题里,选业务需求难以转化为技术方案的占 60.0%,选标准产品与企业实际场景不匹配的也占 60.0%。这组数字只能说明方向,不能代表中国企业 CIO 的总体。
这个解释也划出了不需要 FDE 的情况。《100 个问题》自己提醒过,如果企业买的软件本来够用,只是没人会用,需要的是一个会用的人,不需要 FDE。书里同一处还给了一个软件支出与实施支出的比例,全书没有写出处,其他六份资料也没有出现,我不引用。
范冰在书里用 Harvey 标出了另一条边界。Harvey 做法律行业的 AI 应用。范冰的判断是,保密制度、数据驻留和关键用户自主权三项障碍同时存在的市场,产品化交付进不去,只有人进到客户内部,系统才部署得进去。
我对这三项障碍的理解是这样的。保密制度让外部团队无法远程取得数据,上下文只能在现场获取。数据驻留要求系统部署在客户自己的环境里,部署和运维也在那里发生。关键用户自主权意味着每个关键用户都要单独争取。范冰描述过律所里的三层人群:合伙人付费但不亲自使用,律师助理使用但不付费,知识管理律师看得到双方的盲区。三项障碍都不存在的市场,标准产品加远程支持可能就够了。场景怎样筛选,见 第 08 讲。
派人进现场过去太贵,现在为什么算得过账
派工程师进客户现场不是新做法,Palantir 的来历见 第 01 讲。腾讯研究院报告的判断是,过去十几年里真正把这套模式做成的公司极少。2024 到 2026 年它重新流行,报告认为原因是 AI 同时改变了这套模式的三项成本结构,过去不划算的做法变得可行。报告也说明,FDE 升温不等于企业更愿意买驻场服务。
| 成本项 | 过去 | AI 之后 |
|---|---|---|
| 行业知识蒸馏 | 现场团队发现了问题,只能写需求文档,排队等产品团队评估和开发 | FDE 在现场写脚本和搭原型,还能生成测试用例,问题更快变成可验证的产品改进 |
| 定制开发 | 理解业务 → 写需求 → 排期开发 → 测试上线 | 理解业务 → 抽象语义 → 生成原型 → 现场验证,更小的团队就能完成价值验证 |
| 复合型人才供给 | 同时懂业务和技术的人才门槛很高 | AI 补上一部分工程、文档和产品能力,更多一线人员能跨越业务和技术的边界工作 |
报告对第三行加了限定。AI 压缩的是工程执行的成本;判断场景价值和理解行业逻辑的能力,以及推动组织采用的能力,不会因此变得更容易获得。这一点和前面的机制对得上,执行变便宜以后,稀缺的部分是上下文和判断。
《全球 FDE 发展研究报告》把供给和需求放在一起算账,提出三种力量:AI 降低首次实现的成本,FDE 减少认知和交接的损耗,行业资产复用降低后续项目的成本。需求一侧,企业智能化让更多生产流程成为软件可以参与的对象。两边同时作用,最小经济可行项目的门槛降低。有些企业过去因为预算太小、需求太细或变化太快,得不到定制软件,现在开始进入可服务的范围。报告判断,新增市场主要来自中小企业和细分流程。
复用降低后续成本,有一个行业基准可以参考。据全球 FDE 报告引用,北京软件造价评估技术创新联盟发布过《2025年中国软件行业基准数据》。其中的工作量调整因子,同行业有相似项目背景时为 0.8,缺少相似背景时为 1.2。这两个数是做工作量估算时用的调整因子,报告没有给出实测的节省。
这一层和模型能力的关系更直接。模型越强,原型越便宜,派一个人进现场能做的事越多,同样的预算能覆盖更小的项目。在这一层,「越需要有人」的意思是需要人的项目变多了。
中小企业能不能成为主要市场,资料之间有分歧。崔牛会白皮书里,毕昇认为中小企业负担不起 FDE,数巅认为中小企业要等产品标准化和模型成本下降。白皮书的研究判断是,重 FDE 只适合少数高价值客户。全球 FDE 报告自己也把中小企业能否承担服务成本列为全球实践还没有证明的问题,长期的单位经济也在其中。这份报告的发布方以 FDE 命名,立场是推动 FDE 成为明确的职业。
我的倾向是,门槛下降这个机制成立,中小企业付不付得起还没有证据。崔牛会的受访者是在做这门生意的厂商,判断来自自己的账;全球 FDE 报告的判断来自机制推演。在看到中小企业项目的续约和利润数据之前,我把新增市场主要来自中小企业这个判断当作待验证的假设。两份资料都认为,海外面向大客户的长期驻场做法不能直接搬到中小企业身上。国内项目的经济账见 第 04 讲,怎样让第二个客户比第一个便宜见 第 25 讲。
岗位会不会被产品和 Agent 吸收
范冰在书里引用了一条高德纳(Gartner)的预测。据 CIO.com 2026 年 5 月 6 日报道,高德纳分析师 Alex Coqueiro 预测,到 2028 年,70% 的企业将因供应商成本过高与内部技能不足,放弃由前线部署工程师主导的 Agent 方案。这条预测要到 2028 年才能检验。范冰用它提醒 FDE 团队,不要让客户觉得被绑定。
按我的理解,这条预测的两个原因都指向对外部供应商的依赖,一个是付出的钱太多,一个是企业内部没有人能接手。它预测企业会放弃 FDE 主导的方案,没有说五个连接可以不接。我的推断是,企业放弃以后,这部分工作会转给产品、平台或企业自己的团队;没有人接的,项目继续停在试点。
范冰还记录了一个更直接的质疑。Kuse.ai 创始人吴显昆认为 FDE 很难成为好的商业模式。做浅了,模型厂商自己会做;做深了,就和外包没有区别,交付成本高,也难规模化。范冰把这个质疑和高德纳的预测放在一起,判断 FDE 模式最大的敌人可能是它自己的成本结构。
崔牛会白皮书的立场是,FDE 可能是过渡性的岗位,部署能力不会消失。部署能力会被产品和平台吸收,也会流向客户团队和生态伙伴,还有一部分交给 AI Agent。吸收已经在发生,白皮书提到,Palantir 已经把部分数据转换和应用构建工作交给名为 AI FDE 的产品功能。
白皮书收录的反方样本是元理智能。元理想用虚拟商业环境和强化学习训练数字员工,让系统在自我博弈中进化,跳过人工部署。白皮书列出了这条路线还没有回答的五个问题:
- 谁定义商业环境和奖励信号;
- 谁判断模型学到的是正确的能力,没有钻规则的空子;
- 谁取得客户的信任和数据权限;
- 谁处理组织冲突、责任和伦理边界;
- 谁决定一个结果值不值得追求。
五个问题问的都是上下文和责任,和前面几节的机制指向同一处。白皮书建议换一个问法,不问未来还有没有 FDE 这个岗位,问部署责任最终由谁承担、通过什么系统承担。
我的判断是,前面这些机制能解释企业为什么需要部署能力,解释不了 FDE 这个岗位名称和人数会不会保留。决定岗位去留的变量是成本结构,也就是同类的第二个项目有没有比第一个便宜。同类项目始终要同样的人数和时间,崔牛会白皮书把这种情况叫作高端定制;经验沉淀成可复用的资产,下一个客户的交付成本才会下降。判断一个项目属于哪一种,第 03 讲 给出了三项检验;岗位的长期走向在 第 31 讲 展开。
这些机制的证据主要来自推理和访谈。80/95/99 是经验归纳,全球 FDE 报告是倡导型报告,崔牛会的受访者多是厂商,停在试点的比例出自未具名的统计。我在七份资料里找过对照数据,想看有人进现场的项目成功率是否更高,没有找到这样的研究。我接受这些机制,依据是它们和模型的三个属性一致:输出是概率性的,取不到企业没有写下的上下文,也不构成责任主体。机制说得通,不等于在你的项目里成立,下面的检查要用你自己的项目来做。
FDE 实战课连载
下一讲是《03|FDE 和售前、实施、咨询、外包的分界线》。用一张九个相邻角色的对照表和三项检验,判断一个岗位或项目是不是真正的 FDE。
历史课程:
基础