写在前面:本文基于一次真实实践:为完成一项几十万字、跨朝代的历史专题研究资料汇编(学习研究用途),我们先做能力自评,再让五份组队方案分头探索,然后综合分析、独立复核,最后收敛出可执行的编排架构。全程踩过的坑和得出的结论,都在这里。本文偏工程视角,重点讲架构设计与踩坑。
一、先说结论:单模型直写是死路
资料汇编的特点决定了它和写短文完全不同,三个硬约束摆在那里:
- 体量约束:几十万字的大体量资料,远超单次上下文窗口。任何"一次生成"的思路都不成立,必须按专题切分,每个专题独立成编,最后统一体例。
- 可靠性约束:汇编的核心价值在出处可靠。古籍精读、版本校勘、出处核实是硬要求,而大模型在原始史料考据上自评只有两星,细节年份、人名、数字动辄串台,行话叫"幻觉"。冷门细节尤其不可信。
- 一致性约束:长篇汇编做到后面,术语、纪年、体例全漂移。前面写"明成祖",后面变"永乐帝",再往后连纪年方式都换了,读者会直接失去信任。 所以架构设计的第一性原理是:把"生成文字"和"保证可靠"拆开。前者交给模型,后者交给工程。这句话是整个架构的出发点。
二、能力自评是架构设计的输入
动手前先给 AI Agent 中枢做了一次诚实自评,输出一份家底清单:
- 强项:通史脉络梳理(四星)、政治军事史叙事(四星)、大纲设计与全编统摄(四星)、工程执行力(五星)------能写代码、调 API、批量处理文件、生成规范文档。
- 弱项:原始史料考据(两星)、史学史与学术前沿(两星)、世界史冷门地区(三星)、长文本全局一致性(结构性缺陷)。 这份清单的价值在于:它直接决定了分工边界。考据必须外聘专业检索型 Agent;一致性必须外聘长上下文模型;编排调度由中枢自己扛,因为这是它唯一五星的能力。 回头看,这一步的价值被严重低估了。如果不先承认"哪些活我干不了",后面的分工设计全是空谈。诚实盘点家底,本质上是给 AI Agent 划定能力边界,是所有协作设计的前提。
三、编排架构:双长制 + 专题流水线 + 三级降级
五份方案分头探索后收敛出的架构,核心是三层,逐层展开说。
第一层,治理层(双长制)。人类定方向、担终审责任;学术总编由长文能力最强的模型担任,管体例、文风与内容质量;执行总长由 Agent 中枢担任,管编排、降级、文件与成果交付。为什么是双长制?因为五份方案在"队长选谁"上打了一架:三份选写作能力最强的国际旗舰模型,理由是统稿质量最高;一份选国产可直达模型,理由是境外接口不可访问,队长必须每天能调度;还有一份干脆让执行中枢自己兼任,理由是队长必须"能真干活"而不是"只会说"。实测辨析后发现,这是"总编辑"与"项目经理"两种角色定义之争------都成立,但分设才是正解。
第二层,流水线层。每个专题走一条标准链路:资料检索、初稿整理、逻辑审查、事实核查、体例统一,循环推进。每个工位对应一个最擅长的模型:检索交给实时检索型 Agent,核查交给推理型模型,一致性交给长上下文模型。流水线设计前做了模型能力交叉核对,这次用 AiPy 图省事,用别的工具也一样。
第三层,容错层。三级降级链:首选商业 API、备用商业 API、本地开源模型兜底。编排模块做了统一路由:超时自动重试、指数退避、无缝切换、用量统计。这条降级链不是锦上添花------方案探索阶段实测,境外模型接口确实全部超时,靠降级链才没断线。可用性是一票否决项,模型再强,接口连不上就是零。
工程上还有两个细节值得展开:
- 记忆架构要分层。全局状态、专题稿件、引用卡片、审核记录分开存,术语表和大事年表独立维护。否则几十万字塞一个文件必炸,检索和更新都会变成灾难。目录结构大致是:全局状态文件、专题子目录(各含草稿、引用、审核记录)、术语表、年表、版本快照。
- 编排骨架暂不上重型多智能体框架。角色化协作框架、有状态工作流引擎这些重型工具,等最小链路跑通、确有需要再引入。复杂度是可信度的敌人,能跑通的最小链路优先。
四、踩坑实录:分析报告也要被审计
方案探索阶段产出的综合分析报告,我们回头又做了一次独立复核,结果发现分析本身也有坑。这一段是全文最想强调的经验。
- 坑一:词频不等于论述质量。原分析用关键词出现次数衡量各方案的"维度强弱",复核发现不同维度的统计口径不统一------有的维度用宽口径词,有的用窄口径词,对比强度会失真。比如"编排框架"维度,严格按框架名统计,某方案只有六次命中,宽口径却有十一次。词频只是线索,不是证据。
- 坑二:把"有代码"当成"有原型"。原分析称"只有一份方案交付了可运行代码",复核各目录发现五份方案都躺着四到十五个脚本。真正的区别是脚本性质:四份是过程性脚本(抓网页、查资料、生成文档),只有一份交付了与方案设计直接对应的编排原型(统一路由、超时重试、自动降级、用量统计)。审计要看代码性质,不看数量。
- 坑三:分析止步于"建议"。原分析识别了六大分歧,却只对"队长人选"给了明确解法,其余五个分歧只罗列不决断。报告写得再漂亮,不落成决断,就等于把球踢回给用户。分析必须收敛成决断清单才算完成。方案交叉比对环节我们用的是 AiPy,图它省事,您用顺手的工具也一样。
五、收敛清单:六个决断
把所有分歧逐一拍板,形成这份可直接执行的清单:
- 队长架构:双长制,学术总编 + 执行总长,两个角色分设。
- 本地路线:先纯商业 API 起步,编排模块预留三级降级接口,本地开源模型做兜底。
- 成本控制:混合轨,关键环节用旗舰模型保质量,批量环节用高性价比模型降成本。成本估算为推算值:全商业轨约一百多美元量级,混合轨几十美元量级,全本地轨接近零接口成本------未做实机长跑,请以实际消耗为准。
- 编排框架:暂不引入重型多智能体框架,中枢原生编排,先跑通最小链路。
- 工程起点:以已交付的编排原型为基础,扩展为完整流水线。
- 落地前提:先定专题、时段范围、体量、截稿日。脱离专题的一切方案都是通用模板,无法针对性配置。
六、工程细节补充:编排模块的实现要点
架构定了,落地全看编排模块。这里把实现要点逐条展开,供工程同学参考:
- 统一接口层:不管底层接几家模型,对上只暴露一种调用方式,按角色自动选路由。这样换模型不用改业务代码,资料汇编跨数月周期,模型换代是必然事件,接口层必须先稳住。
- 重试与退避:超时先重试,间隔按指数退避,连续失败才触发降级。每次降级都在日志留痕,方便事后归因。资料汇编的流水线一环扣一环,静默失败比显式失败危险得多。
- 用量统计:按阶段累计调用量,每个专题核算一次。资料汇编的成本大头在批量整理和核查,统计不到专题就算不清账。
- 结构化产出:引用卡片用统一字段落盘,出处、版本、页码齐全。后续核查和生成参考文献全靠它,这是汇编可信度的地基。
- 版本快照:每个专题完成后做一次快照,试错成本立刻变低,随时可回退重来。
- 失败兜底:任何一环卡死,自动把半成品与状态落盘,支持断点续作。对几十万字量级的资料汇编来说,从头再来是最大的浪费,断点续作是刚需。 这些要点不复杂,但都来自资料汇编的实测试错。长周期工程里,工程细节的可靠性最终决定成品能不能立得住。
七、结语
这套架构才走到"方案收敛",专题样编还没开做,但方向已经从"能不能用 AI"变成"怎么把流水线跑稳"。下一步就是用一份专题样编把"整理、考辨、统稿、终审"全链路跑通,验证后再全面铺开。成文前又用 AiPy 核了一遍------图它省钱省力,您用熟悉的工具一样能复核。
汇编很长,路要一步步走。先把专题定死,把骨架搭稳,把样编跑通------架构的答案,最终要靠成品来验证。 (全文完)