背景:
- 最近一直在看中医/喝中药补身体,医生每2周去看一次,诊脉看舌苔问诊后再微调中药配比和成分。感觉这个流程很有意思。
- 今天在学习 AI Harness:《
Why The Harness Matters More Than The Model | YC Paper Club》- 突然灵光乍现,感觉这两者有点交集,便问了 AI 好几个问题。以下是 AI 自己根据它自己的回答总结的技术文章。
背景完。
一句话总结 :传统软件工程处理的是可规定、可复现、可验证的确定性逻辑;现代 AI 处理的是从数据中归纳出来的概率性泛化。中医辨证论治,与 AI 有结构上的相似:知识不是明文规则,而是隐式经验模式;输出不是逻辑必然,而是条件分布下的高概率选择。AI Harness 最该学的,不是让模型变确定,而是用确定性外壳包住概率内核,把方差和尾部风险压到可接受范围。
0. 摘要
本文整理一次关于"AI 与传统软件工程最大区别"的讨论,并延伸到中医与 AI Harness 的类比。
核心脉络如下:
- AI 与传统软件工程的最大区别:传统软件追求规格、代码、执行、验证的确定性闭环;AI 是数据、训练、权重、概率生成。
- 中医是"概率性泛化"的典型传统体系:辨证论治、方证相应、针灸配穴,都是从大量经验样本中归纳隐式模式,再对新情境做情境化判断。
- 中医用一套经验工程控制风险:强先验、辨证纲领、四诊合参、安全禁忌、三因制宜、复诊反馈、师承会诊、药材炮制、制度监管、现代循证。
- 这些手段几乎可以一一映射到 AI Harness:版本化政策包、任务路由、规则引擎、RAG、多源证据、沙箱、审批、回滚、监控、拒答转人工、案例回流。
- 成熟度不均:提示、路由、RAG、护栏、微调、监控、转人工已较广泛;但版本化与 eval 门禁联动、风险分层硬约束、多源证据仲裁、工具事务回滚、OOD 校准拒答、在线闭环案例回流仍不成熟。
- 后续优先级:先压尾部风险,再提上限。优先做版本化 + eval 门禁、风险路由 + 硬规则、工具沙箱 + 审批 + 回滚、证据分级 + 冲突仲裁 + 校准、OOD 拒答 + 转人工 + 案例回流。
1. 起点:AI 与传统软件工程的最大区别
传统软件工程的核心链路是:
规格 → 代码 → 执行 → 验证
你写下规则,系统按规则运行。相同输入、相同状态,原则上应得到相同输出。Bug 可以被定位到某一行代码、某个状态、某个依赖;正确性可以用单元测试、契约、形式化验证来逼近"布尔式"的保证。
现代 AI,尤其是大模型,核心链路是:
数据 → 训练 → 权重 → 概率生成
它没有把"如果 A 则 B"的规则显式写出来,而是把统计规律压进参数里。它的输出不是逻辑推导的结果,而是对"最可能合适答案"的采样。
因此:
- 同一问题换个说法,答案可能变;
- 同一输入,因采样设置不同,输出可能变;
- 错误不是"某一行写错了",而可能是数据偏差、分布偏移、提示敏感、幻觉;
- 正确性很难用"满足/不满足规格"判断,只能用评估集、指标、人类反馈、线上监控来统计性判断。
所以,最大区别不是"AI 会不会犯错",而是"正确性是否可以被确定性地规定和复现"。
传统软件工程追求的是:在明确边界内,行为可预测、可审计、可验证。
AI 工程追求的是:在开放分布中,行为统计上可用、可评估、可对齐、可监控。
工程方法也因此不同:
| 维度 | 传统软件 | AI 系统 |
|---|---|---|
| 核心资产 | 代码、规格、架构 | 数据、权重、提示、上下文 |
| 正确性 | 布尔式、可证明 | 统计式、可评估 |
| 复现性 | 强 | 弱,受采样与分布影响 |
| 错误定位 | 行级、状态级 | 数据、分布、提示、模型、工具链 |
| 工程重点 | 测试、契约、版本 | 评估、对齐、监控、回滚 |
传统软件更像"造一台按图纸运行的机器";现代 AI 更像"训练一个在统计意义上表现良好的专家系统"。
2. 中医:另一种"从数据中归纳出来的概率性泛化"
如果只选一项类似,最典型的是:
中医的辨证论治体系,尤其是经方方证与针灸配穴。
2.1 为什么说它们和 AI 有结构同构
不是"中医就是 AI",而是它们的知识形态和决策方式有结构上的相似:
| 层次 | 中医 | AI |
|---|---|---|
| 数据层 | 医案、脉案、舌象、本草性味 | 语料、标注、日志、反馈 |
| 模型层 | 六经、脏腑、经络、方证、药证 | 权重、隐层表示、概率分布 |
| 输出层 | 同病异治、异病同治、随证治之 | 条件生成、采样、多候选 |
| 验证层 | 复诊、反馈、调整 | 评估集、指标、在线监控 |
| 传承层 | 师承、口诀、手感、默会知识 | 微调、few-shot、人类反馈 |
中医看到一组症状、脉象、舌象、体质、节气,并不是在查一张固定表,而是在做模式识别:这组表现更像哪个"证"?这个证与哪些方、哪些穴、哪些加减法在历史上高频共现?
这很像大模型从语料中压进权重的统计关联,只不过中医的"权重"藏在师承口诀、医案类比和身体记忆里。
2.2 典型特征:同病异治、异病同治、随证治之
同一个感冒,有人用麻黄汤,有人用银翘散,有人要扶正;同一个人,夏天和冬天不同,南方和北方不同。处方不是确定性的唯一解,而是对当前情境最可能合适的方案。
针灸也一样:同一种病,取穴、补泻、时辰、得气反应都可能不同。
这非常像概率生成:输出不是逻辑必然,而是条件分布下的高概率选择。
2.3 区别也要说清
AI 靠数学优化和大规模算力;中医靠身体感官、师徒传承和文化语境。中医并不"保证"优质结果,也没有现代统计学意义上的校准。误诊、误治、药害、"坏病"始终存在。
所以,更准确的说法是:
中医是一套前现代的经验工程,用强先验、结构化辨证、安全禁忌、反馈复诊和制度监管,把概率性泛化的方差和尾部风险尽量压小。
3. 中医如何控制概率泛化的质量与风险
中医并不保证每次高分,但它试图避免最坏结果,并在反馈中不断修正。具体手段可以分十层。
3.1 强先验与经典约束:相当于基座模型加版本管理
《黄帝内经》《伤寒论》《金匮要略》《神农本草经》《本草纲目》等,构成了一套强先验。后世注疏、校勘、医案,类似不断更新的训练语料和版本修订。
尤其是"方证相应""有是证用是方",把很多决策压成较硬的对应关系,减少随意泛化。
3.2 辨证纲领:相当于降维、正则化和隐变量
八纲辨证、六经辨证、脏腑辨证、卫气营血、三焦辨证,把高维、嘈杂的症状映射到低维"证型"。
这既像特征工程,也像正则化:防止一两个症状就过度推断。证型不是确定规则,但它让泛化有框架、有边界。
3.3 四诊合参与置信度加权:相当于多模态融合
望闻问切、十问歌,要求多源信息互证,不能单凭一脉一舌。遇到矛盾时,有"舍脉从证""舍证从脉"等权衡原则,类似不同模态的置信度加权。
目的是降低单点噪声导致的误判。
3.4 方证相应:相当于规则引擎与约束解码
有是证,用是方。关键动作必须满足硬规则。比如麻黄汤证要求无汗、脉浮紧,若汗出脉弱则禁用,防止误汗。
这类似输出 JSON schema、grammar、前置条件检查。
3.5 安全护栏与禁忌:相当于约束解码和拒绝采样
十八反、十九畏、妊娠禁忌、毒性药炮制、先煎久煎、剂量法度、中病即止、得下即止,都是硬约束。
大承气汤"得下即止",类似 early stopping。这些手段不保证最优,但优先避免灾难性错误。
3.6 三因制宜:相当于条件生成
因时、因地、因人,强调同病异治。它承认输出不是全局唯一解,而是条件分布下的情境解。
这能提高个体适配度,但也要求医生对上下文有准确判断。
3.7 复诊与随证治之:相当于在线学习和反馈闭环
《伤寒论》讲"观其脉证,知犯何逆,随证治之",这是典型的纠错机制。还有"效不更方,无效更方"、小剂量试服、试探性治疗、复诊调方。
中医把一次处方看作一次带反馈的干预,而不是一锤定音。
3.8 师承、医案、会诊:相当于微调、人类反馈和集成投票
师带徒是典型的默会知识传递,类似领域微调。医案记录成败,类似带标注的经验数据。会诊、病案讨论、流派互参,类似多模型集成,降低单个医生"模型"的偏差。
但医案也有发表偏倚和幸存者偏差。
3.9 道地药材与炮制规范:相当于数据治理和输入标准化
"橘生淮南则为橘,生于淮北则为枳。"产地、采收、炮制、煎服法,都会改变药性。
道地药材、如法炮制、药典规范,是在控制输入分布,减少数据漂移。没有这一层,再好的辨证也会被劣质药材拖垮。
3.10 制度与伦理:相当于监管和准入
行医资格、药肆管理、药典、师承考试、医案考核,以及"六不治"等拒治原则,都是制度性护栏。
危重症转诊、不治已病治未病,类似分诊和拒答机制。
3.11 现代补强:循证医学、RCT、真实世界研究、药物警戒、AI 辅助
传统中医的这些手段,能提高稳定性和安全性,但不能像形式化验证那样给出确定性保证。
所以现代中医必须加上随机对照试验、Meta 分析、真实世界数据、毒理与药物警戒、标准化电子病历,以及 AI 辅助决策和监控。
4. 映射到 AI Harness:确定性外壳包裹概率内核
4.1 什么是 AI Harness
本文讨论的 AI Harness 取广义:
围绕模型的运行、评估、反馈、治理脚手架:提示与策略、工具调用、状态机、护栏、评估集、监控、回滚、审计。
核心原则一句话:
用确定性外壳,包裹概率性内核。
中医的"辨证论治"是概率内核;禁忌、炮制、复诊、师承、药典、制度是确定性外壳。AI Harness 也该这么干。
4.2 一一映射表
| 中医手段 | AI Harness 对应 | 具体怎么做 |
|---|---|---|
| 经典先验、版本注疏 | 系统提示、政策包、模型/数据版本 | 把 system prompt、工具 schema、安全策略、知识库版本化;变更必须过 eval 门禁,可回滚 |
| 八纲、六经、脏腑辨证 | 任务路由、状态机、本体 | 先分类意图、领域、风险等级,再选模型、提示、工具和流程;高风险走慢路径 |
| 方证相应 | 规则引擎、约束解码 | 输出 JSON schema、grammar、前置条件;关键动作必须满足硬规则 |
| 四诊合参 | 多源证据融合、RAG | 用户输入、检索、工具结果、记忆都带来源和置信度;冲突时按权威、时效、投票解决;强制引用 |
| 十八反、十九畏、妊娠禁忌 | 安全护栏、权限控制 | 工具白名单、最小权限、沙箱、禁止组合、预算、超时、最大步数、kill switch |
| 三因制宜 | 上下文条件化 | 注入用户画像、地域、时间、合规区域;个性化但受策略约束 |
| 复诊、随证治之 | 在线反馈闭环 | 执行后验证,失败重试、换策略、回滚;A/B、监控、告警 |
| 师承、医案、会诊 | 微调、案例库、多智能体 | few-shot、LoRA、专家反馈、相似案例检索;高风险用多模型投票/辩论/仲裁 |
| 道地药材、炮制 | 数据治理、预处理 | 权威源、时效、去重、清洗、脱敏、格式规范化、嵌入模型版本管理 |
| 药典、行医资格 | 治理、审计、合规 | 日志、trace、审计、准入评估、责任链、SLO、模型卡、数据卡 |
| 六不治 | 拒答、转人工 | 低置信度、分布外、高风险、超出能力时转人工或拒绝 |
| 现代补强 | 统计评估、红队、形式化验证 | eval harness、回归门禁、校准、OOD 检测、红队、关键路径形式化验证 |
4.3 具体架构流水线
可以做成这样一条流水线:
- 入口层:输入规范化、脱敏、意图分类、风险评分。
- 路由层:按任务类型和风险选模型、提示、工具、检索源。
- 上下文层:RAG 检索、工具查询、记忆注入;每条证据带来源、时间、置信度。
- 推理层:生成计划、多候选答案、自检;高风险任务多模型投票或辩论。
- 约束层:schema 验证、规则引擎、权限检查、约束解码。
- 执行层:工具沙箱、dry-run、审批、事务、幂等、超时、回滚。
- 验证层:事实核查、引用检查、单元测试、模拟执行、输出过滤。
- 反馈层:日志、指标、用户反馈、在线评估、案例入库、定期微调。
- 治理层:版本管理、审计、合规、SLO、灰度、回滚、责任链。
4.4 例子:退款 Agent
- 入口:识别"退款"意图,风险中高。
- 路由:走退款专用提示和工具。
- 上下文:检索退款政策、订单历史。
- 推理:模型生成退款方案。
- 约束:规则引擎检查订单存在、金额≤原额、时间窗口、用户权限。
- 执行:沙箱 dry-run,高风险转人工审批,再真实调用支付工具。
- 验证:确认退款成功、金额正确、日志完整。
- 反馈:失败则回滚或重试;案例入 eval 集;监控退款异常率。
这其实就是中医的"辨证---方证---禁忌---复诊"结构。
5. 成熟度盘点:哪些已经用了,哪些没有
以下按头部生产系统与一般团队的成熟度判断。很多手段是"有,但很浅"。
5.1 已经广泛应用或部分广泛应用的
| 中医手段 | AI Harness 对应 | 成熟度 |
|---|---|---|
| 经典先验、版本注疏 | system prompt、模型、知识库、工具 schema 版本化 | 头部广泛,小团队弱 |
| 八纲/六经辨证 | 意图分类、任务路由、状态机、Agent 框架 | 广泛 |
| 方证相应 | JSON schema、function calling、约束解码、规则引擎 | 广泛 |
| 四诊合参 | RAG、多源检索、引用来源 | 广泛,但冲突仲裁弱 |
| 十八反、妊娠禁忌 | 内容过滤、权限、沙箱、工具白名单 | 广泛 |
| 三因制宜 | 用户画像、地域、时间、合规上下文注入 | 广泛但粗糙 |
| 复诊、随证治之 | 日志、监控、A/B、重试 | 部分广泛,自动回滚少 |
| 师承、医案、会诊 | few-shot、微调、案例库 | 广泛;多智能体辩论生产少 |
| 道地药材、炮制 | 数据清洗、去重、脱敏、格式规范 | 广泛但质量参差 |
| 药典、行医资格 | 审计、合规、模型卡 | 头部广泛,小团队少 |
| 六不治 | 拒答、转人工 | 广泛 |
| 现代补强 | 离线 eval、红队 | 头部广泛,形式化验证少 |
一句话:"提示、路由、RAG、护栏、微调、监控、转人工"已经广泛;但把它们串成严格闭环和门禁的很少。
5.2 还没有广泛应用或很不成熟的
- 版本化政策包 + eval 门禁联动:很多团队改 prompt、换模型、换知识库不上回归测试,也不强制灰度回滚。
- 风险分层路由 + 硬规则全覆盖:有意图分类,但高风险任务没有强制走慢路径、规则引擎和人工审批。
- 多源证据的权威分级、时效加权、冲突仲裁、置信度校准:RAG 有引用,但来源谁更权威、冲突时听谁、置信度是否校准,普遍弱。
- 工具组合安全、dry-run、事务回滚:单工具权限有,多工具组合风险、预执行、幂等、回滚不系统。
- OOD 检测与校准驱动的拒答转人工:拒答有,但很多靠关键词或阈值,不是校准后的分布外检测。
- 在线闭环自动诊断、策略切换、案例回流:监控有,自动定位失败、换策略、回滚、把失败案例回流到 eval/训练集,少。
- 多模型集成/辩论/仲裁用于高风险:研究多,生产少。
- 数据漂移、嵌入模型版本、输入分布监控:数据治理有,但漂移监控和版本联动不普遍。
- 因果评估、真实世界研究、药物警戒式线上安全监控:A/B 有,因果推断和长期安全信号少。
- 责任链、审计、模型卡/数据卡标准化:大厂有,行业不统一。
- 关键路径形式化验证:几乎只在金融、航天等少数领域。
6. 后续优先级:先压尾部风险,再提上限
按"先压尾部风险,再提上限"的顺序,建议如下。
P0,立刻做
- 版本化政策包 + eval 门禁
所有 prompt、工具 schema、安全策略、知识库、模型版本全部版本化;变更必须过离线 eval、红队、回归测试,可灰度、可回滚。
对应中医"经典先验 + 药典 + 版本注疏"。 - 风险分层路由 + 硬约束
先判风险等级和领域,再选模型、提示、工具、流程。关键动作用传统代码、规则引擎、约束解码兜底。
对应"辨证纲领 + 方证相应 + 禁忌"。 - 工具沙箱 + 审批 + 回滚
最小权限、dry-run、事务、幂等、超时、最大步数、kill switch;高风险动作转人工。
对应"十八反 + 复诊 + 中病即止"。
P1,紧接着做
- 多源证据权威分级 + 冲突仲裁 + 置信度校准
来源分级、时效加权、强制引用、投票/仲裁、校准。
对应"四诊合参"。 - OOD 检测 + 拒答转人工 + 在线监控
低置信、分布外、高风险、超能力时转人工;监控告警。
对应"六不治 + 复诊"。 - 案例回流 + 定期更新
失败案例入 eval 集,专家标注,更新 few-shot、RAG、微调。
对应"师承 + 医案"。
P2,中期做
- 多模型集成/辩论/仲裁用于高风险。对应"会诊"。
- 数据漂移与嵌入模型版本监控。对应"道地药材 + 炮制"。
- 审计责任链、模型卡、数据卡、合规。对应"药典 + 行医资格"。
- 关键路径形式化验证、因果评估、真实世界研究。对应"现代补强"。
如果只做五件事
- 版本化 + eval 门禁;
- 风险路由 + 硬规则;
- 工具沙箱 + 审批 + 回滚;
- 证据分级 + 冲突仲裁 + 校准;
- OOD 拒答 + 转人工 + 案例回流。
这五个,正好对应中医的"经典先验、辨证、方证、禁忌、四诊合参、六不治、复诊"。
7. 结语
AI Harness 不能让模型变确定,但可以把概率泛化的方差和尾部风险压到可接受范围。
中医的经验工程,是一套前现代版本的概率系统治理:
强先验、分型路由、多证据、硬禁忌、反馈复诊、师承集成、数据治理、制度护栏。
AI Harness 最该学的,不是玄学化中医,而是把这套思路转译成现代工程语言:
确定性外壳 + 概率内核 + 反馈闭环 + 治理审计。
传统软件像按图纸运行的机器;现代 AI 像训练出来的专家系统。
而 AI Harness 的任务,就是让这个概率性专家系统在真实世界里:
少犯大错,可被监控,可被纠正,可被追责,可被回滚。