第 10 篇 数据飞轮与冷启动:AI 产品的数据从哪来
本篇属于「工程质量」模块,紧接第 09 篇。09 篇讲"怎么测",本篇讲"数据从哪来、怎么让数据越用越多、越用越好"。它解决 AI 产品启动第一天就面临的最硬约束:没有数据,再强的模型也答不对、答不规范、没法变好。
引言:模型可以买,数据不能买
一个常被忽视的结构性事实:AI 产品与纯软件产品的根本差别,不在代码,在 data 依赖。
纯软件产品,功能写完就基本定型,数据多半是用户行为日志,用来优化体验。AI 产品不一样------它的"正确性"本身由数据决定。知识数据决定它能不能答对,示例数据决定它答得规不规范,反馈数据决定它能不能持续变好。这三样,没有一样能用钱直接买来现成的。模型可以调用 API 租到,但"你的业务里的正确"只能从你自己的场景里长出来。
结论先行:AI 产品的竞争力最终落在数据上。谁先把数据飞轮转起来,谁就建起对手抄不走的壁垒------因为数据是非线性积累、越用越厚的。
一、AI 产品需要的三类数据
混为一谈会害死项目。三类数据用途完全不同,来源、更新频率、作用环节都不同。
| 类型 | 用途 | 来源 | 更新频率 | 作用环节 |
|---|---|---|---|---|
| 知识数据 | 喂 RAG,决定"能不能答对" | 内部文档、工单、知识库、公开数据 | 中--高(业务常变) | 检索与生成的基础 |
| 示例数据 | few-shot 或微调,决定"答得规不规范" | 专家手写、历史优质回答、合成扩充 | 低(风格稳定) | prompt / 训练 |
| 反馈数据 | 做迭代,决定"能不能持续变好" | 用户行为、人工标注、评分 | 高(持续产生) | 评测集更新 / 再训练 |
一个关键判断:这三类数据不能互相替代。 没有知识数据,模型靠参数硬猜会编;没有示例数据,回答格式与语气会飘;没有反馈数据,系统永远停在 v1,永远不会因为你上线了而变好。
与《第 05 篇:RAG 产品设计与调优实战》的关系:知识数据质量直接决定 RAG 的天花板,检索再好也救不回一堆过时矛盾的文档。
二、冷启动:没有数据时的三条路
产品第一天,三类数据可能全空。这是最难的时刻,但路是有的。
2.1 知识数据冷启动
知识数据决定了"能不能答对",冷启动靠三招:
- 存量文档挖掘:历史文档、客服工单、内部 wiki、邮件往来里藏着大量隐性知识。它们往往非结构化、重复、过时,需要清洗和去重后才能喂 RAG。这一步是最便宜的知识来源,因为"东西本来就有,只是没整理"。
- 专家访谈结构化:把老师傅、资深客服、业务骨干脑子里的经验,转成"问答对"形式的可检索知识。例如"用户问 X 时,正确口径是 Y,常见误区是 Z"。这类知识最值钱,因为它补的是文档里没有、但一线天天在用的 tacit knowledge。
- 公开数据集与行业标准:行业白皮书、国标/行标文档、公开评测集,可作为基础层。注意版权(见第七节),优先用明确可商用的来源。
专家访谈的价值在于它能挖出"文档写不出、但一线天天用"的隐性口径。一次有效的访谈,产出不是一段录音,而是一批结构化问答对。可直接套用的访谈产出模板:
markdown
# 专家知识抽取卡(单条)
主题: 退换货政策口径
触发场景: 用户咨询"已拆封商品能否退"
标准回答: 在 X 日内、不影响二次销售的前提下可退;拆封但完好的配件类商品适用此规则
常见错误口径: "拆封一律不退"(过度收紧,与现行规则不符)
依据来源: 202X 版售后管理规范 第 N 条 / 资深客服确认
边界与例外: 食品、定制类除外;赠品拆封不可退
关联知识ID: KB-退货-003
这张卡是知识数据的最小单元:它把"老师傅怎么说"变成"系统可检索、可溯源、可复核"的结构化记录。每条都带"常见错误口径"和"边界例外",正是为了提前堵住模型最容易幻觉的地方。
2.2 示例数据冷启动:专家手写 50 条 > 合成 5000 条
这是最反直觉、也最该坚持的一条。让领域专家先手写 50 条高质量示例,价值远高于用模型合成 5000 条。
为什么?因为示例数据要定义的是"什么叫对、什么叫好"。专家手写的是真实业务里的正确范式------边界清晰、口径权威、覆盖真实长尾。模型合成的是模型"以为的对",它只能重新排列它已有的认知,既发明不出领域知识,也识别不了自己没见过的失败形态。用 5000 条合成数据,你得到的是"看起来很多、其实都在舒适区"的噪音。
50 条不是随便写。它们应该:覆盖核心失败模式(呼应第 09 篇按失败模式分层)、代表真实用户问法、每条都经得起"这就是标准答案"的检验。这 50 条定标后,再用合成做表达层面的扩充才安全。
2.3 用 AI 造数据的正确姿势与风险
合成数据不是不能用,是要用对地方、知道边界。
| 维度 | 能做什么 | 不能做什么 |
|---|---|---|
| 表达多样性 | 把同一意图改写成多种问法,扩充训练/测试的表达覆盖 | 不能发明新的领域事实 |
| 格式变体 | 生成不同格式的标准回答,训练格式鲁棒性 | 不能保证事实正确 |
| 边界扩充 | 在已知范围内生成对抗样本 | 无法创造未知失败形态 |
最危险的是**"自噬"问题**:用模型生成的数据训练模型,再用训练后的模型生成新数据再训练......循环几轮后,数据分布会塌缩到模型自己最"舒适"的一小块区域,多样性丧失,盲区被放大(研究上称为 model collapse / 模型坍塌)。纪律:合成数据占比要有上限(经验上不超过总训练/示例数据的 30%--50%),且必须与真实/专家数据混合,每隔几轮用真实数据"校准"一次。
三、数据质量 > 数据数量
在 AI 产品里,100 条干净数据常胜过 10000 条脏数据。脏数据不仅没用,还会主动把系统带偏。
3.1 脏数据的四类典型问题
| 类型 | 表现 | 危害 |
|---|---|---|
| 过时 | 旧价格、旧政策、已下线的功能 | 直接产出错误答案,且最难发现 |
| 矛盾 | 同一问题在不同文档里答案不同 | 模型随机采信,结果不可预测 |
| 颗粒度不匹配 | 训练数据是长文,线上是短 query;或反之 | 分布错位,泛化差 |
| 格式混乱 | 字段缺失、编码乱、模板不一 | 解析失败,评测噪声大 |
3.2 清洗优先级
不是所有脏数据都先洗。按"危害 × 影响面"排序:
- 先删过时与矛盾:它们直接制造错误答案,且会被系统当作"事实"输出,危害最高。矛盾数据尤其要先消歧(确定唯一口径)再入库。
- 再统格式:统一字段、编码、模板,让数据可被程序稳定读取,降低下游噪声。
- 最后补缺口:在前两步之后,再针对性补缺失的场景覆盖。顺序错了,你会在垃圾上精雕细琢。
四、反馈数据的采集设计
反馈数据是飞轮的燃料,但它最容易被采"废"。设计的核心是:采到的是真信号,不是礼貌。
4.1 显性反馈 vs 隐性反馈
| 类型 | 例子 | 可靠性 | 问题 |
|---|---|---|---|
| 显性反馈 | 点赞/点踩、星级、问卷 | 中--低 | 易被礼貌性点击带偏;样本少 |
| 隐性反馈 | 是否修改输出、是否采纳、停留时长、是否重试 | 高 | 需埋点,解读要小心 |
关键结论:修改行为比点赞更能说明问题。 用户点个赞可能只是礼貌;但用户把 AI 生成的内容大改特改,说明这条输出基本不可用。第 02 篇就强调过:采纳率、修改率、放弃率,是 AI 产品最诚实的三组数字。点赞会被礼貌性点击,修改不会。
4.2 什么时候问用户
- 不要打断:在用户正忙、正阅读时弹问卷,得到的都是敷衍。
- 在完成动作后问:用户刚用完、看到了结果,反馈最准。
- 一次只问一个:"这条回答有用吗?"一个二元问题,比一套五题问卷回收率高一个量级。
4.3 如何降低反馈成本
- 把反馈做成一个动作(点踩、标"不对"),而不是一段填写。
- 用隐性信号自动采集,显性信号只做抽样补充。
- 对高价值失败案例,才值得让用户多写一句"哪里错了"。
4.4 反馈信号埋点清单(可直接套用)
反馈数据不会自动出现,要在设计期就埋好。一份覆盖三类的埋点清单:
markdown
# 反馈信号埋点清单(AI 功能)
## 隐性行为信号(自动采集,优先级最高)
- [ ] 采纳率:用户是否把 AI 输出原样使用(未改即用)
- [ ] 修改率:用户复制后做了多少编辑(改写比例、编辑时长)
- [ ] 放弃率:生成后是否未使用即离开 / 重新提问
- [ ] 重试率:同意图重复发起次数(暗示首答不满)
- [ ] 轨迹信号:第几轮放弃、是否切人工
## 显性反馈信号(抽样采集)
- [ ] 点踩/标"不对":轻量动作,全量可点
- [ ] 有用性二元问:完成后问一次"这条有用吗?"
- [ ] 自由文本:仅对高价值失败案例触发
## 成本信号(工程侧)
- [ ] 单次 token 消耗、缓存命中率
- [ ] 降级/兜底触发次数
- [ ] 工具调用失败率(Agent 场景)
这份清单的要点:隐性行为信号放在最高优先级,因为它们不依赖用户"愿意反馈",而是从真实使用里自然流出;显性信号做抽样补充,避免打扰。两者合起来,才能既看"用户说好不好"也看"用户做不做"。
五、飞轮真正转起来的样子
飞轮不是一个比喻,是一套有节奏的运营动作。断一天不动,数据就 stale;但也不需要天天高强度,关键是稳定每周转一圈。
5.1 闭环图
生产环境 trace(含成功与失败)
│
┌──────────────┼───────────────────┐
│ │ │
采样标注 发现新失败模式 发现检索盲区
│ │ │
└──────┬───────┴───────┐ │
▼ ▼ ▼
补进 golden set 更新质量定义 补知识库
│ │ │
└───────┬───────┘───────────┘
▼
下一轮评测(第 09 篇)
│
▼
发布更好的版本 ──→ 产生新 trace ──→ 回到顶部
5.2 每周节奏表
| 星期 | 动作 | 产出 |
|---|---|---|
| 周一 | 采样本周 trace(生产 5--20%,错误日志高采样) | 待标注样本池 |
| 周二 | 人工标注失败案例,定标"什么算错" | 标注后的失败样本 |
| 周三 | 归集:去重、分类、消歧 | 结构化新数据 |
| 周四 | 并入测试集 / 知识库 / 质量定义 | golden-v(N+1)、知识库更新 |
| 周五 | 重跑全量评测,对比基线 | 评测报告(结论先行) |
强调:节奏比强度重要。 每周稳定转一圈,比每季度突击一周更有复利。飞轮的价值是非线性的------早期积累慢,越过某个阈值后,你的数据资产对手就是抄不走的。
六、飞轮的三个常见断点
很多团队"建了飞轮但没转",根因通常是三个断点之一。
- 采集了但没人看:trace 堆在日志里,从没人采样标注。数据在库里腐烂。治法是把"周二标注"写进某人的周责,而非"有空再看"。
- 标注没有规范:不同人标注标准不一,同一失败有时记有时不记,数据不可用。治法是像第 09 篇那样写可执行标注规范,并定期算标注一致性。
- 只进不出:数据进了库,但从未影响任何决策------没进测试集、没改 prompt、没补知识库。这是最隐蔽的断点,因为"看起来在做事"。治法是每条入库数据都要有去处:进 golden set、进知识库、或进质量定义,三选一。
七、数据合规红线(通用原则)
本节只给通用原则,不列具体法条编号(各地法规差异大,且迭代快,请以最新合规要求为准)。
- 用户数据用于训练的边界:把用户对话、内容用于改进模型前,需明确告知并获得同意(或在条款中载明用途)。默认"可以拿用户数据训练"是高危假设。
- 脱敏要求:进入 golden set、知识库、训练集的任何用户数据,必须先脱敏------去标识、去 PII(个人身份信息)、去敏感业务字段。
- 留存期限:数据不是留越久越好。明确分类分级,设定留存上限与到期销毁机制,避免"无限堆积"带来的合规与成本风险。
- 外部内容引入的版权风险:把第三方文档、网页、公开数据集喂进产品前,确认其授权范围是否覆盖你的使用方式(训练 / 检索增强 / 商业用途)。模糊处一律按"不可商用"处理,宁可不引入。
落地时,把这四条写成一份上线前的合规检查清单,比口头约定可靠:
markdown
# 数据合规上线检查清单
- [ ] 用户数据用途已在隐私条款/授权中明示,且覆盖"用于改进模型"
- [ ] 进入任何数据集的用户内容已完成脱敏(去 PII、去标识)
- [ ] 已定义各类数据的留存期限与到期销毁机制
- [ ] 所有外部引入内容(文档/网页/数据集)已确认授权范围
- [ ] 知识库更新触发重新评测(见第 09 篇),避免带病知识上线
注意最后一条:合规不只是"能不能用这份数据",还包括"这份数据上线后会不会让系统变坏"。知识库一旦引入未核实的内容,下一轮评测就该把它拦下来。
一页速查
数据飞轮搭建清单
├─ 三类数据,用途不同,不可互替
│ 知识数据:能不能答对(喂 RAG,更新中--高)
│ 示例数据:答得规不规范(专家手写/few-shot,更新低)
│ 反馈数据:能不能持续变好(行为/标注,更新高)
├─ 冷启动三条路
│ 知识:存量文档挖掘 + 专家访谈结构化 + 公开数据
│ 示例:专家手写 50 条 >> 合成 5000 条
│ 合成数据:只补表达/格式,占比 ≤30--50%,防自噬塌缩
├─ 质量 > 数量:先删过时/矛盾,再统格式,最后补缺口
├─ 反馈设计:改行为比点赞真;完成后问、一次一问、降成本
├─ 飞轮节奏:周一采样/周二标/周三归集/周四并入/周五重跑
└─ 合规红线:告知同意 / 先脱敏 / 设留存期 / 外部内容查授权
常见坑
- 三类数据混用:拿反馈数据当知识数据喂 RAG,系统把用户随口说的当事实。
- 冷启动靠合成堆量:5000 条合成示例看着多,全在模型舒适区,真实长尾零覆盖。
- 专家手写敷衍:50 条没覆盖失败模式,定标失败,下游全歪。
- 合成数据自噬:模型生数据训模型循环,分布塌缩,盲区放大。
- 只洗格式不删矛盾:在矛盾数据上精雕细琢,系统输出随机对错。
- 用点赞当真理:礼貌性点赞掩盖真实不可用,修改率才是真信号。
- 打断式问卷:用户在忙时被弹窗,反馈全废。
- 飞轮只进不出:数据入库却从不影响决策,假忙碌。
- 标注无规范:同一失败不同人不同判,数据不可用。
- 合规默认全可训练:未告知就拿用户数据训练,踩红线。
结语
模型可以买,数据不能买。AI 产品的壁垒不在你用了哪个模型,而在你有没有把自己场景里的"正确"数据,用飞轮持续地、干净地、合规地积累起来。
本文为「AI 产品经理入门与进阶」系列第 10 篇。数据来源:公开 LLM 数据治理与合成数据研究(含 model collapse / 数据自噬相关文献)、RAG 知识库构建实践、企业 AI 数据合规通用原则。具体数值与法规随迭代变化,请以最新资料与合规要求为准。