第 10 篇 数据飞轮与冷启动:AI 产品的数据从哪来

第 10 篇 数据飞轮与冷启动:AI 产品的数据从哪来

本篇属于「工程质量」模块,紧接第 09 篇。09 篇讲"怎么测",本篇讲"数据从哪来、怎么让数据越用越多、越用越好"。它解决 AI 产品启动第一天就面临的最硬约束:没有数据,再强的模型也答不对、答不规范、没法变好。


引言:模型可以买,数据不能买

一个常被忽视的结构性事实:AI 产品与纯软件产品的根本差别,不在代码,在 data 依赖。

纯软件产品,功能写完就基本定型,数据多半是用户行为日志,用来优化体验。AI 产品不一样------它的"正确性"本身由数据决定。知识数据决定它能不能答对,示例数据决定它答得规不规范,反馈数据决定它能不能持续变好。这三样,没有一样能用钱直接买来现成的。模型可以调用 API 租到,但"你的业务里的正确"只能从你自己的场景里长出来。

结论先行:AI 产品的竞争力最终落在数据上。谁先把数据飞轮转起来,谁就建起对手抄不走的壁垒------因为数据是非线性积累、越用越厚的。


一、AI 产品需要的三类数据

混为一谈会害死项目。三类数据用途完全不同,来源、更新频率、作用环节都不同。

类型 用途 来源 更新频率 作用环节
知识数据 喂 RAG,决定"能不能答对" 内部文档、工单、知识库、公开数据 中--高(业务常变) 检索与生成的基础
示例数据 few-shot 或微调,决定"答得规不规范" 专家手写、历史优质回答、合成扩充 低(风格稳定) prompt / 训练
反馈数据 做迭代,决定"能不能持续变好" 用户行为、人工标注、评分 高(持续产生) 评测集更新 / 再训练

一个关键判断:这三类数据不能互相替代。 没有知识数据,模型靠参数硬猜会编;没有示例数据,回答格式与语气会飘;没有反馈数据,系统永远停在 v1,永远不会因为你上线了而变好。

与《第 05 篇:RAG 产品设计与调优实战》的关系:知识数据质量直接决定 RAG 的天花板,检索再好也救不回一堆过时矛盾的文档。


二、冷启动:没有数据时的三条路

产品第一天,三类数据可能全空。这是最难的时刻,但路是有的。

2.1 知识数据冷启动

知识数据决定了"能不能答对",冷启动靠三招:

  • 存量文档挖掘:历史文档、客服工单、内部 wiki、邮件往来里藏着大量隐性知识。它们往往非结构化、重复、过时,需要清洗和去重后才能喂 RAG。这一步是最便宜的知识来源,因为"东西本来就有,只是没整理"。
  • 专家访谈结构化:把老师傅、资深客服、业务骨干脑子里的经验,转成"问答对"形式的可检索知识。例如"用户问 X 时,正确口径是 Y,常见误区是 Z"。这类知识最值钱,因为它补的是文档里没有、但一线天天在用的 tacit knowledge。
  • 公开数据集与行业标准:行业白皮书、国标/行标文档、公开评测集,可作为基础层。注意版权(见第七节),优先用明确可商用的来源。

专家访谈的价值在于它能挖出"文档写不出、但一线天天用"的隐性口径。一次有效的访谈,产出不是一段录音,而是一批结构化问答对。可直接套用的访谈产出模板:

markdown 复制代码
# 专家知识抽取卡(单条)

主题:          退换货政策口径
触发场景:      用户咨询"已拆封商品能否退"
标准回答:      在 X 日内、不影响二次销售的前提下可退;拆封但完好的配件类商品适用此规则
常见错误口径:  "拆封一律不退"(过度收紧,与现行规则不符)
依据来源:      202X 版售后管理规范 第 N 条 / 资深客服确认
边界与例外:    食品、定制类除外;赠品拆封不可退
关联知识ID:   KB-退货-003

这张卡是知识数据的最小单元:它把"老师傅怎么说"变成"系统可检索、可溯源、可复核"的结构化记录。每条都带"常见错误口径"和"边界例外",正是为了提前堵住模型最容易幻觉的地方。

2.2 示例数据冷启动:专家手写 50 条 > 合成 5000 条

这是最反直觉、也最该坚持的一条。让领域专家先手写 50 条高质量示例,价值远高于用模型合成 5000 条。

为什么?因为示例数据要定义的是"什么叫对、什么叫好"。专家手写的是真实业务里的正确范式------边界清晰、口径权威、覆盖真实长尾。模型合成的是模型"以为的对",它只能重新排列它已有的认知,既发明不出领域知识,也识别不了自己没见过的失败形态。用 5000 条合成数据,你得到的是"看起来很多、其实都在舒适区"的噪音。

50 条不是随便写。它们应该:覆盖核心失败模式(呼应第 09 篇按失败模式分层)、代表真实用户问法、每条都经得起"这就是标准答案"的检验。这 50 条定标后,再用合成做表达层面的扩充才安全。

2.3 用 AI 造数据的正确姿势与风险

合成数据不是不能用,是要用对地方、知道边界。

维度 能做什么 不能做什么
表达多样性 把同一意图改写成多种问法,扩充训练/测试的表达覆盖 不能发明新的领域事实
格式变体 生成不同格式的标准回答,训练格式鲁棒性 不能保证事实正确
边界扩充 在已知范围内生成对抗样本 无法创造未知失败形态

最危险的是**"自噬"问题**:用模型生成的数据训练模型,再用训练后的模型生成新数据再训练......循环几轮后,数据分布会塌缩到模型自己最"舒适"的一小块区域,多样性丧失,盲区被放大(研究上称为 model collapse / 模型坍塌)。纪律:合成数据占比要有上限(经验上不超过总训练/示例数据的 30%--50%),且必须与真实/专家数据混合,每隔几轮用真实数据"校准"一次。


三、数据质量 > 数据数量

在 AI 产品里,100 条干净数据常胜过 10000 条脏数据。脏数据不仅没用,还会主动把系统带偏。

3.1 脏数据的四类典型问题

类型 表现 危害
过时 旧价格、旧政策、已下线的功能 直接产出错误答案,且最难发现
矛盾 同一问题在不同文档里答案不同 模型随机采信,结果不可预测
颗粒度不匹配 训练数据是长文,线上是短 query;或反之 分布错位,泛化差
格式混乱 字段缺失、编码乱、模板不一 解析失败,评测噪声大

3.2 清洗优先级

不是所有脏数据都先洗。按"危害 × 影响面"排序:

  1. 先删过时与矛盾:它们直接制造错误答案,且会被系统当作"事实"输出,危害最高。矛盾数据尤其要先消歧(确定唯一口径)再入库。
  2. 再统格式:统一字段、编码、模板,让数据可被程序稳定读取,降低下游噪声。
  3. 最后补缺口:在前两步之后,再针对性补缺失的场景覆盖。顺序错了,你会在垃圾上精雕细琢。

四、反馈数据的采集设计

反馈数据是飞轮的燃料,但它最容易被采"废"。设计的核心是:采到的是真信号,不是礼貌。

4.1 显性反馈 vs 隐性反馈

类型 例子 可靠性 问题
显性反馈 点赞/点踩、星级、问卷 中--低 易被礼貌性点击带偏;样本少
隐性反馈 是否修改输出、是否采纳、停留时长、是否重试 需埋点,解读要小心

关键结论:修改行为比点赞更能说明问题。 用户点个赞可能只是礼貌;但用户把 AI 生成的内容大改特改,说明这条输出基本不可用。第 02 篇就强调过:采纳率、修改率、放弃率,是 AI 产品最诚实的三组数字。点赞会被礼貌性点击,修改不会。

4.2 什么时候问用户

  • 不要打断:在用户正忙、正阅读时弹问卷,得到的都是敷衍。
  • 在完成动作后问:用户刚用完、看到了结果,反馈最准。
  • 一次只问一个:"这条回答有用吗?"一个二元问题,比一套五题问卷回收率高一个量级。

4.3 如何降低反馈成本

  • 把反馈做成一个动作(点踩、标"不对"),而不是一段填写。
  • 用隐性信号自动采集,显性信号只做抽样补充。
  • 对高价值失败案例,才值得让用户多写一句"哪里错了"。

4.4 反馈信号埋点清单(可直接套用)

反馈数据不会自动出现,要在设计期就埋好。一份覆盖三类的埋点清单:

markdown 复制代码
# 反馈信号埋点清单(AI 功能)

## 隐性行为信号(自动采集,优先级最高)
- [ ] 采纳率:用户是否把 AI 输出原样使用(未改即用)
- [ ] 修改率:用户复制后做了多少编辑(改写比例、编辑时长)
- [ ] 放弃率:生成后是否未使用即离开 / 重新提问
- [ ] 重试率:同意图重复发起次数(暗示首答不满)
- [ ] 轨迹信号:第几轮放弃、是否切人工

## 显性反馈信号(抽样采集)
- [ ] 点踩/标"不对":轻量动作,全量可点
- [ ] 有用性二元问:完成后问一次"这条有用吗?"
- [ ] 自由文本:仅对高价值失败案例触发

## 成本信号(工程侧)
- [ ] 单次 token 消耗、缓存命中率
- [ ] 降级/兜底触发次数
- [ ] 工具调用失败率(Agent 场景)

这份清单的要点:隐性行为信号放在最高优先级,因为它们不依赖用户"愿意反馈",而是从真实使用里自然流出;显性信号做抽样补充,避免打扰。两者合起来,才能既看"用户说好不好"也看"用户做不做"。


五、飞轮真正转起来的样子

飞轮不是一个比喻,是一套有节奏的运营动作。断一天不动,数据就 stale;但也不需要天天高强度,关键是稳定每周转一圈

5.1 闭环图

复制代码
        生产环境 trace(含成功与失败)
                  │
   ┌──────────────┼───────────────────┐
   │              │                   │
采样标注      发现新失败模式        发现检索盲区
   │              │                   │
   └──────┬───────┴───────┐           │
          ▼               ▼           ▼
   补进 golden set    更新质量定义   补知识库
          │               │           │
          └───────┬───────┘───────────┘
                  ▼
          下一轮评测(第 09 篇)
                  │
                  ▼
            发布更好的版本 ──→ 产生新 trace ──→ 回到顶部

5.2 每周节奏表

星期 动作 产出
周一 采样本周 trace(生产 5--20%,错误日志高采样) 待标注样本池
周二 人工标注失败案例,定标"什么算错" 标注后的失败样本
周三 归集:去重、分类、消歧 结构化新数据
周四 并入测试集 / 知识库 / 质量定义 golden-v(N+1)、知识库更新
周五 重跑全量评测,对比基线 评测报告(结论先行)

强调:节奏比强度重要。 每周稳定转一圈,比每季度突击一周更有复利。飞轮的价值是非线性的------早期积累慢,越过某个阈值后,你的数据资产对手就是抄不走的。


六、飞轮的三个常见断点

很多团队"建了飞轮但没转",根因通常是三个断点之一。

  1. 采集了但没人看:trace 堆在日志里,从没人采样标注。数据在库里腐烂。治法是把"周二标注"写进某人的周责,而非"有空再看"。
  2. 标注没有规范:不同人标注标准不一,同一失败有时记有时不记,数据不可用。治法是像第 09 篇那样写可执行标注规范,并定期算标注一致性。
  3. 只进不出:数据进了库,但从未影响任何决策------没进测试集、没改 prompt、没补知识库。这是最隐蔽的断点,因为"看起来在做事"。治法是每条入库数据都要有去处:进 golden set、进知识库、或进质量定义,三选一。

七、数据合规红线(通用原则)

本节只给通用原则,不列具体法条编号(各地法规差异大,且迭代快,请以最新合规要求为准)。

  • 用户数据用于训练的边界:把用户对话、内容用于改进模型前,需明确告知并获得同意(或在条款中载明用途)。默认"可以拿用户数据训练"是高危假设。
  • 脱敏要求:进入 golden set、知识库、训练集的任何用户数据,必须先脱敏------去标识、去 PII(个人身份信息)、去敏感业务字段。
  • 留存期限:数据不是留越久越好。明确分类分级,设定留存上限与到期销毁机制,避免"无限堆积"带来的合规与成本风险。
  • 外部内容引入的版权风险:把第三方文档、网页、公开数据集喂进产品前,确认其授权范围是否覆盖你的使用方式(训练 / 检索增强 / 商业用途)。模糊处一律按"不可商用"处理,宁可不引入。

落地时,把这四条写成一份上线前的合规检查清单,比口头约定可靠:

markdown 复制代码
# 数据合规上线检查清单
- [ ] 用户数据用途已在隐私条款/授权中明示,且覆盖"用于改进模型"
- [ ] 进入任何数据集的用户内容已完成脱敏(去 PII、去标识)
- [ ] 已定义各类数据的留存期限与到期销毁机制
- [ ] 所有外部引入内容(文档/网页/数据集)已确认授权范围
- [ ] 知识库更新触发重新评测(见第 09 篇),避免带病知识上线

注意最后一条:合规不只是"能不能用这份数据",还包括"这份数据上线后会不会让系统变坏"。知识库一旦引入未核实的内容,下一轮评测就该把它拦下来。


一页速查

复制代码
数据飞轮搭建清单
├─ 三类数据,用途不同,不可互替
│   知识数据:能不能答对(喂 RAG,更新中--高)
│   示例数据:答得规不规范(专家手写/few-shot,更新低)
│   反馈数据:能不能持续变好(行为/标注,更新高)
├─ 冷启动三条路
│   知识:存量文档挖掘 + 专家访谈结构化 + 公开数据
│   示例:专家手写 50 条 >> 合成 5000 条
│   合成数据:只补表达/格式,占比 ≤30--50%,防自噬塌缩
├─ 质量 > 数量:先删过时/矛盾,再统格式,最后补缺口
├─ 反馈设计:改行为比点赞真;完成后问、一次一问、降成本
├─ 飞轮节奏:周一采样/周二标/周三归集/周四并入/周五重跑
└─ 合规红线:告知同意 / 先脱敏 / 设留存期 / 外部内容查授权

常见坑

  1. 三类数据混用:拿反馈数据当知识数据喂 RAG,系统把用户随口说的当事实。
  2. 冷启动靠合成堆量:5000 条合成示例看着多,全在模型舒适区,真实长尾零覆盖。
  3. 专家手写敷衍:50 条没覆盖失败模式,定标失败,下游全歪。
  4. 合成数据自噬:模型生数据训模型循环,分布塌缩,盲区放大。
  5. 只洗格式不删矛盾:在矛盾数据上精雕细琢,系统输出随机对错。
  6. 用点赞当真理:礼貌性点赞掩盖真实不可用,修改率才是真信号。
  7. 打断式问卷:用户在忙时被弹窗,反馈全废。
  8. 飞轮只进不出:数据入库却从不影响决策,假忙碌。
  9. 标注无规范:同一失败不同人不同判,数据不可用。
  10. 合规默认全可训练:未告知就拿用户数据训练,踩红线。

结语

模型可以买,数据不能买。AI 产品的壁垒不在你用了哪个模型,而在你有没有把自己场景里的"正确"数据,用飞轮持续地、干净地、合规地积累起来。


本文为「AI 产品经理入门与进阶」系列第 10 篇。数据来源:公开 LLM 数据治理与合成数据研究(含 model collapse / 数据自噬相关文献)、RAG 知识库构建实践、企业 AI 数据合规通用原则。具体数值与法规随迭代变化,请以最新资料与合规要求为准。

相关推荐
明月_清风1 小时前
为什么最近开始关注 JEV?几个实战案例告诉你答案
人工智能·后端
qq_199886871 小时前
第6板块·第4节:构建系统与多文件项目
c++·人工智能·gpu算力
冬奇Lab2 小时前
开源项目第222期:security-audit — Cloudflare 的安全审计 Skill,把 Coding Agent 变成六阶段安全审计器
人工智能·开源·资讯
卤煮最下饭2 小时前
在眼镜上背单词:一个 AIUI 对话式智能体的诞生
人工智能
Java后端的Ai之路2 小时前
Python进阶探索17 - Python中的深拷贝与浅拷贝
人工智能·python·ai·浅拷贝·深拷贝
知识分享小能手2 小时前
深度学习学习教程,从入门到精通,深度生成模型 —— 知识点详解与代码实现(20)
人工智能·深度学习·学习
坐吃山猪2 小时前
Harness Engineering知识总结
llm·agent·harness
hzxxxz3 小时前
26%的研发交给AI之后-人的位置换到了哪里
人工智能
m0_587383003 小时前
深圳24小时自助健身房系统软件开发实战:架构设计与部署指南
人工智能·数据挖掘·系统架构·需求分析