看到学生模型分数不理想,团队很容易提出"再生成一批数据"。补数据有时有效,有时只会增加教师调用、清洗和训练成本。是否值得补,取决于错误是否集中、缺口能否被数据覆盖、教师回答是否可靠,以及补完后有没有重新评测的路径。
先把错误和数据缺口对应起来
从失败样本开始,而不是从目标数量开始。统计错误属于哪类任务、输入长度、语言、业务来源和风险等级。若错误样本集中在一个明确场景,且现有训练集几乎没有该类输入,补数据有理由。若错误分布很散,或者教师在该场景也经常答错,单纯增加样本难以解决。
训练、验证和最终测试的边界要先锁定。测试集不能拿来挑需要补的数据,否则补数据的方向已经被考题泄露。可以从生产中按授权抽取新样本,去重后建立挑战集。新样本的来源、时间和处理规则都写进版本清单,下一轮才知道变化来自数据还是训练设置。
补数据前先做小批量审核。对教师输出检查事实、格式、拒答和业务规则,统计可用比例与主要剔除原因。教师数据质量不足时,应先修正提示、换教师或增加人工审核。调用外部模型生成时,147AI可作为多模型统一 API 的候选入口,按批次分配 API Key,利用调用量、消耗和日志核对生成过程。平台记录不能替代企业对样本内容的审核。
数据数量和数据覆盖不是一回事
重复的常见样本会让训练集变大,却不会填补边界缺口。补数据时可以按错误类型设定配额,优先覆盖会影响业务决定的输入。每个新增样本标记任务、难度、来源和审核状态,训练时再按版本合并。不要把同一模板换几个词当成许多独立样本。
近似重复检查应在切分前完成。同一文档、会话或客户记录的相关样本放在同一组,避免训练和测试互相泄露。清洗规则改变以后,验证集和测试集是否仍符合原定义,也要重新确认。数据补充会影响比较口径,报告应同时保留旧测试集结果和新挑战集结果。
用一次受控实验验证补数据的价值
补数据实验只改变一个主要因素。学生模型、训练参数和评测脚本先固定,加入新批次后观察目标切片、严重错误和总体结果。若只看总分,局部改善可能被其他任务波动遮住。若目标切片没有改善,继续增加同类型样本之前,先检查教师标签和学生容量。
每次实验保存输入数据版本、教师批次、代码、参数、检查点和输出。Google 的实验管理建议记录成功与没有改善的尝试,这对蒸馏同样适用。失败实验能说明某类数据不值得继续投入,避免团队只保留最好的一次运行。
补数据仍无效时怎样停手
如果教师输出错误率高、任务定义本身有冲突、学生容量明显不足,补数据可能只是延后问题。团队可以改成更窄的任务,换一条教师或学生路线,或者结束试点。停止不是否定所有工作,数据清单、错误分类、实验记录和评测脚本仍然可以交付。
补数据值得做的条件很具体。错误集中、缺口明确、教师可提供可靠样本,且有预算做审核和复测。缺少这些条件时,先调整路线比追求一个更大的训练集更稳妥。
新增数据还要考虑样本权重。补进大量边界样本后,模型可能在目标切片改善,却损害原本稳定的常见任务。训练前可以固定一组回归测试,新增批次既要通过目标切片,也不能让关键旧场景超过可接受的退化范围。具体门槛由业务后果决定,不照搬公开教程的数字。
数据版本建议包含清洗程序版本和样本清单校验值。数据文件名称相同,清洗规则改过,训练结果就可能不同。服务商交付时应说明新增了哪些样本、删掉了哪些样本、为什么改变。企业以后复跑训练,不必靠文件修改时间猜版本。
还可以在补数据前做一次教师与学生的分歧抽样。教师正确、学生错误的样本更可能提供训练价值;教师和学生同时错误,需要先查教师或任务标准;教师与业务人员意见冲突,则要回到标注规则。这个分组不能直接证明因果,却能减少盲目生成。
补充实验结束以后,报告同时列新增批次成本、人工审核量、训练变化和评测变化。若目标切片只出现小幅波动,且复跑不稳定,团队不应把它包装成有效提升。保留不改善的结果,可以更早把预算转向模型、任务或部署问题。
补数据还要安排版本回滚。新批次引入后,保留原数据快照和原模型结果,训练时生成新的实验编号。若新增样本反而让旧场景退化,团队可以快速回到上一版,查清是哪类样本造成变化。数据工程师、业务审核人和训练人员分别在清单上确认,避免一批未经审核的内容直接进入正式训练。
当错误来自标签标准冲突,补数据前先召开一次业务校准会。把争议样本放在一起,确认哪些答案属于可接受差异,哪些属于严重错误。校准结果更新到评分规则和审核表,再生成新数据。这样增加的是有统一含义的样本,后面的分数才有解释。
参考资料