一、什么是数据标注
数据标注是人工智能产业的核心基础环节,简单来说就是对图片、语音、文本、视频等各类原始非结构化数据添加标签,将其转化为机器可识别、可用于模型训练的结构化数据的过程,也被称为AI时代的"基石工程"。
1.1 数据标注有哪些类型?
主流的标注类型包括:
文本类标注
图像类标注
语音类标注
视频标注
- 文本标注:标记人名、地名等实体,或给内容打上情感、分类标签,用于智能客服、搜索优化。
- 图像标注:用矩形框、语义分割等方式标记物体,比如自动驾驶场景里标注车辆、行人、车道线。
- 语音标注:将语音转写为文字、标记说话人声纹特征,支撑智能音箱、语音助手产品。
- 视频标注:跟踪画面中物体的运动轨迹、识别连续动作,用于行为分析、赛事智能剪辑。
1.2 标注的场景有哪些?
标注软件一般公司自己开发的,根据算法要求开发标注软件。
1.线上标注方式
2.本地部署标注软件
1.3 文本类型标注
例如Apple,可以标注为苹果,也可以代表苹果公司
Apple === 苹果
苹果公司
多维度对数据进行说明,说清楚这个数据究竟代表什么。
标注类型的时候,有说明文档(标注文档)
1.4 图像类标注

需要说明的物体在图像中圈出来。
底层原理是:把我们想解释给大模型的物体标记出来,然后告诉大模型。
1.5 语音类型的标注
TTS:语音转文字
还可以有其他维度?
谁说的?
女士还是男士?
二、数据集
2.1 数据提升模型的哪些能力?
- 模型的准确性
- 模型的泛化能力
- 减少偏差
- 提高模型的训练效率
- 增加用户的信任
- 限制(违规,安全风险的)
2.2 数据集从哪来?
公司原有的数据
采集员采集数据
线上白嫖的数据集(魔塔、)
付费(数据堂、某宝)
2.3 数据清洗
数据清洗是数据处理流程中的核心环节,指通过识别、修正或删除数据集中的脏数据,最终得到符合质量要求的可用数据的过程,通常会占据数据分析全流程50%-80%的时间资源。
好的数据集:大模型能够精准识别的数据
不好的数据集:模糊,没有对应样本的数据
数据采集=》数据清洗=》数据标注=》质检
2.4 数据如何质检
参考文献: