大模型数据标注第一弹-什么是数据标注

一、什么是数据标注

数据标注是人工智能产业的核心基础环节,简单来说就是对图片、语音、文本、视频等各类原始非结构化数据添加标签,将其转化为机器可识别、可用于模型训练的结构化数据的过程,也被称为AI时代的"基石工程"。

1.1 数据标注有哪些类型?

主流的标注类型包括:

文本类标注

图像类标注

语音类标注

视频标注

  • 文本标注‌:标记人名、地名等实体,或给内容打上情感、分类标签,用于智能客服、搜索优化。
  • 图像标注‌:用矩形框、语义分割等方式标记物体,比如自动驾驶场景里标注车辆、行人、车道线。
  • 语音标注‌:将语音转写为文字、标记说话人声纹特征,支撑智能音箱、语音助手产品。
  • 视频标注‌:跟踪画面中物体的运动轨迹、识别连续动作,用于行为分析、赛事智能剪辑。

1.2 标注的场景有哪些?

标注软件一般公司自己开发的,根据算法要求开发标注软件。

1.线上标注方式

2.本地部署标注软件

1.3 文本类型标注

例如Apple,可以标注为苹果,也可以代表苹果公司

Apple === 苹果

苹果公司

多维度对数据进行说明,说清楚这个数据究竟代表什么。

标注类型的时候,有说明文档(标注文档)

1.4 图像类标注

需要说明的物体在图像中圈出来。

底层原理是:把我们想解释给大模型的物体标记出来,然后告诉大模型。

1.5 语音类型的标注

TTS:语音转文字

还可以有其他维度?

谁说的?

女士还是男士?

二、数据集

2.1 数据提升模型的哪些能力?

  1. 模型的准确性
  2. 模型的泛化能力
  3. 减少偏差
  4. 提高模型的训练效率
  5. 增加用户的信任
  6. 限制(违规,安全风险的)

2.2 数据集从哪来?

公司原有的数据

采集员采集数据

线上白嫖的数据集(魔塔、)

付费(数据堂、某宝)

2.3 数据清洗

数据清洗是数据处理流程中的核心环节,指通过识别、修正或删除数据集中的脏数据,最终得到符合质量要求的可用数据的过程,通常会占据数据分析全流程50%-80%的时间资源。

好的数据集:大模型能够精准识别的数据

不好的数据集:模糊,没有对应样本的数据

数据采集=》数据清洗=》数据标注=》质检

2.4 数据如何质检

参考文献:

https://www.bilibili.com/video/BV1nWGX6DEy9/?spm_id_from=333.788.videopod.episodes&vd_source=588d631cf0dd8fa52573829827fe8788

相关推荐
V哥AI增长1 小时前
AI搜索引用机制解析:影响内容被选中的5个因素
人工智能
Hali_Botebie1 小时前
PyTorch 内存布局,.view()要合并哪两个维度(比如 B 和 G),这两个维度在内存里就必须“紧挨着”。
人工智能·pytorch·python
2601_950513591 小时前
GEO 技术详解:AI 搜索引擎如何决定推荐谁,企业内容怎么适配
人工智能·搜索引擎
万联WANFLOW1 小时前
技术演进与安全博弈中的 OpenAI GPT-6 Astra
网络·人工智能·gpt·安全·业界资讯
四点半-企业AI获客1 小时前
GEO 技术实践:从内容可及性到结构化数据,让 AI 搜索引擎正确索引你的站点
人工智能·搜索引擎
大象AI共学1 小时前
AI 写得比你好,你为什么还要写?
人工智能·ai写作
星期一研究室1 小时前
5个Skills,一个人干一个团队的活
人工智能·团队管理
词却1 小时前
OpenCV学习:人脸识别
人工智能·opencv·学习
智驭未来掌门人1 小时前
本地大模型网关 CLI 使用教程
人工智能