一句话定位:一个开源的数据标注工具,让你用简单的界面标注各种类型的数据,并导出为各种机器学习框架的格式。

为什么需要这个项目?
AI 模型的性能取决于训练数据的质量。而训练数据的质量取决于标注的准确性。
一个现实的场景是:你收集了一万张图片,想训练一个物体检测模型。你需要在每张图片上画出物体的边界框,标注出物体的类别。这个工作如果手动来做,耗时耗力,而且不同标注者的结果可能不一致。
Label Studio 解决的就是这个问题:提供一个标准化的标注界面,让标注工作变得高效、一致、可追溯。
Github:
它有多大?核心数据
| 维度 | 数据 |
|---|---|
| GitHub 星星 | 28,155 |
| Fork 数 | 3,679 |
| 主要语言 | TypeScript(前端)+ Python(后端) |
| 协议 | Apache 2.0 |
| 创建时间 | 2019 年 6 月 |
| 所属公司 | HumanSignal(原 Heartex) |
| 官网 | labelstud.io |
核心功能:不只是画框

多类型数据支持
Label Studio 最大的特点是支持几乎所有类型的数据标注:
- 图片:边界框、多边形、语义分割、关键点
- 文本:命名实体识别、情感分析、文本分类
- 音频:语音转写、声音事件检测
- 视频:目标跟踪、行为识别
- 时间序列:异常检测、模式识别
一个工具覆盖五种数据类型,这在开源标注工具中是比较少见的。
可配置的标注界面
Label Studio 有自己的配置语言,你可以用 XML 风格的标签来定义标注界面。比如:
xml
<View>
<Image name="image" value="$image"/>
<RectangleLabels name="label" toName="image">
<Label value="汽车"/>
<Label value="行人"/>
</RectangleLabels>
</View>
这段配置会生成一个图片标注界面,包含两个标签:汽车和行人。你可以用鼠标画出边界框,然后选择对应的标签。
这种配置化的设计意味着:你不需要写代码就能创建自定义的标注界面。
机器学习模型集成

Label Studio 可以连接机器学习后端,实现:
- 预标注:用模型预测结果作为标注的初始值,标注者只需要修正
- 在线学习:新标注产生后自动重新训练模型
- 主动学习:只标注模型最不确定的样本,提高标注效率
这让标注工作从"纯手工"变成了"人机协作"。
多用户和多项目
支持多用户注册登录,每个标注者的操作都绑定到自己的账户。支持多项目管理,可以在一个实例中管理所有数据集。
REST API
提供完整的 REST API,可以轻松集成到现有的数据处理流水线中。
竞品对比
| 维度 | Label Studio | CVAT | Doccano | Prodigy | LabelImg |
|---|---|---|---|---|---|
| GitHub Stars | 28,155 | 34,100+ | 9,800+ | N/A(商业) | 25,060(已归档) |
| 核心定位 | 多类型数据标注 | 计算机视觉标注 | 文本标注 | NLP 标注 | 图片标注(已停止) |
| 图片标注 | ✅ | ✅(专业) | ❌ | ❌ | ✅ |
| 文本标注 | ✅ | ❌ | ✅(专业) | ✅(专业) | ❌ |
| 音频标注 | ✅ | ❌ | ❌ | ❌ | ❌ |
| 视频标注 | ✅ | ✅ | ❌ | ❌ | ❌ |
| 时间序列 | ✅ | ❌ | ❌ | ❌ | ❌ |
| ML 模型集成 | ✅ | ✅ | ❌ | ✅ | ❌ |
| 多用户 | ✅ | ✅ | ✅ | 有限 | ❌ |
| 可配置界面 | ✅(XML 配置) | ✅ | 有限 | 有限 | ❌ |
| 开源协议 | Apache 2.0 | MIT | MIT | 商业 | MIT |
| 创建时间 | 2019 | 2018 | 2018 | 2016 | 2015(归档) |

关键差异总结
vs CVAT :CVAT 是计算机视觉标注领域的王者(34k 星),在图片和视频标注上更专业。Label Studio 的差异化在于多类型数据支持------一个工具覆盖图片、文本、音频、视频和时间序列。
vs Doccano :Doccano 专注于文本标注(情感分析、命名实体识别等),在文本领域更专业。Label Studio 的文本标注能力也很强,但它的优势是跨类型------如果你同时有图片和文本需要标注,Label Studio 是更好的选择。
vs Prodigy:Prodigy 是商业产品,在 NLP 标注上体验很好,但价格不便宜。Label Studio 是开源免费的,且支持更多数据类型。
vs LabelImg:LabelImg 已经被归档(不再维护),它曾经是最流行的图片标注工具。Label Studio 可以看作是 LabelImg 的"升级版"------由同一个团队(HumanSignal)开发,功能更全面。

为什么它值得关注?
理由一:多类型支持是稀缺能力
大多数标注工具只专注一种数据类型:CVAT 做图片、Doccano 做文本、Prodigy 做 NLP。Label Studio 是少数能同时处理五种数据类型的开源工具。如果你的项目涉及多种数据类型,Label Studio 可以避免为每种类型安装不同的工具。
理由二:ML 集成让标注更高效
预标注和主动学习功能可以显著减少标注工作量。用模型预测作为起点,标注者只需要修正,而不是从零开始。
理由三:Apache 2.0 协议友好
Apache 2.0 是一个对商业使用非常友好的开源协议。你可以在商业产品中使用 Label Studio,不需要公开你的源代码。
理由四:HumanSignal 的持续投入
Label Studio 背后有 HumanSignal 公司的持续投入,不是"先发布再看反馈"的项目。他们同时提供开源版和商业云版本(Starter Cloud),有明确的商业模式支撑长期发展。
如何使用?
Docker 一键启动
bash
docker pull heartexlabs/label-studio:latest
docker run -it -p 8080:8080 -v $(pwd)/mydata:/label-studio/data heartexlabs/label-studio:latest
访问 http://localhost:8080 即可使用。
pip 安装
bash
pip install label-studio
label-studio
Docker Compose(生产级)
bash
docker-compose up
包含 Label Studio + Nginx + PostgreSQL,适合生产环境部署。

这个项目适合谁?
机器学习工程师------需要准备训练数据,标注图片、文本、音频等。
数据科学家------需要快速标注数据集来验证模型假设。
AI 创业公司------需要一个可扩展的标注平台,又不想花大钱买商业工具。
学术研究者------需要标注数据来做实验,Apache 2.0 协议适合论文引用。
Github:
总结
Label Studio 解决的是 AI 开发中最基础但也最容易被忽视的问题:训练数据的标注。
28,155 颗星星、多类型数据支持、ML 模型集成、可配置界面------这些特性让它成为数据标注领域的"瑞士军刀"。它不是最专业的图片标注工具(CVAT 更专业),也不是最专业的文本标注工具(Doccano 更专业),但它是覆盖范围最广的开源标注工具。
在 AI 模型越来越依赖高质量训练数据的今天,一个好用的标注工具是整个 AI 流水线的起点。Label Studio 正是这个起点。
我的理解
看完 Label Studio 的代码库和文档,我最欣赏的是它的"配置化"设计。
大多数标注工具的界面是固定的------你只能用它提供的标注方式。Label Studio 用 XML 配置语言让你可以自定义标注界面,这意味着它可以适应几乎任何标注需求。
这种"框架而非产品"的设计哲学,让 Label Studio 的适用范围远远超出了它的初始设计。你可以用它标注图片,也可以用它标注音频,甚至可以用它标注时间序列------只要你能用配置语言描述标注界面。
ML 模型集成也是一个亮点。预标注和主动学习功能把标注工作从"纯手工"变成了"人机协作",这在大规模数据标注场景下可以显著降低成本。
Apache 2.0 协议的选择也很聪明------它让 Label Studio 可以被商业产品集成,扩大了它的用户基础。
关注
如果你觉得这篇文章对你有帮助,欢迎关注我的公众号,获取更多优质开源项目的深度解读。