【问题解决】Label Studio上传文件数量超限解决方案

文章目录

  • 问题背景
  • 解决方法
    • [一、 使用外部存储同步](#一、 使用外部存储同步)
      • [1、 准备图片目录](#1、 准备图片目录)
      • [2、 配置Label Studio环境](#2、 配置Label Studio环境)
      • [3、在Label Studio界面中连接存储](#3、在Label Studio界面中连接存储)
    • 二、调整上传限制(备选方案)

问题背景

在Python环境中使用Label Studio,并且有8000张图片需要处理,遇到了上传限制的问题。这个问题的核心是Label Studio的默认设置无法单次处理这么多文件。

解决方法

一、 使用外部存储同步

这是处理大量数据的标准方法。它的原理是不通过浏览器上传,而是让Label Studio直接从一个你指定的本地文件夹里读取图片。

步骤如下:

1、 准备图片目录

将你的8000张图片集中放在一个文件夹里,例如 D:/my_labeling_project/images

2、 配置Label Studio环境

在于启动Label Studio前,设置两个环境变量。

  • LABEL_STUDIO_LOCAL_FILES_SERVING_ENABLED=true:启用本地文件服务。

  • LABEL_STUDIO_LOCAL_FILES_DOCUMENT_ROOT:指定你图片文件夹的上一级或上两级路径 。如:D:/

    # 这里路径指定数据目录的上一级,这样导入其他数据的时候不用重新指定,直接将新数据放在和该数据路径平级的位置即可

在启动你的Python环境(如Jupyter Notebook)或运行Python脚本之前,在终端中执行以下命令:

在Windows命令提示符中:

plain 复制代码
set LABEL_STUDIO_LOCAL_FILES_SERVING_ENABLED=true
set LABEL_STUDIO_LOCAL_FILES_DOCUMENT_ROOT=D:/

在Linux/macOS的终端中:

bash 复制代码
export LABEL_STUDIO_LOCAL_FILES_SERVING_ENABLED=true
export LABEL_STUDIO_LOCAL_FILES_DOCUMENT_ROOT=/my_labeling_project 

设置完毕后,再启动初始化Label Studio。

plain 复制代码
label-studio start

3、在Label Studio界面中连接存储

  • 新建项目,进入你的项目,点击 Settings > Cloud Storage

  • 点击 Add Source Storage ,选择 Local Files

  • 在配置页面中,Absolute local path 一栏填写数据所在文件夹的完整路径(例如 D:\my_labeling_project\images)。点击 Check Connection 测试连接,成功后会变成Connection Verified ,链接失败则可能是路径填写错误。
  • 之后点击next, 选择Import Method为导入的文件类型Files ,FileName filter 这里选择文件后缀,我们导入图片,因此选择Images。之后点击【Load Preview】,自动查找对应的文件类型。

  1. 数据预览加载结果:之后点击next。
  • 同步数据 :添加成功后,点击 Safe&Sync 按钮进行同步。同步时,建议不要进行数据标注操作 ,因为这可能会导致同步中断。

导入结果:

二、调整上传限制(备选方案)

如果外部存储方案遇到困难,你也可以尝试直接修改上传限制。

  1. 找到配置文件 :这通常是位于Label Studio配置目录下的 settings.py 文件。

  2. 修改参数:在配置文件中找到并修改以下参数:

    python 复制代码
    # 提高单次上传文件数量的上限
    DATA_UPLOAD_MAX_NUMBER_FILES = 10000  # 设置为一个大于8000的值
    
    #或者在Windows命令提示符中:
    set DATA_UPLOAD_MAX_NUMBER_FILES = 10000  # 设置为一个大于8000的值
  1. 重启服务 :修改配置后,务必重启Label Studio服务 才能使更改生效。
相关推荐
早起CaiCai13 小时前
【Pytorch 实践1】手写数字
人工智能·pytorch·python
吴梓穆13 小时前
Python 语法基础 函数
开发语言·python
Kobebryant-Manba13 小时前
学习文本处理
开发语言·python
m0_6174939413 小时前
PaddleOCR报错:OneDnnContext does not have the input Filter 解决方案汇总
python
李可以量化13 小时前
量化迅投 QMT vs 聚宽 (JoinQuant)全面分析
python·量化·qmt·ptrade·聚宽
旅僧13 小时前
运行UMI镜像
python
ellenwan202613 小时前
期货跨期价差程序化怎么做:天勤 SP 合约与腿比例核对
python·区块链
月疯13 小时前
torch:expand和repeate的区别
开发语言·python·深度学习
顾林海14 小时前
Agent入门阶段-编程基础-Python:Python 开发环境与运行方式
python·agent·ai编程
叫我:松哥14 小时前
基于深度卷积神经网络的水果图片分类算法设计与实现,有ResNet50的迁移学习模型,准确率达95%
人工智能·python·神经网络·机器学习·分类·cnn·迁移学习