【MinerU】:一款将PDF转化为机器可读格式的工具——RAG加强(Docker版本)

目录

创建容器

安装miniconda

安装mineru

CPU运行

GPU加速

多卡问题


创建容器

构建Dockerfile文件

开启ssh服务,设置密码为1234等操作

复制代码
# 使用官方 Ubuntu 24.04 镜像
FROM ubuntu:24.04

# 安装基础工具和SSH服务
RUN apt-get update && \
    apt-get install -y --no-install-recommends \
    openssh-server \
    vim \
    curl \
    net-tools \
    iputils-ping && \
    rm -rf /var/lib/apt/lists/*

# 配置SSH
RUN mkdir -p /var/run/sshd && \
    echo 'root:1234' | chpasswd && \
    sed -i 's/#PermitRootLogin prohibit-password/PermitRootLogin yes/' /etc/ssh/sshd_config

# 暴露SSH端口
EXPOSE 22

# 启动SSH守护进程
CMD ["/usr/sbin/sshd", "-D"]

将Dockerfile文件构建为镜像

复制代码
docker build -t ubuntu_lfl .

启动一个docker容器

复制代码
 docker run -d   --name mineru-1   --restart=unless-stopped --gpus '"device=0"'  -v /mnt/LTSDataset:/mnt/LTSDataset   -v /mnt/Share400T:/mnt/Share400T  -p 9999:22   ubuntu_lfl:latest 

安装miniconda

连接进入容器

可以使用ssh或者vscode或者xshell等

安装wget

复制代码
apt update && apt install wget -y

下载miniconda安装的运行脚本

复制代码
 wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh -O miniconda.sh

运行脚本

复制代码
 bash miniconda.sh -b -p ~/miniconda3

环境变量生效

复制代码
source ~/.bashrc

用查看版本来验证是否安装成功

复制代码
conda --version

安装mineru

创建一个py10的conda环境

复制代码
conda create -n mineru python=3.10

进入环境

复制代码
conda activate mineru

安装相关的包

复制代码
pip install -U "magic-pdf[full]" --extra-index-url https://wheels.myhloli.com -i https://mirrors.aliyun.com/pypi/simple

安装modelscope,用来下载模型的(也可以自己下)

复制代码
pip install modelscope

下载使用modelscope包下载模型的python运行脚本

复制代码
wget https://gcore.jsdelivr.net/gh/opendatalab/MinerU@master/scripts/download_models.py -O download_models.py

运行python脚本(可以自己写)

复制代码
python download_models.py

验证安装

复制代码
 magic-pdf -v

CPU运行

上传了一个pdf文件

复制代码
magic-pdf -p /root/olb_ug-1.7r0.pdf -o /root/outputs -m auto

运行报错,缺少了一些图像处理的包

安装对应的包

复制代码
apt-get update && apt-get install -y libgl1 libglib2.0-0

成功启动

结果如下

运行时间

8:52-11:05 共 73分钟

GPU加速

将用户目录下的magic-pdf.json文件修改为 (原来是cpu)

"device-mode":"cuda"

运行时间为3分钟

GPU加速的效果确实很好

多卡问题

使用其官方镜像运行发现也不会多卡加速

所以对于多张卡的用户就授予不同的GPU权限,分开跑,比如我可以四个docker容器分别跑。

相关推荐
小江的记录本3 分钟前
【大语言模型】大语言模型——核心概念(预训练、SFT监督微调、RLHF/RLAIF对齐、Token、Embedding、上下文窗口)
java·人工智能·后端·python·算法·语言模型·自然语言处理
我叫张土豆4 分钟前
我把 Spring Boot 升级到 4.0.2 后,顺手重构了整个 AI 脚手架:删模块、加 Skills Agent、补 Resume RAG
人工智能·spring boot·重构
满腹的小不甘6 分钟前
YOLO11改进:注意力魔改 | 微小目标检测 | 上下文增强和特征细化网络ContextAggregation,暴力涨点
人工智能·目标检测·计算机视觉
洒满阳光的午后7 分钟前
我做了一个“能理解业务语义”的可观测性 MCP Server:统一接入 Prometheus、OpenObserve 和 SkyWalking
人工智能·ai·prometheus·skywalking·openobserve·mcp
小鱼~~9 分钟前
集成学习简介
人工智能·机器学习·集成学习
半兽先生11 分钟前
03阶段:机器学习
人工智能·机器学习
.柒宇.11 分钟前
LLM大模型认识
人工智能·深度学习·神经网络·阿里云·ai
泉城嵌入式12 分钟前
AI工程概念解析:从提示词工程到驾驭工程
人工智能
其实秋天的枫12 分钟前
【26专四】英语专业四级TEM4历年真题及答案解析电子版PDF(2009-2025年)
经验分享·pdf
ModelWhale12 分钟前
和鲸科技CEO范向伟亮相“AI极客夜话”:畅谈智能体时代的人才培养与创业路径
人工智能·科技