dockerfile: PaddleOCR hubserving api 服务

前言

目前 OCR 有比较成熟的方案,想着直接通过 docker 部署一个提供 api 接口服务,查看了一些开源方案,最终发现还是 PaddleOCR 比较好用。

本篇不介绍 PaddleOCR 的详细使用方式,只介绍一下构建镜像的 dockerfile 需要注意的事项。

docker 镜像构建

目录结构

复制代码
- inference_models (下载好的模型放这里,可以直接在 dockerfile 中下载)
- PaddleOCR (git仓库,可以直接在 dockerfile 中克隆)
- dockerfile

dockerfile 内容如下,网络环境需要自己整一下,可直接食用:

bash 复制代码
# 使用 paddlepaddle/paddle:3.0.0 镜像作为基础镜像
FROM paddlepaddle/paddle:3.0.0

# 设置工作目录
WORKDIR /app

# 安装 paddlehub
RUN pip3 install paddlehub --upgrade

# 安装兼容版本的 protobuf
RUN pip3 install protobuf==3.20.0

# 克隆 PaddleOCR 仓库
RUN git clone https://github.com/PaddlePaddle/PaddleOCR.git
# COPY ./PaddleOCR ./PaddleOCR

WORKDIR /app/PaddleOCR

# 下载并解压 OCR 文本检测、文本识别、文本方向分类模型
RUN mkdir -p inference && \
    wget https://paddleocr.bj.bcebos.com/PP-OCRv3/chinese/ch_PP-OCRv3_det_infer.tar && \
    tar -xf ch_PP-OCRv3_det_infer.tar -C inference && \
    # 由于 git 仓库中的名称不同,改一下
    mv ./inference/ch_PP-OCRv3_det_infer ./inference/PP-OCRv3_mobile_det_infer && \
    wget https://paddleocr.bj.bcebos.com/PP-OCRv3/chinese/ch_PP-OCRv3_rec_infer.tar && \
    tar -xf ch_PP-OCRv3_rec_infer.tar -C inference && \
    wget https://paddleocr.bj.bcebos.com/dygraph_v2.0/ch/ch_ppocr_mobile_v2.0_cls_infer.tar && \
    tar -xf ch_ppocr_mobile_v2.0_cls_infer.tar -C inference
# COPY ./inference_models /app/PaddleOCR/inference

# 安装 PaddleOCR 的 Python 依赖
RUN pip3 install -r requirements.txt

# 安装 hub 模块
RUN hub install deploy/hubserving/ocr_system

# 暴露端口
EXPOSE 8866

# 启动服务的命令
CMD ["hub", "serving", "start", "--modules", "ocr_system", "-p", "8866"]

注意:使用 ocr_system 服务,使用的模型是在这里 PaddleOCR/deploy/hubserving/ocr_system/params.py 定义的,如果模型的路径不对,需要手动修改。

  1. 编译镜像:docker build -t ocr_test -f dockerfile .

  2. 运行容器:docker run -d --name paddleocr_hubserving_container -p 8866:8866 ocr_test

  3. 客户端测试:服务启动后,可以通过访问 http://127.0.0.1:8866/predict/ocr_system 来测试 OCR 识别服务。

bash 复制代码
curl -X POST \
  http://127.0.0.1:8866/predict/ocr_system \
  -H "Content-Type: application/json" \
  -d '{"images": ["/9j/4AAQSkZJRgABAQ..."]}'

注意:这里的 images 中放的是图片的 base64 字符串,是不需要带 data:image/jpeg;base64, 这种头的。

总结

本篇介绍了如何使用 docker 快速部署基于 PaddleOCROCR API 服务,包括构建镜像、运行容器及进行客户端测试的完整步骤。

提供的 dockerfile 可以直接使用,处理了 protobuf 版本错误,以及 params.py 中模型路径匹配。

相关推荐
无妄无望3 小时前
docker学习(4)容器的生命周期与资源控制
java·学习·docker
爱宇阳5 小时前
禅道社区版 Docker Compose 服务迁移教程
运维·docker·容器
xzl046 小时前
docker运行Ubuntu22.04
docker
vue学习7 小时前
docker 学习dockerfile 构建 Nginx 镜像-部署 nginx 静态网
java·学习·docker
热爱生活的五柒7 小时前
vscode如何链接远程服务器里面的docker里面的目录
服务器·vscode·docker
hello_zzw9 小时前
docker部署MySQL主从服务集群
mysql·adb·docker
vue学习10 小时前
docker 运行容器限制内存、限制磁盘 IO
运维·docker·容器
山塘小鱼儿11 小时前
open-webui docker高速下载&本地部署
运维·docker·容器
余俊晖11 小时前
多模态大模型OCR幻觉缓解思路:DianJin-OCR-R1通过“再看一眼”图像减轻幻觉
人工智能·ocr
落日漫游12 小时前
docker 网络模式
docker