Docker安装PaddleOCR并提供接口服务(CPU)

#初始化复制配置#创建数据目录

复制代码
sudo mkdir -p /app/paddle
sudo chmod -R 777 /app/paddle

#生成dockerfile

复制代码
sudo cat > /app/paddle/dockerfile <<EOF
FROM python:3.9-slim

# 设置环境变量:限制线程数,避免线程冲突导致 Paddle 崩溃
ENV OMP_NUM_THREADS=1
ENV MKL_NUM_THREADS=1
ENV FLAGS_allocator_strategy=naive_best_fit

# 安装 PaddleOCR 和 OpenCV 所需的系统库
RUN apt-get update && apt-get install -y \
    libgl1 \
    libglib2.0-0 \
    libgomp1 \
    && rm -rf /var/lib/apt/lists/*

# 安装 Python 依赖(OCR 和 Flask Web 服务)
RUN pip install --no-cache-dir \
    paddleocr \
    flask \
    paddlepaddle -f https://paddlepaddle.org.cn/whl/cpu.html

# ✅ 可选:提前拉模型用于缓存,也可删除这行以加快构建速度
RUN python -c "from paddleocr import PaddleOCR; PaddleOCR(use_angle_cls=False, lang='en')"

# 拷贝应用
COPY app.py /app.py

# 启动 Flask 服务
CMD ["python", "/app.py"]

EOF

#生成app.py(示例用于提取英语单词)

复制代码
sudo cat > /app/paddle/app.py <<EOF
from flask import Flask, request, jsonify
import requests, io, re
import numpy as np
from PIL import Image
import threading
from concurrent.futures import ThreadPoolExecutor
from paddleocr import PaddleOCR

app = Flask(__name__)
executor = ThreadPoolExecutor(max_workers=2)
thread_local = threading.local()

def get_ocr():
    if not hasattr(thread_local, "ocr"):
        thread_local.ocr = PaddleOCR(
            use_textline_orientation=False,
            lang='en'
        )
    return thread_local.ocr

def process_image(bytes_data):
    try:
        img = Image.open(io.BytesIO(bytes_data)).convert("RGB")
        img_np = np.array(img)
        ocr = get_ocr()
        result = ocr.ocr(img_np)
        texts = result[0].get('rec_texts', [])
        words = [m.group(1) for t in texts if (m := re.match(r'^[0-9]*([A-Za-z]+)$', t))]
        return {"words": words}
    except Exception as e:
        return {"error": str(e)}

@app.route('/ocr', methods=['POST'])
def ocr_route():
    data = request.get_json()
    if not data or 'image_url' not in data:
        return jsonify({"error": "Missing 'image_url'"}), 400
    try:
        resp = requests.get(data['image_url']); resp.raise_for_status()
    except Exception as e:
        return jsonify({"error": f"Failed download image: {e}"}), 400

    future = executor.submit(process_image, resp.content)
    result = future.result()
    if "error" in result:
        return jsonify({"error": "OCR failed: " + result["error"]}), 500
    return jsonify(result)

if __name__ == "__main__":
    app.run(host="0.0.0.0", port=8866)

EOF

#创建docker镜像

复制代码
cd /app/paddle

docker build -t paddleocr-flask-en .

#启动docker容器

复制代码
docker run -p 8866:8866 -d -v /app/paddle/paddle_data:/root/.paddlex --rm --name paddleocr paddleocr-flask-en

#请求示例

复制代码
curl -X POST http://your.domain:8866/ocr -H "Content-Type: application/json" -d '{"image_url": "http://your.image.domain/demo.jpg"}'
相关推荐
Yana.nice4 分钟前
Linux 只保留 30 天内日志(find命令删除日志文件)
linux·运维·chrome
2601_960567963 小时前
电商套图自动化效率的工程量化分析——从逐张生成到批量套图的架构演进
运维·架构·自动化
吳所畏惧4 小时前
宝塔面板Redis密码修改指南:SSH命令修改 vs 面板UI界面修改,哪个更靠谱?
运维·服务器·数据库·redis·缓存·ssh
张忠琳4 小时前
【NVIDIA】 NVIDIA Container Toolkit v1.19.1 — OCI 模块超深度分析之三
云原生·容器·架构·kubernetes·nvidia
HiDev_4 小时前
【非标自动化】2、认识元器件(确定目标)
运维·自动化
Zhang~Ling5 小时前
从 fopen 到 struct file:从零开始拆解 Linux 文件 I/O
linux·运维·服务器
爱写代码的森5 小时前
蒙三方库 | harmony-utils之FileUtil文件重命名与属性查询详解
linux·运维·服务器·华为·harmonyos·鸿蒙·huawei
Elastic 中国社区官方博客5 小时前
将你的 Grafana Kubernetes 仪表板迁移到 Elastic Observability:相同的 PromQL,30 倍更快的查询
大数据·人工智能·elasticsearch·搜索引擎·容器·kubernetes·grafana
中微极客5 小时前
2026主流AI Agent框架技术选型与性能对比
运维·网络·人工智能
久曲健的测试窝6 小时前
智能座舱自动化测试落地方案:数字仿真搭配实车实测,解决用例运维与场景失真难题
运维