如何基于pdf2image实现pdf批量转换为图片

最近为了将pdf报告解析成为文本和图片,需要将大量多页的pdf文件拆分下单独的一页一页的图像,以便后续进行OCR和图像处理,因此就需要实现将pdf2image,本文主要结合开源的pdf2image和poppler,实现了pdf转换为png格式图片的简单转换工具,供大家参考,具体步骤和应用测试示例如下。

1.安装pdf2image包

需要先安装pdf2image包,安装命令:pip3 install pdf2image

2.安装poppler用于实现pdf2image

安装poppler-windows,下载地址:https://github.com/oschwartz10612/poppler-windows/releases/tag/v23.11.0-0

3.配置环境变量

将上述压缩包解压缩之后,将路径配置到环境变量path中,如path=:D:\tools\poppler-24.08.0\Library\bin

4.修改poppler_path指向的路径

修改pdf2image包的pdf2image.py文件,将poppler路径为上述路径,具体如下。

复制代码
# pdf2image.py文件修改
def convert_from_path(
	pdf_path: Union[str, PurePath],
	output_file: Any = uuid_generator(),
	poppler_path=r'D:\tools\poppler-24.08.0\Library\bin',  # 需要修改为path中配置的poppler路径。
	grayscale: bool = False
) -> List[Image.Image]:
	...
5.测试示例代码
复制代码
import fitz  # PyMuPDF  
from pdf2image import convert_from_path  
import os,sys
def extract_fullpage_images(filename,pdf_path,output_folder):  
    # 打开PDF文件  
    doc = fitz.open(pdf_path)  
    # output_folder = "extracted_content_pdf"  
    os.makedirs(output_folder, exist_ok=True)  
    os.makedirs(output_folder + "/png-full/", exist_ok=True)  
  
    # 遍历每一页  
    for page_num in range(len(doc)):  
        page = doc.load_page(page_num)        
        # 使用pdf2image将整个页面转换为图像  
        images = convert_from_path(pdf_path, first_page=page_num + 1, last_page=page_num + 1) 
        for img_index, img in enumerate(images):  
            img.save(f"{output_folder}/png-full/page_{page_num + 1}_full_img_{img_index + 1}.png", 'PNG')  
        print(f"Processed page {page_num + 1}================================")  
    doc.close()
    
# 示例: python pdfSplitAdapterPMI.py D:\xxx\report.pdf
if __name__ == '__main__':  
    # 检查参数个数  
    argc = len(sys.argv)  
    if (argc <= 1):  
        print('missing Parameter' % locals())  
        sys.exit()  
    filepath = sys.argv[1]  
    pdf_path = filepath
    filename=filepath.split('\\')[-1][:-4]  
    output_folder = filepath[:filepath.rfind('\\')]+"\extracted_content2_"+filename  
    extract_fullpage_images(filename,pdf_path,output_folder)
6.转换结果对比

1.原始pdf文件

2.转换后每一页的图片文件列表

相关推荐
星野云联AIoT技术洞察2 小时前
RK3588 边缘 AI 盒子适合什么工业视觉场景
计算机视觉·边缘计算·rk3588·语音识别·图像识别·边缘网关·边缘计算盒子
这张生成的图像能检测吗3 小时前
(论文速读)Cylinder3D:面向室外 LiDAR 分割的柱面划分与非对称 3D 卷积
计算机视觉·点云·3d视觉·三维感知
贾伟康4 小时前
【HarmonyOS 7新能力|028】Core Vision Kit工程封装:把接入逻辑放进可维护的分层结构
计算机视觉·harmonyos·arkts·端侧ai·harmonyos 7
Saruka的男朋友4 小时前
不上传文件也能转格式?拆解一个纯浏览器端的 EPUB 工具链的设计思路
pdf·epub·eink
Zentceh5 小时前
0.001Lux是什么概念
图像处理·人工智能·科技·计算机视觉·车载系统·无人机·智能硬件
asdzx675 小时前
Python 实战:基于 Spire.PDF 为 PDF 文档添加自定义文本
python·pdf
这张生成的图像能检测吗6 小时前
(论文速读)SphereFormer:用径向窗口解决 LiDAR 远距离稀疏点的信息断连
计算机视觉·点云·3d技术·三维感知
SamChan907 小时前
PyMuPDF vs pdfplumber vs pypdf:PDF 文本提取实测对比(翻译预处理视角)
python·ai·pdf
YOLO数据集集合8 小时前
Anti-UAV 可见光与红外无人机检测数据集| 反无人机 可见光红外 多模态检测 小目标检测 Anti-UAV9076期
人工智能·目标检测·计算机视觉·目标跟踪·无人机识别·反无人机·灾害救援
工具派9 小时前
视频场景检测是怎么找到切镜头位置的?三种思路与实测
算法·计算机视觉·视频