Python批量合并多个PDF

安装pymupdf

python 复制代码
pip install pymupdf

合并PDF文件

合并两个PDF

方法Document.insert_pdf()可以在不同的 PDF 文档之间复制页面。示例(doc1和doc2是打开的 PDF):

plain 复制代码
# append complete doc2 to the end of doc1
doc1.insert_pdf(doc2)
python 复制代码
import fitz  # PyMuPDF

def merge_two_pdf(pdf1_path: str, pdf2_path: str, output_pdf):
    pdf1 = fitz.open(pdf1_path)
    pdf2 = fitz.open(pdf2_path)
    pdf1.insert_pdf(pdf2)
    pdf1.save(output_pdf, garbage=4)
    pdf1.close()
    pdf2.close()

合并多个PDF

python 复制代码
def merge_pdfs0(input_files: list, output_file: str):
    final_pdf = fitz.open()
    for temp_file in input_files:
        with fitz.open(temp_file) as temp_pdf:
            final_pdf.insert_pdf(temp_pdf)
    # 保存最终合并结果
    final_pdf.save(output_file, garbage=4)
    final_pdf.close()
    print(f"合并完成,输出文件为:{output_file}")

如果PDF非常多,或者单个PDF文件特别大,会导致final_pdf占用大量的内存,针对大文件和大量 PDF 的合并需求,可以进一步优化以减少内存占用和提高效率。以下是优化策略和改进代码示例:

优化策略

  1. 分批处理并写入
    • 大量文件时可以分批加载和合并,避免一次性加载所有文件。
    • 例如,每处理一组文件就保存一次部分结果,释放内存。
  2. 避免逐页插入
    • 如果文件页数很多,可以通过直接将整个 PDF 插入到目标文档中,而不是逐页插入,减少 insert_pdf 的调用次数。
  3. 多次保存分批结果,避免中间缓存
    • 分批处理每组文件后保存一个中间文件,再加载这个中间文件继续合并下一组。最终再合并中间文件。
  4. 利用磁盘而非内存
    • 可以采用文件缓存方式,将中间文件写入磁盘。合并完成后,删除不再需要的中间文件。

示例代码

python 复制代码
def merge_two_pdf(pdf1_path: str, pdf2_path: str, output_pdf):
    """
    1、合并pdf1和pdf2输出到output_pdf
    2、删除临时文件
    """
    pdf1 = fitz.open(pdf1_path)
    pdf2 = fitz.open(pdf2_path)
    pdf1.insert_pdf(pdf2)
    pdf1.save(output_pdf, garbage=4)
    pdf1.close()
    pdf2.close()
    if pdf1_path.endswith('.tmp'):
        os.remove(pdf1_path)
    if pdf2_path.endswith('.tmp'):
        os.remove(pdf2_path)

def merge_pdfs(input_files, output_file):
    tmp_count = 0
    while len(input_files) > 2:
        merged_files = []
        for i in range(0, len(input_files), 2):
            if i + 1 < len(input_files):
                tmp_file = output_file + f'{tmp_count}.tmp'
                merge_two_pdf(input_files[i], input_files[i + 1], tmp_file)
                merged_files.append(tmp_file)
                tmp_count += 1
            else:
                merged_files.append(input_files[i])
        input_files = merged_files
    # Save the final merged PDF
    merge_two_pdf(input_files[0], input_files[1], output_file)
相关推荐
wsxqaz4 分钟前
浏览器原生控件上传PDF导致hash值不同
算法·pdf·哈希算法
0wioiw06 分钟前
Python基础(吃洋葱小游戏)
开发语言·python·pygame
蓝婷儿10 分钟前
Python 数据分析与可视化 Day 14 - 建模复盘 + 多模型评估对比(逻辑回归 vs 决策树)
python·数据分析·逻辑回归
知其然亦知其所以然10 分钟前
JVM社招面试题:队列和栈是什么?有什么区别?我在面试现场讲了个故事…
java·后端·面试
栗子~~13 分钟前
Python实战- Milvus 向量库 使用相关方法demo
开发语言·python·milvus
狐凄15 分钟前
Python实例题:基于 Flask 的在线聊天系统
开发语言·python
狐凄15 分钟前
Python实例题:基于 Flask 的任务管理系统
开发语言·python
harmful_sheep18 分钟前
Spring 为何需要三级缓存解决循环依赖,而不是二级缓存
java·spring·缓存
星辰大海的精灵19 分钟前
如何确保全球数据管道中的跨时区数据完整性和一致性
java·后端·架构
大大。22 分钟前
van-tabbar-item选中active数据变了,图标没变
java·服务器·前端