使用 Python 拆分和提取 PDF 页面

实际工作中经常拿到几十页甚至上百页的 PDF------合并的季度报告、扫描的合同、批量导出的发票。接收方往往只需要其中几页:把单页拆成独立文件分发,或者抽取某个页码区间交给不同的人处理。手动用 PDF 编辑器拆分既低效又难以批量。用 Python 可以按页拆分整个文档、提取指定页码、甚至把一个超长页面切成多页,方便接入自动化流程。本文以 Spire.PDF for Python 为例,演示这三种常见的拆分方式。

为什么用 Python 拆分 PDF

通过脚本拆分 PDF 有几个实际好处:

  • 批量处理:一次脚本处理成百上千个文件,无需人工逐个操作。
  • 拆分粒度灵活:既可以整档逐页拆,也可以只提取指定页,或对单个超长页面再切分。
  • 易于集成:拆分只是流水线中的一步,可以和下载、归档、邮件发送等操作衔接。

环境准备

安装 Spire.PDF 库:

bash 复制代码
pip install Spire.PDF

在脚本中引入模块:

python 复制代码
from spire.pdf import *
from spire.pdf.common import *

将 PDF 拆分为单页文档

最直接的拆分方式是让每一页都变成一个独立的 PDF 文件。PdfDocument.Split() 用一个文件名模板即可完成,无需逐页操作:

python 复制代码
from spire.pdf import *
from spire.pdf.common import *

# 加载 PDF 文档
doc = PdfDocument()
doc.LoadFromFile("Sample.pdf")

# 按文件名模板拆分,每一页生成一个独立 PDF
doc.Split("SplitDocument-{0}.pdf")

doc.Close()

Split() 接收一个包含 {0} 占位符的文件名模板,占位符会被替换成页码索引(从 0 开始)。一个 10 页的文档执行后会生成 SplitDocument-0.pdf 到 SplitDocument-9.pdf 共 10 个单页文件。拆分完成后调用 Close() 释放文档占用的资源。

提取指定页面生成新 PDF

更多场景是不需要全部页面,只挑出某几页组成新文档。思路是:新建一个 PdfDocument,为每个要提取的源页面添加一个同尺寸的新页面,再把源页内容绘制进去:

python 复制代码
from spire.pdf import *
from spire.pdf.common import *

# 加载源文档
oldPdf = PdfDocument()
oldPdf.LoadFromFile("Sample.pdf")

# 新建目标文档
newPdf = PdfDocument()
page = None

# 提取索引 1、2 两页(页码从 0 开始)
for i in range(1, 3):
    # 添加与源页面同尺寸的页面
    page = newPdf.Pages.Add(oldPdf.Pages[i].Size, PdfMargins(0.0))
    # 把源页面内容绘制到新页面
    oldPdf.Pages[i].CreateTemplate().Draw(page, PointF(0.0, 0.0))

newPdf.SaveToFile("ExtractPages.pdf")
newPdf.Close()
oldPdf.Close()

Pages.Add() 的第一个参数传入源页面的 Size,保证新页面与源页面尺寸一致;PdfMargins(0.0) 把新页面边距设为 0,避免内容错位。CreateTemplate() 为源页面生成一个绘制模板,Draw() 把它原样画到新页面上,内容和排版都不会丢失。循环范围 range(1, 3) 表示提取第 2、3 页------改这个范围就能提取任意页码组合。

将一个长页面拆分为多页

还有一类特殊需求:源 PDF 里有一张很长的页面(比如长截图、连续表格),希望按标准页高切成多页。做法是新建一个高度只取源页一半的文档,再利用自动分页布局绘制源页内容:

python 复制代码
from spire.pdf import *
from spire.pdf.common import *

# 加载源文档并获取第一页
doc = PdfDocument()
doc.LoadFromFile("LongPage.pdf")
page = doc.Pages[0]

# 新建文档:边距为 0,宽度不变,高度取源页的一半
newPdf = PdfDocument()
newPdf.PageSettings.Margins.All = 0.0
newPdf.PageSettings.Width = page.Size.Width
newPdf.PageSettings.Height = page.Size.Height / float(2)

# 添加新页面并设置自动分页布局
newPage = newPdf.Pages.Add()
format = PdfTextLayout()
format.Break = PdfLayoutBreakType.FitPage
format.Layout = PdfLayoutType.Paginate

# 绘制源页内容,内容超出页高时自动换页
page.CreateTemplate().Draw(newPage, PointF(0.0, 0.0), format)

newPdf.SaveToFile("SplitOnePage.pdf")
newPdf.Close()
doc.Close()

关键在 PdfTextLayout 的两个属性:Layout = PdfLayoutType.Paginate 表示绘制内容超出页面时自动分页,Break = PdfLayoutBreakType.FitPage 表示按页面高度截断。由于新页面高度是源页的一半,一页长内容会被平铺到两个标准页上;把高度除数改小,还能切成更多份。

实用提示

  • 输出位置 :Split() 的文件名模板里可以带上路径前缀(如 "output/SplitDocument-{0}.pdf"),让拆分结果直接输出到指定目录。
  • 页码从 0 开始 :提取页面时先用 doc.Pages.Count 确认总页数,再决定循环范围,避免索引越界。
  • 拆分粒度 :长页切分时,Height 除以的数字越小,切出的页数越多,可按实际内容高度调整。
  • 资源释放 :源文档和目标文档用完都调用 Close(),批量处理时尤其重要。
  • 免费版限制:Spire.PDF 的免费版对处理的页数有限制,大批量或大文档场景需注意这一约束。

总结

本文介绍了用 Python 拆分 PDF 文档的三种常见方式:用 Split() 把整个文档逐页拆成单页文件,用 CreateTemplate().Draw() 把指定页码提取成新文档,以及借助 PdfLayoutType.Paginate 自动分页把一个长页面切成多页。结合文件遍历和页码计算,这些操作可以轻松嵌入批量拆分、按人分发文档等自动化流程中。

相关推荐
用户8356290780511 小时前
使用 Python 操作 PowerPoint 中的图片
后端·python
梅雅达编程笔记1 小时前
02_BeautifulSoup网页数据提取
开发语言·爬虫·python·beautifulsoup·数据采集
ai小陈1 小时前
深度学习CUDA OOM排查:显存占用与碎片问题实战
服务器·人工智能·python·深度学习·ai·gpu算力
对象存储与RustFS1 小时前
自建对象存储的第一个决定:单机就够,还是必须上分布式
后端·rust·开源
用户8181870627461 小时前
第37章 Java应用在K8s里的经典坑:容器内存/CPU limit与JVM参数不匹配导致的OOMKilled
java·后端
小小张说故事2 小时前
pandas 读大 CSV 太慢?6 个实测提速技巧(dtype / 分块 / 引擎选择)
后端·python·pandas
yi0112 小时前
DAY17: LeetCode 139|单词拆分:从“把单词删掉”到用 DP 记录合法切口
人工智能·笔记·python·算法·leetcode·动态规划
喵个咪2 小时前
GoWind Admin|风行 — 开箱即用的企业级全栈中后台框架:多租户与行级数据隔离
后端·go
Java的搬运工2 小时前
【无标题】
python·机器学习·docker·fastapi·模型部署·mlops·ai工程化