Python读取PDF文字 去掉页眉页脚

使用PyMuPDF(即fitz)读取PDF中的text时,会把页码也读进来。所以,有时候就需要让程序忽略页眉和页脚,或者直接删除页眉和页脚。

根据fitz的文档:Page - PyMuPDF 1.24.0 documentation

get_text的clip参数可以指定要读取文字的区域,于是大致代码如下:

python 复制代码
doc = fitz.open(fname)
page = doc[0]
rect = page.rect
clip = 50 # 假设页眉和页脚的高度都是50
crop = fitz.Rect(0, clip, rect.width, rect.height-clip)
text = page.get_text(clip=crop)
相关推荐
redfred12 分钟前
Koodo Reader 使用教程:开源电子书阅读器 epub/pdf/mobi/azw3 全格式 多端同步 AI翻译 笔记高亮
人工智能·pdf·开源
Metaphor69232 分钟前
如何在 Python 环境中裁剪 PDF 页面
python·pdf
开开心心就好37 分钟前
手机精确倒计时工具悬浮窗口秒数实时显示
android·前端·javascript·jupyter·智能手机·pdf·html
jayson.h19 小时前
python——pdf编辑
前端·python·pdf
MaiTube&Maipdf19 小时前
MaiPDF 在线分享
pdf
Metaphor69220 小时前
使用 Python 快速拆分 PDF 文件
python·pdf
MaiTube&Maipdf1 天前
.maipdf 文件 + 系统级拒绝截屏 + 交付后仍可吊销
安全·pdf
web打印社区1 天前
网页静默打印热敏小票:从 HTML 到出纸的完整指南
前端·javascript·vue.js·electron·pdf·html
eybk3 天前
python将图片pdf文件转为透明文字的pdf文件
pdf
小新科研测评4 天前
2026 年 3 种 PDF 文献翻译方案横评:公式/表格/双栏排版保真度实测
人工智能·ai·pdf·自动翻译