python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
今儿敲了吗1 分钟前
Python ——第三方包
笔记·python
麒麟水手4 分钟前
国产银河麒麟系统开发实录:跑通Streamlit,我踩过的6个坑
python
麒麟水手14 分钟前
麒麟系统部署检查清单:上线前30分钟,逐项自查这4类问题
python
用户0332126663671 小时前
使用 Python 在 PDF 中添加或删除数字签名
python
代码方舟2 小时前
零信任架构实战:基于天远柠檬查出险-登记证API构建自动化车辆履约评估网关
人工智能·python·架构·自动化
估值探索者3 小时前
【Python实时盯盘与预警 #08】成交额突然放大2倍?Python窗口比较抓异动
java·开发语言·python
yk 坤帝3 小时前
用Python实现发送《自动周报》实战脚本
开发语言·python
一点一木3 小时前
Seed Evolving 深度测评:我用它造了一个 AI 出题工具
人工智能·python·github
阿童木写作4 小时前
跨境卖家效率翻倍,跨马翻译批量图片翻译工具实测
人工智能·python
鹿鹿学长4 小时前
2026国赛报名季:从组委会第一次通知到各校8月报名通知,赛程报名评奖官方口径一次讲清
python·自动化