python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
估值探索者40 分钟前
【Python量化系统工程实战 #08】从脚本到生产:量化系统上线 checklist 的最小闭环
java·开发语言·jvm·python·数据挖掘·数据·股票数据api接口
李可以量化42 分钟前
如何开通基于 AI 打造的 A 股量化策略(下):特征工程与大模型决策落地
python
万年咸鱼1 小时前
解决C语言的内存释放机制
java·c语言·python
李可以量化1 小时前
如何开通基于 AI 打造的 A 股量化策略(上):三层策略骨架与代码落地
python
破芽1 小时前
python知识点整理02
开发语言·python
打工仔折腾 AI2 小时前
Docker镜像分层与卷挂载到底怎么工作:一次文件系统层面的实测分析
运维·人工智能·后端·python·docker·容器·性能优化
老歌老听老掉牙2 小时前
麻花钻锥面后刀面数学模型的完整推导与数值求解
python·钻头·后刀面
墨染天姬2 小时前
【人工智能训练师】python语法二
开发语言·人工智能·python
ikun_文3 小时前
Python高级特性
python
用户872185012433 小时前
港股投资者必备:三大数据源对比,哪种最适合实时行情与回测?
python