python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
czq_26867194871 分钟前
Python打卡第30天
python·机器学习
FYKJ_20108 分钟前
SSM校园互助与闲置交易平台62145-计算机课程设计、毕业设计
java·spring boot·python·mysql·架构·spark·课程设计
“AI国潮设计-小江”11 分钟前
Python实战 | SDXL批量生成“带炸英歌”国潮IP:从海报到门店落地(附核心Prompt与授权思路)
开发语言·人工智能·python·prompt·aigc
我就是不信15 分钟前
深入理解 Python 虚拟机:字典(dict)的优化
开发语言·python·哈希算法
晚风醉蝶18 分钟前
YOLO11图标点选验证码识别实战
python·目标检测·验证码识别·yolo11
打工仔折腾 AI28 分钟前
多台服务器日志分散难查?用Promtail+Loki+Grafana搭建集中检索平台
服务器·人工智能·后端·python·性能优化·django·grafana
ysu_031429 分钟前
uv实战指南-从Python版本虚拟环境到pyproject依赖管理
开发语言·python·pip·uv·虚拟环境·包管理·依赖管理
打工仔折腾 AI40 分钟前
DiPlay 实测:iPhone 绕过硬件盒子直连 BYD 车机的思路拆解
android·人工智能·后端·python·gradle·iphone·ai agent 实战
老歌老听老掉牙5 小时前
空间曲线数据的拼接与几何变换分析
python·曲线
databook9 小时前
使用 SciPy 库进行时间序列分析
python·数据分析·scipy