python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
小白快快跑哦5 小时前
python-字符串全解(四):字符串方法
开发语言·python·字符串
用户298698530145 小时前
Python 实现文本文件与 Word 文档互转的两种方法
后端·python·api
Zane19945 小时前
明明在赋值前读取,为什么还会报 UnboundLocalError?global 与 nonlocal 深挖
后端·python
小毛驴8505 小时前
Jupyter Notebook 安装步骤
ide·python·jupyter
BUG研究员_5 小时前
LangGraph节点缓存-CachePolicy
python·缓存·langraph
quantdash_cc5 小时前
如何设计高效率的批量股票数据获取程序?QuantDash Python SDK 全市场行情拉取实战指南
开发语言·python·数据分析·量化交易·股票数据·quantdash
砚底藏山河6 小时前
拉数管道设计:从一次性脚本到可重启的数据流水线(魔码量化实战 #01)
java·数据库·python·金融·maven
东莞市云毅网络有限公司6 小时前
企业非结构化资料拆分成可引用片段:一套能跑通的预处理流水线
python·数据清洗·rag·企业知识库·文档解析
淼澄研学6 小时前
Sonos空间音频技术解析与Python本地API控制实操
开发语言·python·音视频