python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
paeamecium17 分钟前
【PAT甲级真题】- Rational Sum (20)
数据结构·c++·python·算法·pat考试·pat
爱昏羔7 小时前
下篇:从检索到交互 — 物流RAG问答系统与WebUI全实现
python·langchain·agent
_Jimmy_7 小时前
Agent引用数据库知识过时的增量同步方案
人工智能·python·langchain
min(a,b)8 小时前
学习第 4 天:面向对象与异常处理
python·学习·学习方法
yangshicong10 小时前
第19章:AI安全防护与AI安全
人工智能·python·安全·prompt·ai编程
果汁华10 小时前
Function Calling 与 Python 实战完整指南
开发语言·网络·python
c_lb728810 小时前
2026年不同基础做量化,先找AI能参与的位置
人工智能·python
chenment12 小时前
ComfyUI 自定义节点开发:从零扩展你的图像生成工作流
python·stable diffusion
IT空门:门主12 小时前
Python 基础语法学习路线图
网络·python·学习
互联网中的一颗神经元13 小时前
小白python入门 - 25. SQL 与表设计入门
数据库·python·sql