python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
min(a,b)31 分钟前
学习第17天:Agent Memory 与 MCP 协议
python·学习
CodeBlog-star1 小时前
LLM安全实战:提示词注入与越狱攻击防御指南
python·agent·提示词攻击·越狱攻击
小柯南敲键盘1 小时前
电商图片翻译工具推荐,批量处理主图视频字幕,免费试用
大数据·人工智能·python·音视频
比高创意品牌策划设计2 小时前
零售卖场设计软件用CAD还是SketchUp还是酷家乐
python
迷迭香yy4 小时前
行业板块轮动因子实战从板块资金到因子建模的本地化Python全流程
数据库·人工智能·python
W_326004 小时前
Python文件进阶:一维数据与 CSV 文件读写
开发语言·python
yaoxin5211234 小时前
497. Java 反射 - 使用反射读取注解
java·开发语言·python
2019一路前行5 小时前
Python 函数式编程
开发语言·python
专注仿真5 小时前
问答大模型技术方案算法实现-RAPTOR树构建算法与BEG集成使用
python·算法
从小就看凹凸曼^o^7 小时前
Python基础5 - 字典与集合:(1)字典
开发语言·python