python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
2601_962099461 小时前
Python中的find()函数:用法和示例
python·字符串·索引·子字符串·find函数
大圣编蚕1 小时前
Java StringWriter 详解:从入门到实战
java·开发语言·python
for_ever_love__2 小时前
python基础语法学习: requirements.txt
开发语言·python·学习
程序员清风2 小时前
FastAPI 入门:用 Python 快速开发现代后端服务
python·oracle·fastapi
SunnyDays10113 小时前
使用 Python 提取 Word 文档中的表格数据
python·word
for_ever_love__3 小时前
python基础语法学习: 动态类型
开发语言·python·学习
troy1283 小时前
分布式系统框架选型指南:主流框架优缺点深度对比
python·django·pygame
129Lab3 小时前
BMS算法快速原型开发:AI辅助实现扩展卡尔曼滤波(EKF)SOC估算从理论到代码落地
python·嵌入式开发·bms·卡尔曼滤波·电池管理系统·soc估算
萧鼎3 小时前
safetensors 库的安装、核心语法与实战用法,安全保存模型权重
python·开源·教程·python库·safetensors
千里码aicood3 小时前
基于Python语言的测量程序设计
开发语言·python