python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
颜颜yan_2 小时前
ESP-IDF 鸿蒙 PC 适配全记录:打通 Python、构建工具链与 ESP32-P4 固件生成
python·华为·harmonyos
言乐62 小时前
Python加速器4跨境网络加速器
运维·服务器·开发语言·网络·python
weixin_440730502 小时前
线程02-并发串行-互斥锁-Semaphore-Event
python·thread
张小凡vip3 小时前
python--爬虫--经验积累的遇到的坑
开发语言·爬虫·python
毕业设计7033 小时前
(免费领源码) 基于微信小程序的预制菜商城的设计与实现25172-java、PHP、python、C#、小程序、大数据、单片机、网络工程等)
vue.js·python·mysql·微信小程序·pycharm·微信开发者工具·推荐算法
xifangge20254 小时前
AGENTS.md 怎么写?涵盖 Java、Python、Vue、Go 的 8 套开箱即用模板
java·vue.js·python
大草原的小灰灰4 小时前
Python基础语法
开发语言·python
小葱炖豆腐5 小时前
python绘制excel折线图
python·excel·numpy·pandas·matplotlib
Ticnix6 小时前
MCP 实战:把工具层从 Agent 里彻底解耦
python·mcp
XZ-0700017 小时前
week4-1-figure画布
python