python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
郭老二8 小时前
【Python】基本语法:装饰器语法糖@
python
_Jimmy_9 小时前
Agent常用检索器的详细介绍
python·langchain
小柯南敲键盘9 小时前
图片翻译API接入与自动化实现指南
运维·python·自动化
旅僧10 小时前
Q-learning(自用)
python·机器学习
Python大数据分析@10 小时前
曝梁文锋称「一度不想维护C端用户,奈何赶不走」,DeepSeek真不需要C端用户吗?可能会有啥影响吗?
python
艾斯特_11 小时前
工作流与多Agent协作:LangGraph、MCP和A2A的应用分层
人工智能·python·ai
IT小盘11 小时前
04-大模型流式输出原理-SSE与Python实现
开发语言·网络·人工智能·python
我叫黑大帅11 小时前
add()和 __add__() 写法哪个更好呢?
后端·python·面试
不如语冰11 小时前
AI大模型入门-Python进阶-上下文管理与with语句
开发语言·数据结构·数据库·人工智能·pytorch·redis·python
柠檬味的Cat12 小时前
GEO优化系统哪个渠道商好
大数据·人工智能·python