python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
_oP_i3 小时前
python 后缀 mjs文件
开发语言·python
北斗落凡尘3 小时前
如何使用LangGraph(1)
python·langchain
Livia要学习4 小时前
Python装饰器
开发语言·python
circuitsosk5 小时前
向量数据库选型与性能压测:Milvus、Pinecone、Chroma在真实业务下的对比
数据库·python·pinecone·milvus·向量数据库·chroma
雾时之林5 小时前
python--字符串
开发语言·python
战略性的菠萝5 小时前
研究生基本功-Python快速入门(一)
python
鬼手点金6 小时前
与LLM结合的主流智能爬虫框架
爬虫·python·llm·post·request·firecrawl·crawl4ai
月光船幽幽6 小时前
门控函数SHS阈值与调制机制解析
人工智能·python·算法
测试19986 小时前
2026全新软件测试面试八股文(含答案+文档)
自动化测试·软件测试·python·测试工具·面试·职场和发展·测试用例
Zane19946 小时前
map 比推导式快"是真的吗?一文讲透 map、filter、reduce 与 lambda 的真实性能与设计取舍
后端·python