python 提取PDF文字

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
相关推荐
nangonghen8 分钟前
Agent如何传递不同类型的ID给MCP Server
开发语言·python
weixin_3988316611 分钟前
佛山AI推广GEO哪家做的专业
人工智能·python
taller_200022 分钟前
【006】何时用 Python?何时用 Excel 公式?一文讲清
python·excel·公式·pie·py
2601_9623815834 分钟前
物联网场景下的 Python 边缘计算轻量化方案解析与实战落地
python·物联网·边缘计算·数据处理·轻量化方案
whcyhhh42 分钟前
头歌实践教学平台:大数据存储2023(十三1)
大数据·数据库·python
2601_966949651 小时前
9:25-9:30 如何获取 A 股开盘基准价?QuantDash Python SDK 实战初始化量化策略状态
开发语言·人工智能·python·量化·quantdash·量化数据源
卷无止境1 小时前
从一杯咖啡的订单说起,数据库设计到底是怎么长出来的
后端·python
2601_962066231 小时前
golang超详细基础入门教程_golang教程
前端·python·golang
逗脑IDE1 小时前
零基础学ESP32:蜂鸣器——让ESP32会“唱歌”!
python·物联网·esp32·智能家居
TomEval1 小时前
【Web UI 自动化】08 - 企业选型·报告·CI/CD
python·功能测试