技术栈

python 提取PDF文字

柚见2024-02-24 20:05

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
上一篇:Java导出pdf格式文件
下一篇:分布式扫描bean问题
相关推荐
听雨入夜
16 分钟前
zero.zhang
开发语言·python
叶 落
1 小时前
Mac 通过 Miniconda 安装 Python
python·macos·conda·miniconda
就改了
7 小时前
Java8 日期处理(详细版)
java·python·算法
威联通安全存储
10 小时前
TS-h1887XU-RP在汽车发动机热试与NVH在线质检网中的部署
python·汽车
qq_31641103
11 小时前
腹腔镜模拟手术训练数字化管理平台构建
人工智能·python·深度学习·机器学习
卷无止境
11 小时前
PageIndex:把RAG的检索逻辑从"找相似"改成了"讲道理"
后端·python
卷无止境
12 小时前
什么是VoxCPM2?一场TTS架构的彻底重构
后端·python
kisloy
13 小时前
【爬虫入门第5讲】Python爬虫文本解析详解
开发语言·爬虫·python
神经蛙1996
14 小时前
🌍 别再硬编码中文了!Python Web 项目国际化(i18n)完全指南
后端·python
颜酱
14 小时前
14 | 验证并修正 LLM 生成的 SQL
人工智能·python
热门推荐
01GitHub 镜像站点02如何新建文件夹? 电脑新建文件夹的4种方法032026年7月AI圈大地震:GPT-5.6被政府限制、Claude入驻Slack、Anthropic自研芯片04国内可直接用、免费额度/永久免费的大模型API清单(含 SiliconFlow、火山、阿里、智谱、百度、Kimi、DeepSeek、DMXAPI 等)05AI 编程 IDE 全景解析 2026:Agent 全面接管开发链路06AI科技热点日报 | 2026年07月01日07微信历史版本含下载地址( Windows PC | 安卓 | MAC )及设置微信不更新082026 国产 AI 大模型横评:DeepSeek、通义千问、Kimi、文心一言、星火、豆包谁更能打?092026上半年大模型全景技术解读:推理融合、Agent 爆发与多模态统一10Agnes AI 免费 API 接入指南:文本、生图、生视频,一套接口全免费