技术栈

python 提取PDF文字

柚见2024-02-24 20:05

使用pdfplumber,不能提取扫描的pdf和插入的图片。

python 复制代码
import pdfplumber

file_path = r'D:\UserData\admindesktop\官方文档\1903_Mesh-Models-Overview_FINAL.pdf'
with pdfplumber.open(file_path) as pdf:
    page = pdf.pages[0]
    print(page.extract_text()) # 所以文字
    print([word["text"] for word in page.extract_words()]) # 提取存在的文字
上一篇:Java导出pdf格式文件
下一篇:分布式扫描bean问题
相关推荐
cts618
7 分钟前
FDE架构师前端选型指南
python
2601_96229379
37 分钟前
【Python教程:自动化处理文件】
python·自动化·编程·文件处理·os模块
禹凕
38 分钟前
快速幂算法详解与实战
python·算法
sylviiiiiia
1 小时前
leetcode hot 100
python·算法·leetcode
半摆烂日常
1 小时前
自建WMS和买成品:三年成本对比
大数据·服务器·数据库·python·深度学习·低代码·numpy
2601_96229651
1 小时前
Python的哈希hashlib模块详细解读
python·md5·sha·加密算法·hashlib
chinesegf
1 小时前
comfyui便携版的基础使用
python
OPEN-F
1 小时前
ROS2系列教程:Gazebo插件(关节控制/IMU/激光雷达)
c++·python·数码相机·算法·机器人
临沂GEO
1 小时前
芝麻开门GEO|AI数字化新趋势,助力企业线上长效增长
大数据·人工智能·python
梦想不只是梦与想
2 小时前
大模型系列(二):技术基础与核心能力
python·大模型·token
热门推荐
01国内可直接用、免费额度/永久免费的大模型API清单(含 SiliconFlow、火山、阿里、智谱、百度、Kimi、DeepSeek、DMXAPI 等)02GitHub 镜像站点03蜘蛛磁力 搜索引擎大全,如何使用蜘蛛磁力查找磁力链接04历年考研数学一、数学二、数学三真题试卷及答案PDF05ZCode 周末送额度活动开启:3 亿 Token 免费领取062026 国产 AI 大模型横评:DeepSeek、通义千问、Kimi、文心一言、星火、豆包谁更能打?07微信历史版本含下载地址( Windows PC | 安卓 | MAC )及设置微信不更新08Agnes AI 免费 API 接入指南:文本、生图、生视频,一套接口全免费09AI 编程 IDE 全景解析 2026:Agent 全面接管开发链路10VSCode+CodeX扩展,无法启动