Python代码优雅解析PDF文件

主要功能:利用Python扩展库pdfplumber解析中文核心期刊要目总览.pdf文件成excel文件

解析文件:中文核心期刊要目总览.pdf

官方文档:pdfplumber · PyPI

具体代码:

python 复制代码
import pdfplumber
import pandas as pd

with pdfplumber.open("hexin.pdf") as pdf:
    print(len(pdf.pages))
    first = pdf.pages[0]
    ftable = first.extract_table()
    tables = ftable[2:]
    for page in pdf.pages[1:]:
        tables += page.extract_table()
    data_frame = pd.DataFrame(tables, columns=ftable[1])
    with pd.ExcelWriter('hexin.xlsx') as excel:
        data_frame.to_excel(excel, index=False)
相关推荐
大、男人10 小时前
python之Starlette
python·uvicorn
小智RE0-走在路上12 小时前
Python学习笔记(11) --数据可视化
笔记·python·学习
历程里程碑12 小时前
hot 206
java·开发语言·数据结构·c++·python·算法·排序算法
Coder_Boy_12 小时前
Java+Proteus仿真Arduino控制LED问题排查全记录(含交互过程)
java·人工智能·python
qq_3561969512 小时前
day47_预训练模型与迁移学习@浙大疏锦行
python
Tipriest_12 小时前
C++ 的 ranges 和 Python 的 bisect 在二分查找中的应用与实现
c++·python·算法·二分法
老歌老听老掉牙12 小时前
符号计算中的表达式等价性验证:数学等价性与计算简化策略分析
python·数学建模·sympy
scan72413 小时前
向量数据库检索
python
摸鱼仙人~13 小时前
一文详解PyTorch DDP
人工智能·pytorch·python
超级种码13 小时前
Java:JavaAgent技术(java.instrument和java.attach)
java·开发语言·python