import pdfplumber
import pandas as pd
def extract_tables_to_excel(pdf_path, excel_path):
# 打开PDF文件
with pdfplumber.open(pdf_path) as pdf:
# 创建一个空的DataFrame列表,用于存储所有表格数据
all_tables = []
# 遍历PDF的每一页
for page in pdf.pages:
# 提取当前页的表格
tables = page.extract_tables()
# 将每页的表格转换为DataFrame,并添加到all_tables列表中
for table in tables:
df = pd.DataFrame(table)
all_tables.append(df)
# 将所有表格数据合并为一个DataFrame
combined_tables = pd.concat(all_tables, ignore_index=True)
# 将合并后的表格数据保存到Excel文件中
combined_tables.to_excel(excel_path, index=False)
# PDF文件路径
pdf_path = '1.pdf'
# Excel文件路径
excel_path = 'output_tables.xlsx'
# 调用函数
extract_tables_to_excel(pdf_path, excel_path)
Python应用—从pdf文件中提取表格,并且保存在excel中
翻车吧奥斯卡2024-07-21 21:45
相关推荐
databook4 小时前
使用 SciPy 库进行时间序列分析java资料站4 小时前
十一、评估测试szial4 小时前
网络爬虫与 CDP 实战(二):浏览器能访问,Python 却被拒绝?拆开登录态与 CSRF青少儿编程课堂5 小时前
后缀自动机解析:本质不同子串与最长重复片段统计怕浪猫6 小时前
LLM 面试必问的 8 个问题,答不上来直接淘汰老歌老听老掉牙7 小时前
从三维旋转的深度解析到Python实现:绕任意轴旋转的奥秘码林拾遗WJ7 小时前
学术 PDF 翻译工作流:从乱码到双语对照的实战记录打工仔折腾 AI7 小时前
工业场景下时序库与实时计算一体化架构选型实践对比梦幻精灵_cq8 小时前
sumdir——一个伪python.built-in的“术法”打造weixin_440730509 小时前
函数return、参数、参数组、递归函数、高阶函数等小结