import pdfplumber
import pandas as pd
def extract_tables_to_excel(pdf_path, excel_path):
# 打开PDF文件
with pdfplumber.open(pdf_path) as pdf:
# 创建一个空的DataFrame列表,用于存储所有表格数据
all_tables = []
# 遍历PDF的每一页
for page in pdf.pages:
# 提取当前页的表格
tables = page.extract_tables()
# 将每页的表格转换为DataFrame,并添加到all_tables列表中
for table in tables:
df = pd.DataFrame(table)
all_tables.append(df)
# 将所有表格数据合并为一个DataFrame
combined_tables = pd.concat(all_tables, ignore_index=True)
# 将合并后的表格数据保存到Excel文件中
combined_tables.to_excel(excel_path, index=False)
# PDF文件路径
pdf_path = '1.pdf'
# Excel文件路径
excel_path = 'output_tables.xlsx'
# 调用函数
extract_tables_to_excel(pdf_path, excel_path)
Python应用—从pdf文件中提取表格,并且保存在excel中
翻车吧奥斯卡2024-07-21 21:45
相关推荐
dotnet全栈开发42 分钟前
火爆全网的《高性价比人生指南》,613条建议最新完整版PDF来了!朝朝辞暮i8 小时前
VLA 系统学习第 4 课:一个 Batch 进入神经网络后,模型到底是怎么“学会”的?Ada's8 小时前
【计算机基础系列】003:Python数据结构2601_962885729 小时前
如何用 Python 计算 TRIX 三重指数平滑均线指标?还卿一钵无情泪9 小时前
Unsloth 微调 构建自己的大模型 没有GPU也能微调蜗牛互联网11 小时前
Python消费Responses SSE事件:增量文本、超时与取消statistican_ABin12 小时前
中国国际旅游发展分析报告—基于世界银行国际旅游数据的多维度分析青少儿编程课堂12 小时前
背包问题(0/1 背包与完全背包)解题精讲——动态规划入门code2cat12 小时前
【随笔】MCP工具注解的信任边界:四个提示如何参与调用决策慢云智慧空间12 小时前
从设备智能到空间理解,慢云科技如何重新定义智慧建筑