使用Python解析pdf、docx等格式文件。

针对不同类型的文件,需要采取特定的访问与解析策略来有效获取其中蕴含的知识。下面我们将介绍对于不同数据源数据的获取方式。

1 解析Docx文档

1.1 获取Docx文档中文本

python 复制代码
from docx import Document
# pip install python-docx
# python-docx == 0.8.11
filename = 'xxx.docx'
doc = Document(filename)
for para in doc.paragraphs:
    print(para.text)

1.2 获取Docx文档中表格

python 复制代码
from docx import Document
filename = r'sample.docx'
doc = Document(filename)
print(f"\n 便利文档中表格:")
print(f"\n 方法一:")
for table in doc.tables:
    row_count = len(table.rows)
    col_count = len(table.columns)
    for i in range(row_count):
        row = table.rows[i].cells
        print(f"row : {row}")
print(f"\n 方法二:")
for table in doc.tables:
    row_count = len(table.rows)
    col_count = len(table.columns)
    for i in range(row_count):
        for j in range(col_count):
            print(table.cell(i,j).text)

2 解析txt文件

2.1 读取富文本txt

  • read() ------ 读取所有文本
python 复制代码
with open('sample.txt','r+',encoding='utf-8') as f:
	data = f.read()
	print(data)
  • readline() ------ 读取第一行的内容
python 复制代码
with open('sample.txt','r+',encoding='utf-8') as f:
	data = f.readline()
	print(data)
  • readlines() ------ 读取全部内容,以数列的形式返回结果
python 复制代码
with open('sample.txt','r+',encoding='utf-8') as f:
	data = f.readlines()
	print(data)
python 复制代码
with open('sample.txt','r+',encoding='utf-8') as f:
	for ann in f.readlines()
	ann = ann.strip('\n') # 去除文本中的换行符
	print(ann)
# 简单版本
for i in open(file='sample.txt',encoding='utf-8').readlines():
    ann = i.strip('\n')
    print(ann)

3 解析PDF

3.1 PDF解析神器------pdfplumber

3.1.1 安装
python 复制代码
pip install pdfplumber
3.1.2 提取pdf中的纯文本
python 复制代码
import pdfplumber
file_name = r'sample.pdf' # 需要解析的pdf文件
output_file = 'sample.txt' # pdf解析后的内容
with pdfplumber.open(file_name) as p:
    page_count = len(p.pages)
    for i in range(0,page_count):
        page = p.pages[i]
        text_data = page.extract_text()
        data = open(output_file,'a',encoding='utf-8')
        data.write(text_data)
3.1.3 提取pdf中的表格
python 复制代码
import pdfplumber
from openpyxl import Workbook # 保存表格
file_name = r'sample.pdf'
output_file = 'sample.xlsx'
with pdfplumber.open(file_name) as pdf:
    page = pdf.pages[0]
    table = page.extract_table()
    workbook = Workbook()
    sheet = workbook.active
    for row in table:
        sheet.append(row)
    workbook.save(filename=output_file)
  • extract_tables()方法------输出文档所有表格,返回一个嵌套列表。
python 复制代码
#extract_tables()法
with pdfplumber.open(r'exm.pdf') as pdf:  # 打开pdf
    page_one = pdf.pages[0]  
    page_one_table =page_one.extract_tables()  # 获取pdf第一页的所有表格数据
    for row in page_one_table:
       print('第一页的表格数据:', row)
  • extact_table()方法------不会返回文档的所有表格,仅返回行数最多的表格数据。如存在多个行数相等的表格,则默认输出顶部表格数据。表格的每一行都为一个单独的列表,列表中的元素即为原表格的各个单元格的数据。
python 复制代码
# extract_table()法
with pdfplumber.open(r'exm.pdf') as pdf_info:  # 打开pdf
    page_one = pdf_info.pages[0]  
    page_one_table = page_one.extract_table()
    for row in page_one_table:
        print(row)
复制代码
相关推荐
会博通·代码搬运工4 分钟前
会博通API对接实战:工程企业文档分布式采集系统的技术实现与Python SDK详解
开发语言·分布式·python·线性代数·矩阵·架构·电子档案合规
yunwei379 分钟前
eBPF 入门实践教程第五十篇:使用 TCX Link 实现可组合的流量控制
linux·云原生·开源
空堂与归10 分钟前
大模型再火,也得先过 class 这一关
python
Muselit11 分钟前
Python 泛型:把 list[User] 讲明白
python·fastapi
2501_9160074717 分钟前
Python实现HTTPS爬虫的完整指南:使用requests、BeautifulSoup、Selenium和Scrapy
爬虫·python·ios·小程序·https·uni-app·iphone
2401_8275012821 分钟前
Linux系统移植
linux·arm开发·单片机
gptAI_plus25 分钟前
别把整个仓库塞给 AI:用 Python 生成安全的代码上下文清单
python·chatgpt
吃饱了得干活26 分钟前
Agent 记忆系统:从短期记忆到长期记忆
python·langchain·agent
大鱼>43 分钟前
DSPy:LLM程序自动编译与提示词优化
开发语言·人工智能·python·深度学习
2401_843253701 小时前
金融智能:AI如何重构银行业未来
人工智能·python·金融