python提取word文本和word图片

提取文本

docx只支持docx格式,所以如果想读取doc需要另存为docx格式即可

复制代码
import docx # pip3 install python-docx
复制代码
doc = docx.Document('three.docx')
for paragraph in doc.paragraphs:
    print(paragraph.text)

提取图片

复制代码
import zipfile
import os, re
复制代码
# docx本质上也是个压缩文件,使用zip我们就可以看到所有图片都被保存到了word/media里边
# 我们将该文件夹下的数据获取即可
with zipfile.ZipFile('one.zip', 'r') as zip_ref:
    for name in zip_ref.namelist():
        if len(re.findall(r'^word/media/', name)) > 0:
            zip_ref.extract(name, '')
相关推荐
gc_229910 小时前
学习C#调用OpenXml操作word文档的基本用法(14:学习文档编号定义类)
word·openxml·编号定义
wtsolutions1 天前
比Word邮件合并功能更强大的Sheet-to-Doc优势功能
word·批量生成·邮件合并·wtsolutions·sheet-to-doc
子根2 天前
【word】的一些通配符使用方法
word
manjianghong862 天前
如何将一本书PDF扫描件转word 并打印(免费工具)
pdf·word·pdf处理工具
huluang2 天前
Word文档批注智能克隆系统的设计与实现
开发语言·c#·word
gc_22992 天前
学习C#调用OpenXml操作word文档的基本用法(13:学习文档设置类)
word·openxml·文档设置
trayvontang2 天前
word格式原理与编号解析
word·word编号·word解析
huluang2 天前
高性能Word文档批注处理器的设计与实现
开发语言·c#·word
gc_22992 天前
学习C#调用OpenXml操作word文档的基本用法(12:读取文档字体表)
word·openxml·字体表
weixin_462446233 天前
【原创实践】Python 将 Markdown 文件转换为 Word(docx)完整实现
开发语言·python·word