python提取word文本和word图片

提取文本

docx只支持docx格式,所以如果想读取doc需要另存为docx格式即可

复制代码
import docx # pip3 install python-docx
复制代码
doc = docx.Document('three.docx')
for paragraph in doc.paragraphs:
    print(paragraph.text)

提取图片

复制代码
import zipfile
import os, re
复制代码
# docx本质上也是个压缩文件,使用zip我们就可以看到所有图片都被保存到了word/media里边
# 我们将该文件夹下的数据获取即可
with zipfile.ZipFile('one.zip', 'r') as zip_ref:
    for name in zip_ref.namelist():
        if len(re.findall(r'^word/media/', name)) > 0:
            zip_ref.extract(name, '')
相关推荐
FlYFlOWERANDLEAF14 小时前
DevExpress中Word Processing Document API学习记录
学习·c#·word
AnySpaceOne14 小时前
PDF转Word在线转换教程:多种实用方法分享
学习·pdf·word
我命由我123452 天前
Word - Word 的 5 种视图(页面视图、阅读视图、Web 版式视图、大纲视图、草稿视图)
ui·word·excel·photoshop·表格·ps·美工
XYZLHL2 天前
Word怎么设置页码总页数不包含封面和目录页
word
传而习乎2 天前
Word添加图/表题注
word
YAY_tyy2 天前
基于 Vue3 + VueOffice 的多格式文档预览组件实现(支持 PDF/Word/Excel/PPT)
前端·javascript·vue.js·pdf·word·excel
东风西巷3 天前
Atlantis Word Processor:全方位的文字处理专家
前端·学习·word·软件需求
Metaphor6923 天前
Java 高效处理 Word 文档:查找并替换文本的全面指南
java·经验分享·word
jianghaha20113 天前
前端 Word 模板参入特定数据 并且下载
前端·word