python提取word文本和word图片

提取文本

docx只支持docx格式,所以如果想读取doc需要另存为docx格式即可

复制代码
import docx # pip3 install python-docx
复制代码
doc = docx.Document('three.docx')
for paragraph in doc.paragraphs:
    print(paragraph.text)

提取图片

复制代码
import zipfile
import os, re
复制代码
# docx本质上也是个压缩文件,使用zip我们就可以看到所有图片都被保存到了word/media里边
# 我们将该文件夹下的数据获取即可
with zipfile.ZipFile('one.zip', 'r') as zip_ref:
    for name in zip_ref.namelist():
        if len(re.findall(r'^word/media/', name)) > 0:
            zip_ref.extract(name, '')
相关推荐
一棵星2 小时前
内网 MySQL 表结构一键导出 Word 文档:直连 + Agent 双模式实战
数据库·mysql·word
bug嘛我经常写5 小时前
如何批量删除word文档中存在的无用样式
经验分享·python·word
Am-Chestnuts16 小时前
Kimi长回答批量导出Word:DS随心转实践
word
曹牧19 小时前
Word:更改列表级别
word
wtsolutions2 天前
Sheet-to-Doc Skill: Let AI Assistants Generate Word Documents for You
人工智能·word
qq_466302454 天前
如何在word中添加代码
word
一棵星4 天前
LibreOffice Word 转 PDF 报错 “source file could not be loaded” 完整解决方案
pdf·word
一棵星4 天前
记一次 Word 转 PDF 功能故障排查与修复
pdf·word
拆房老料6 天前
ONLYOFFICE AI Agent 深度解析:在线 Office 正从编辑器走向智能工作平台
人工智能·中间件·编辑器·word·开源软件
186******205316 天前
PDF 转 Word 高效办公实战指南
pdf·word