python提取word文本和word图片

提取文本

docx只支持docx格式,所以如果想读取doc需要另存为docx格式即可

复制代码
import docx # pip3 install python-docx
复制代码
doc = docx.Document('three.docx')
for paragraph in doc.paragraphs:
    print(paragraph.text)

提取图片

复制代码
import zipfile
import os, re
复制代码
# docx本质上也是个压缩文件,使用zip我们就可以看到所有图片都被保存到了word/media里边
# 我们将该文件夹下的数据获取即可
with zipfile.ZipFile('one.zip', 'r') as zip_ref:
    for name in zip_ref.namelist():
        if len(re.findall(r'^word/media/', name)) > 0:
            zip_ref.extract(name, '')
相关推荐
wujian831116 小时前
怎么用文心生成word文档?从格式错乱到智能导出,AI导出鸭让创作再无后顾之忧
人工智能·ai·word·豆包·deepseek·ai导出鸭
ccino .1 天前
awvs_json_word.py 使用说明手册
json·word
yuhulkjv3351 天前
Grok鸿蒙版导出word格式的终极解法:AI导出鸭如何重构AI内容到文档的最后一公里
人工智能·ai·word·harmonyos·ai导出鸭
2601_965912912 天前
PDF转Word与拆分组合操作实测:从格式保真到批量处理的方案对比
pdf·word
DS随心转APP2 天前
生成word文档的DeepSeek底层解码与“AI导出鸭”工程化方案:一份技术架构师的全维度测评
人工智能·ai·chatgpt·word·deepseek·ai导出鸭
DS随心转插件2 天前
ChatGPT星号怎么去除?AI 导出鸭从底层根治标记符号顽疾
人工智能·ai·chatgpt·word·deepseek·ai导出鸭
wujian83113 天前
怎么用千问生成word文档:从「格式崩」到「一键过」,AI导出鸭打通最后半厘米
人工智能·ai·c#·word·豆包·deepseek·ai导出鸭
Am-Chestnuts3 天前
豆包表格复制到 Word 后错列,先保留 Markdown 再转换
word
2601_965913003 天前
多份PDF批量转Word合并,三次踩坑后的方案对比与性能评估
pdf·word
DS随心转APP3 天前
deepseek生成的word怎么下载 AI导出鸭全平台方案技术深度测评
人工智能·ai·chatgpt·word·deepseek·ai导出鸭