Python-Pdf转Markdown

使用pdfminer.six+markdownify

  • pdfminer.six可以提取Pdf文本内容
  • markdownify可以将文本内容写markdown文件
安装
复制代码
pip install pdfminer.six 
pip install markdownify
实现
复制代码
from pdfminer.high_level import extract_text
from markdownify import markdownify

def pdf2markdown(pdf_path):
    # 提取 PDF 文本
    raw_text = extract_text(pdf_path)
    # 将原始文本转换为 Markdown 格式
    markdown_text = markdownify(raw_text)
    return markdown_text

data = pdf_to_markdown("./22.pdf")
file = open('./example.md', 'w',  encoding='utf-8')
# 写入字符串到文件
file.write(data)
# 关闭文件
file.close()
相关推荐
满怀冰雪11 分钟前
09-使用 paddle.nn 构建第一个多层感知机
python·深度学习·神经网络·paddle
爱勇宝12 分钟前
你以为自己性格不好,其实只是被环境反复训练
前端·后端·程序员
phltxy15 分钟前
LangChain_v1_Agent快速开发和更新说明
前端·javascript·langchain
Cobyte15 分钟前
通过 Vite 运行手写的模板编译器
前端·javascript·vue.js
Bigger16 分钟前
🔥每天最难的问题不是做饭,而是今天到底吃什么——我做了「烟火食间」
前端·人工智能·agent
Hyyy21 分钟前
Electron多进程
前端
swipe28 分钟前
08|(前端转全栈)一个商品详情接口背后的完整链路:HTTP、Redis、MySQL 与 JSON
前端·后端·全栈
小大宇34 分钟前
python sqlalchemy 案例
开发语言·python
梦想很大很大39 分钟前
Synclan:一个基于局域网的即时通讯式文件传输工具
前端·后端·开源
光影少年1 小时前
RN原生交互 & 桥接
前端·javascript·react native·react.js·前端框架