Python-Pdf转Markdown

使用pdfminer.six+markdownify

  • pdfminer.six可以提取Pdf文本内容
  • markdownify可以将文本内容写markdown文件
安装
复制代码
pip install pdfminer.six 
pip install markdownify
实现
复制代码
from pdfminer.high_level import extract_text
from markdownify import markdownify

def pdf2markdown(pdf_path):
    # 提取 PDF 文本
    raw_text = extract_text(pdf_path)
    # 将原始文本转换为 Markdown 格式
    markdown_text = markdownify(raw_text)
    return markdown_text

data = pdf_to_markdown("./22.pdf")
file = open('./example.md', 'w',  encoding='utf-8')
# 写入字符串到文件
file.write(data)
# 关闭文件
file.close()
相关推荐
__sjfzllv___几秒前
在职前端Leader学习/转行 AI Agent -DAY24
前端
喜欢睡觉2 分钟前
从"白一下"到"丝滑切换"——前端路由的进化史
前端
玉宇夕落5 分钟前
React 多种路由学习:HashRouter 源码级剖析
前端
他们叫我秃子7 分钟前
前端开发转 Go 全栈(三):从函数到 error,Go 连“失败”都要明确返回
前端·后端·go
Canace17 分钟前
GPT-5.6 到底怎么选?一文搞懂 Sol、Terra、Luna 和 Ultra
前端·人工智能·chatgpt
用户0595401744620 分钟前
LangChain Memory 踩坑实录:10种异常场景差点搞崩生产,我们写了一套自动化测试保命
前端·css
名字还没想好☜22 分钟前
React useImperativeHandle 实战:让父组件安全地调用子组件的方法
前端·javascript·react.js·react·forwardref
CodeSheep24 分钟前
FFmpeg 9.0正式发布:代号“Lei”,以纪念中国开发者雷霄骅
前端·后端·程序员
过期的秋刀鱼!25 分钟前
机器学习开发的迭代循环
人工智能·python·深度学习·神经网络·机器学习
IT_陈寒25 分钟前
小心!Java里的这个空指针问题绝对坑过你
前端·人工智能·后端