MinerU 是一款将PDF转化如markdown、json工具

MinerU

项目简介

MinerU是一款将PDF转化为机器可读格式的工具(如markdownjson),可以很方便地抽取为任意格式。 MinerU诞生于书生-浦语的预训练过程中,我们将会集中精力解决科技文献中的符号转化问题,希望在大模型时代为科技发展做出贡献。 相比国内外知名商用产品MinerU还很年轻,如果遇到问题或者结果不及预期请到issue提交问题,同时附上相关PDF。

2、demo网址

点击

导入pdf文件使用,有示例pdf效果还挺好

3、吸引点

也就是按照PDF全部转换过来,

  • 保留原文档的结构,包括标题、段落、列表等
  • 提取图像、图片标题、表格、表格标题
  • 自动识别文档中的公式并将公式转换成latex

不足点:表格数据还是以图片的方式转过来的

相关推荐
keerduoba14 小时前
PDFParser 的pickle.loads 寻找链(源码)wmctf2025-pdf2text
python·pdf·pickle·pdf与pickle反序列化
hereitis贝壳15 小时前
高效 PDF 处理利器:PDF-XChange Editor v10.7.3.401 功能解析与优化版分享
pdf
私人珍藏库16 小时前
[Windows] PDF 专业压缩工具 v3.6
windows·pdf
程序视点16 小时前
PDF格式转换、PDF编辑全功能解锁,功能图文教程
pdf·pdf压缩·pdf合并·pdf编辑·pdf格式转换
DreamNotOver16 小时前
将 Jupyter Notebook 转换为 PDF
ide·jupyter·pdf
要加油哦~17 小时前
其他 | 把 csdn 博客的内容导出成 pdf 文件
pdf
m0_5649149218 小时前
点击EDGE浏览器下载的PDF文件总在EDGE中打开
前端·edge·pdf
Hello123网站1 天前
北极象沉浸式翻译 - 沉浸式翻译 | 免费翻译 | PDF翻译
人工智能·pdf·ai工具
web打印社区1 天前
如何在 Vue 中打印页面:直接用 web-print-pdf(npm 包)
前端·vue.js·pdf
web打印社区1 天前
最简单的 Web 打印方案:用 5 分钟上手 web-print-pdf(npm 包)
前端·pdf·npm