MinerU 是一款将PDF转化如markdown、json工具

MinerU

项目简介

MinerU是一款将PDF转化为机器可读格式的工具(如markdownjson),可以很方便地抽取为任意格式。 MinerU诞生于书生-浦语的预训练过程中,我们将会集中精力解决科技文献中的符号转化问题,希望在大模型时代为科技发展做出贡献。 相比国内外知名商用产品MinerU还很年轻,如果遇到问题或者结果不及预期请到issue提交问题,同时附上相关PDF。

2、demo网址

点击

导入pdf文件使用,有示例pdf效果还挺好

3、吸引点

也就是按照PDF全部转换过来,

  • 保留原文档的结构,包括标题、段落、列表等
  • 提取图像、图片标题、表格、表格标题
  • 自动识别文档中的公式并将公式转换成latex

不足点:表格数据还是以图片的方式转过来的

相关推荐
小墨宝4 小时前
js 生成pdf 并上传文件
前端·javascript·pdf
热水养鲨鱼9 小时前
Java实现HTML转PDF(deepSeekAi->html->pdf)
人工智能·pdf·html
开开心心_Every21 小时前
体积小巧的 Word 转 PDF 批量工具
pdf
一眼青苔21 小时前
切割PDF使用python,库PyPDF2
服务器·python·pdf
zyk_5201 天前
前端渲染pdf文件解决方案-pdf.js
前端·javascript·pdf
IDRSolutions_CN1 天前
如何将 PDF 中的文本提取为 JSON 格式
java·经验分享·pdf·软件工程·团队开发
南博萬1 天前
java将pdf转换成word
java·pdf·word
zhishishe2 天前
2025 年免费 Word 转 PDF 转换器有哪些?
android·windows·pdf·电脑·word
.m2 天前
几种Word转换PDF的常用方法
pdf
前端开心果2 天前
vue实现静默打印pdf
前端·vue.js·pdf