MinerU 是一款将PDF转化如markdown、json工具

MinerU

项目简介

MinerU是一款将PDF转化为机器可读格式的工具(如markdownjson),可以很方便地抽取为任意格式。 MinerU诞生于书生-浦语的预训练过程中,我们将会集中精力解决科技文献中的符号转化问题,希望在大模型时代为科技发展做出贡献。 相比国内外知名商用产品MinerU还很年轻,如果遇到问题或者结果不及预期请到issue提交问题,同时附上相关PDF。

2、demo网址

点击

导入pdf文件使用,有示例pdf效果还挺好

3、吸引点

也就是按照PDF全部转换过来,

  • 保留原文档的结构,包括标题、段落、列表等
  • 提取图像、图片标题、表格、表格标题
  • 自动识别文档中的公式并将公式转换成latex

不足点:表格数据还是以图片的方式转过来的

相关推荐
2501_9071368218 小时前
PDF Splitter Pro - PDF页面分割器
pdf·软件需求
2023框框1 天前
给PDF书籍添加书签
pdf
月屯2 天前
Pandoc 之--pdf-engine
java·开发语言·pdf
开开心心_Every2 天前
Word转PDF工具,免费生成图片型文档
网络·笔记·pdf·word·powerpoint·excel·azure
一个无名的炼丹师2 天前
[硬核实战] 解锁多模态RAG:构建能“看懂”PDF复杂图表的智能问答系统
人工智能·python·pdf·多模态·rag
非凡ghost3 天前
Xournal++(PDF文档注释工具) 中文绿色版
学习·pdf·生活·软件需求
MonkeyKing_sunyuhua3 天前
使用ARQ做PDF OCR和 图片OCR的任务的方案
pdf·ocr
2501_930707783 天前
如何使用C#代码在 PDF 中添加或删除附件
pdf
m5655bj3 天前
如何使用 Python 调整 PDF 页面顺序?
python·pdf
YuanYWRS3 天前
办公基础:实现PDF中表单不改变格式的情况下转成excel
pdf·excel