MinerU高级用法,避坑指南(持续更新)

这里写自定义目录标题

文本解析

问题1:数字解析后丢失

如图,pdf文本(可复制),经过mineru解析后,数字相关的部分都丢失了。

问题定位 :

MinerU支持PDF、图片和DOCX三大主流文档格式的输入。对于PDF文档,工具能够自动处理扫描件和乱码PDF并启用OCR功能。

从官方给出的代码可以看出,mineru默认采用"auto"来进行解析,内部自动根据文本格式等因素选择采用OCR、text的方式来解析文本。这里的text是使用了python解析库来解析pdf的(如:pymulf),(猜测,数字地方可能包含了其它格式,如latex),传统的python库解析时无法正确读取,导致数字丢失。

解决办法:

bash 复制代码
parse_method = ocr
# 调用时,强制开启ocr,使用ocr来解析所有文档
相关推荐
kobe_OKOK_30 分钟前
__getattr__和__getattribute__如何用
python
java资料站1 小时前
十一、Spring AI Alibaba · 高级 · 多智能体(Multi-agent)
人工智能·spring·microsoft
全栈弄潮儿2 小时前
Python实战第2期: 变量与数据类型
后端·python·agent
长沙三为智能科技2 小时前
家政小程序门店运营模块设计:会员、下单、派单、结算四段链路的落地拆解
python·小程序·内容运营
2601_955662462 小时前
情感解说视频如何提升感染力?配音细节很关键
人工智能·音视频·语音识别·视频
Cc.Y2 小时前
Java零基础入门:可变字符串与包装类:StringBuilder、StringBuffer 与 通讯录管理系统实战
java·开发语言·python
苏醒的人生2 小时前
电商品牌物料AI生图工具推荐:让品牌调性一套到底
人工智能
lank_M2 小时前
截图OCR预处理在普通屏上翻车,Retina截图却没事
图像处理·人工智能·计算机视觉·ocr
Aloudata2 小时前
LookML 语义模型 vs 企业级独立语义层:BI 建模语言能否承担企业语义底座?
数据库·人工智能·数据分析·数据资产·dataagent