MinerU高级用法,避坑指南(持续更新)如图,pdf文本(可复制),经过mineru解析后,数字相关的部分都丢失了。 问题定位: MinerU支持PDF、图片和DOCX三大主流文档格式的输入。对于PDF文档,工具能够自动处理扫描件和乱码PDF并启用OCR功能。 从官方给出的代码可以看出,mineru默认采用”auto“来进行解析,内部自动根据文本格式等因素选择采用OCR、text的方式来解析文本。这里的text是使用了python解析库来解析pdf的(如:pymulf),(猜测,数字地方可能包含了其它格式,如latex),传统的python库解