文档解析

山顶夕景17 小时前
ocr·文档解析·agentic
【文档解析】2026年技术发展和趋势其一,视觉token极压缩:"光学压缩"成了新卖点。其二,推理加速成为显学:多token预测+投机解码被卷到这个领域。 OCR输出长、又高度可预测,成了投机解码的"肥肉"。2026年几乎每家都在解「生成长、解码慢」的问题。代表的:
东莞市云毅网络有限公司1 天前
python·数据清洗·rag·企业知识库·文档解析
用 SQLite FTS5 给企业文档建本地全文索引:中文分词与权重调优企业内部的文档检索,多数场景并不需要上 Elasticsearch。几千到几万份文档的规模,用 SQLite 的 FTS5 扩展就能做到毫秒级响应,且零部署成本、单文件可迁移。这篇文章记录一套可直接运行的实现:中文预分词 + FTS5 索引 + BM25 权重调优 + 查询改写。
庖丁AI3 天前
pdf·ocr·文档解析·表格解析
PDF跨页表格提取后错列怎么办?先检查表头、续行和单位从PDF提取一张十几页的明细表,最容易忽略的问题是:第一页看起来完全正常,翻到后面,项目名称却落进了金额列,重复表头混进数据行,某一条长名称还被拆成两条记录。数字可能都识别出来了,但它们之间的关系已经错了。
智码看视界4 天前
pdf·pdfbox·预处理·rag·文档解析·tika·文本切块
Day72-文档预处理实战:PDF解析 + 文本切块的正确姿势RAG 的回答质量,80% 不取决于模型,而取决于喂给模型的上下文干不干净。检索阶段确实能命中相关文档,但如果进 LLM 的 Chunk 是"目录 + 正文 + 页眉页脚 + 水印"的混合体,模型再强也会答非所问。
东莞市云毅网络有限公司11 天前
python·数据清洗·rag·企业知识库·文档解析
企业非结构化资料拆分成可引用片段:一套能跑通的预处理流水线做检索增强(RAG)的人都知道一句话:检索质量的上限,是切分质量决定的。但企业侧的文档和公开语料完全不同——PDF 是扫描件混杂排版文本,Word 是十几年攒下来的各种模板,表格嵌在段落里,图片里还压着关键参数。直接按固定长度切,切出来的块要么截断在半句话上,要么把三件不相关的事揉在一起。
庖丁AI16 天前
人工智能·pdf·文档解析
PDF 转 Markdown 工具怎么选?AI 知识库和 RAG 场景要注意什么PDF 看起来只是一个“能打开就行”的文件,但一旦要进入知识库、搜索问答或 RAG 流程,问题就变了。真正需要的不是把文字拷出来,而是把标题层级、表格、列表、脚注和段落关系一起整理好。
求真学习1 个月前
ocr·pdf解析·腾讯·文档解析·youtu-parsing
腾讯优图Youtu-Parsing开源,无损并行解码让表格解析提速26倍,OmniDocBench 93.22分一个2.5B参数的文档解析模型,推理速度竟然比3B的dots.ocr快了一倍多。这不是「模型更小所以更快」那么简单,秘密藏在一种叫「无损并行解码」的方法里。
求真学习2 个月前
pdf·ocr·pdf解析·字节跳动·文档解析·dolphin-v2
字节跳动Dolphin-v2:数字 PDF 拆开读、拍照文档整页读,自建拍照文档集平均编辑距离较原始 Dolphin降低约 91%同一页论文,从电脑里导出来,和用手机拍下来,内容一点没变。可到了文档解析模型手里,它们最好别走同一条路。
求真学习2 个月前
百度·ocr·pdf解析·paddleocr·文档解析
最新百度PaddleOCR开源HPD-Parsing,提出层级并行文档解析,1B模型解码步数最高压缩18倍,文档解析效率提升3倍!拿到一份扫描文档,丢给一个视觉语言模型做解析。模型看了一眼图片,视觉编码器几十毫秒就处理完了,然后开始一个字一个字地往外吐结果。
求真学习2 个月前
ocr·pdf解析·glm·文档解析·智谱
智谱联合清华开源GLM-OCR,0.9B参数配MTP多Token预测,文档解析吞吐量1.86页/秒,印章识别90.5分,第二名才42.2分2026年3月,智谱AI联合清华大学在arXiv上挂出了一篇技术报告,主角叫GLM-OCR,一个文档解析模型,参数量0.9B。
_张一凡4 个月前
问答系统·大语言模型·文档解析·rag文档处理·mineru2.5
通往RAG之路(四):实战篇pdf文档解析为josn&md这是一个基于MinerU工具开发的批量文档智能解析与格式转换自动化脚本,核心作用是将 PDF、图片、Office 等格式的文档,批量转换为结构化的 Markdown 文本和 JSON 数据,适用于文档数字化、RAG 知识库构建、数据提取等场景。 我的文档全部是pdf,目前只是用到pdf输入。目前只是将pdf数据解析为 Markdown 文本和 JSON 数据。
weixin_377634844 个月前
文档解析·mineru
【MinerU】 Docker 使用问答记录定义在 pyproject.toml:110-120:具体来说,all 在 core 基础上额外安装:
weixin_377634844 个月前
文档解析·mineru
【MinerU】 3090部署 CUDA版本升级我在矩池云上租了3090,但是 CUDA 只有12.2, 当使用 MinerU 的 -b vlm-auto-engine时,官方文档上写着CUDA最低要12.9,当我询问 Gemini 如何升级的时候,给出的答案是只升级 CUDA Toolkit。
weixin_377634845 个月前
文档解析
【MinerU】Pipeline 与 Auto-Engine 模式采用多个专用模型串行处理:分为 hybrid-auto-engine(默认)和 vlm-auto-engine 两种,核心是引入了 视觉语言模型(VLM):
weixin_377634845 个月前
文档解析·mineru
【MinerU】API 服务与 Router服务MinerU 提供 mineru-api 命令启动 FastAPI 服务,支持同步和异步两种处理模式:
weixin_377634845 个月前
文档解析·mineru
【MinerU】多类型文件解析与模型管理MinerU 目前支持以下文件格式:注意:只支持 Office Open XML 格式(.docx/.pptx/.xlsx),不支持旧版二进制格式(.doc/.ppt/.xls)。
weixin_377634845 个月前
文档解析·mineru·昇腾910b
【MinerU】昇腾910B部署npu.Dockerfile 是 MinerU 为华为昇腾(Ascend)NPU 加速卡专门提供的 Docker 构建文件,用于在昇腾硬件上运行 MinerU 的全部功能(pipeline、vlm-auto-engine、hybrid-auto-engine 等)。
盼小辉丶5 个月前
文档解析·openclaw·xparse-parser
TextIn xParse Skill上架ClawHub,补齐Agent“读文档”短板Agent 的生态正在飞速扩张,OpenClaw 社区里上万 Skills 的涌现就是最好的证明。但当开发者们兴冲冲地把 Agent 推向企业真实业务时,一个被长期低估的问题总会浮出水面:模型会思考,但不会“读文档”。 PDF、图片、扫描件、Office 文件等等这些日常工作中最普遍的载体,对大多数 Agent 来说依然是一堵墙。模型原生只能理解文本,面对一张发票截图、一份 PDF 合同或是一页扫描版论文时,要么束手无策,要么依赖 OCR 勉强应对——效果差、速度慢、结构全丢,而这些“非结构化数据”往往才
合合技术团队5 个月前
文档解析·ragflow·textin
RAGFlow集成TextIn方案2.0上线!支持快速镜像部署,随时切换解析插件当前基于 RAGFlow v0.24.0 | 插件式集成本项目是RAGFlow的增强版本,集成了TextIn文档智能解析能力,提供更高质量的PDF文档理解。
_张一凡5 个月前
深度学习·ocr·文档解析·千帆ocr·rag文档解析·qianfan-ocr
【文档解析】一文学懂百度千帆OCR模型细节及本地部署百度千帆 OCR(Qianfan-OCR) 是百度千帆团队于 2026 年 3 月发布的端到端统一文档智能大模型,主打 “单模型搞定全链路文档处理”,与传统的多阶段OCR流水线(将独立的版面检测、文字识别和语言理解模块串联)不同,千帆-OCR 以4B所谓参数可执行 直接的图像到Markdown转换,并支持广泛的提示驱动任务——从结构化文档解析、表格提取,到图表理解、文档问答和关键信息抽取——全部由单一模型完成。在多项权威评测中登顶,且已开源。