| 检查对象 | 重点核对 | 失败后常见结果 |
|---|---|---|
| 标题与段落 | 层级、顺序、跨页连接 | 条件与正文分离 |
| 表格 | 表头、单元格、空值比例 | 数值失去字段含义 |
| 图片 OCR | 文字完整度、页码位置 | 关键说明无法检索 |
| 解析回退 | 采用的解析器、回退原因 | 同类文件结果不一致 |
表格和扫描件最好分开验收。表格需要看行列关系、合并单元格和表头重复是否被正确处理;扫描件要看倾斜页面、印章遮挡、低分辨率和混合语言。把两类资料只按"文字是否出现"验收,容易漏掉结构问题。文字都在,字段对应关系错了,后续回答仍会引用错误数据。
页面位置也值得保留。制度文件中的脚注、附件和跨页条款常带有限定条件,解析后若失去页码与原始位置,资料负责人很难回到原文确认。抽查记录可以保存文件名、页码、元素类型和预期结果,下一次更换解析器时继续使用。
低置信内容需要进入确认队列
自动解析可以处理大量文件,仍会遇到扫描模糊、复杂表格和混合排版。ZGI 的解析质量服务会依据内容类型和置信度整理待确认项,也会记录 OCR 回退、视觉模型回退与表格结构风险。资料负责人由此可以直接定位可疑元素,无需从整份文件里盲查。
置信度只适合用来筛选检查对象。分数较高的文本仍可能丢掉限定条件,分数较低的内容也可能完整可读。确认页面需要同时展示原始位置、解析结果和风险原因,让人能判断修改解析结果、重新上传文件,还是接受当前内容。
确认结果还要回到处理链路。接受的内容进入后续切分,被退回的内容应保留原因并等待重处理;同一份文件多次处理时,需要区分每一批解析产物。确认动作若只停留在页面上,索引可能继续使用未经修正的旧文本,人工检查便失去了作用。
解析路由和文档版本要能追踪
同类文件若走了不同解析器,后续结果可能出现差异。入库记录需要保留处理请求、采用的解析路径、回退情况、失败代码和生成批次。资料更新后,还应通过文档版本和内容哈希区分新旧产物,避免索引仍引用上一版内容。
ZGI 的文档资产链路会记录处理阶段、切分数量和向量状态,便于判断任务停在解析、切分还是索引。上线前可准备十到二十份代表性资料,覆盖文本 PDF、扫描件、复杂表格和跨页内容。每次调整解析策略后重复检查同一批样本,知识入库质量才有可比较的基线。
验收结果可以按文件类型统计通过、退回和需人工确认的数量,同时保留具体失败样本。数字用于观察处理变化,样本用于解释原因。某类扫描件持续出现相同问题时,团队可以调整入口要求、解析路由或人工确认范围,无需把所有资料重新处理一遍。
GitHub:github.com/zgiai/zgi
Gitee:gitee.com/zgiai/zgi