612 次图表重建实验告诉我们的:O612 次图表重建实验告诉我们的:OCR、图形与连接线CR、图形与连接线

把图表图片转换成可编辑对象,听起来只需调用一次视觉模型:让它输出方框、文字和箭头,再生成文件。这个原型在干净流程图上可行,一旦遇到真实架构图中的小字、重复图标、嵌套容器、并行线路和拥挤走线,就会暴露问题。

为了找到 LayerBack 图片转可编辑图表流程中的质量损失点,我们做了一组受控实验:336 次结构识别,加 276 次拓扑识别,总计 612 次模型运行,覆盖 12 张图。其中 10 张生成图有精确标准答案,另有 2 张真实图。

目标并不是宣布一个通用"最佳模型",而是回答几个具体工程问题:

  • OCR 清单能否减少节点遗漏?
  • 提高推理强度会不会改善结构抽取?
  • 哪种模型更适合观察连接拓扑?
  • 是否需要第二个模型裁决候选线路?
  • 对于没有线路的图,能否安全跳过拓扑阶段?

被拆开的处理流程

基线流程分为:

  1. OCR 提取文字与坐标;
  2. 多模态模型识别节点、类型、位置和样式;
  3. 确定性代码把 OCR 文字合并到结构中;
  4. 拓扑观察器根据已知节点目录追踪连接线;
  5. 可选的裁决模型接受或拒绝候选边;
  6. 分割模型提取图标与自定义插画;
  7. 确定性序列化生成 draw.io、VSDX、PPTX、SVG 和预览。

拆开后,文字遗漏与虚构连接线成为两个可独立衡量的问题,不需要不断加长同一个提示词来同时修补。

结论一:OCR 不是兜底,而是 grounding

最强的识别配置把明确的 OCR 清单交给视觉模型。terra-low-ocr 在 33 次测量中,节点召回率平均值和最小值都是 1.00 / 1.00 。快速配置 luna-low 平均为 0.93 ,但在困难案例中最低只有 0.32。

重点不在模型名称,而是可见文字能成为检查清单。模型即使理解了整张图,也可能省略一个小型数据库标签,或者一排重复卡片中的某一项。提供 OCR 文本与坐标后,每段可读文字都必须被解释为节点、边标签、标题或注释。

OCR 不应该决定拓扑;它的作用是约束覆盖率。

结论二:更多推理有时反而更差

我们原以为密集图上的 medium 推理会优于 low,结果不是。带 OCR grounding 的 low 配置,是测试识别矩阵中唯一零遗漏的方案。提高推理强度有时给了模型更多"重组和总结"的自由,而不是忠实抄录图像结构。

这是结构化视觉任务的重要特征:需要的不是最优雅的解释,而是与像素一致、最不意外的对象清单。提示词应该奖励覆盖率、稳定 ID 和坐标忠实度,而不是抽象能力。

结论三:拓扑质量打平,成本相差 20 倍

五种拓扑观察配置的质量几乎打平。具有代表性的精确率/召回率约为 0.95~0.97 / 0.97~0.98。

但实验时单次成本差异明显:

  • Gemini 3.6 Flash:约 $0.0147;
  • Gemini 3.1 Flash-Lite:约 $0.0028;
  • Luna observer:约 $0.0007。

如果质量差异落在噪声范围,架构就应选择便宜观察器,并保留另一家供应商作为故障回退。模型名气不是性能指标。

结论四:拓扑裁决模型几乎没有增加价值

我们让第二个模型裁决观察器产生的每条候选线路。所有观察器在裁决前后的精确率变化都不超过约 0.02,有时还会下降,因为观察器自身的幻觉率已经很低。

从提议架构中删除裁决器,可以省掉一次模型调用和大约 8~10 秒,实验中没有测到质量损失。

不要因为"再验证一次听起来更安全"就加入 LLM 验证器。必须测量它是否真的改变错误分布;只会同意第一个模型的验证器,本质上只是延迟。

结论五:廉价 CV 预检可以安全跳过昂贵阶段

线路检测预检在 12 张图中判断正确 11 张,更重要的是危险方向零错误:凡是预测"没有连接线"的图,确实都没有连接线。

误判"有线"只会失去一次提速机会;误判"无线"却会跳过必要拓扑处理并破坏结果。安全的提前退出应按两个错误方向的代价设计,而不能只看总准确率。

结论六:某些拓扑错误来自源像素

两张生成测试图的标准答案描述的是扇出结构,但肘形线路实际穿过了相邻节点,像素上看起来是链式连接。所有观察器都一致读成链式。模型没有错,测试图错了。

把线路改到清晰走廊后,模型结果与目标拓扑一致。这揭示了产品事实:图的逻辑意图和实际绘制可能矛盾。连接线穿过节点边框,或者多线共用狭窄通道时,人也可能判断错端点。

重建系统应该把这种源图歧义暴露给人工复核,而不是藏在一个置信度分数后面。

实验建议的新架构

  • OCR 与快速识别器并行执行;
  • 仅在密集或低质量案例启用带 OCR 的高召回 hedge;
  • 拓扑前先执行廉价 CV 预检;
  • 使用一个低成本拓扑观察器,并准备跨供应商回退;
  • 删除独立拓扑裁决器;
  • 让分割和拓扑阶段重叠执行;
  • 文件生成由确定性代码完成,并验证包结构。

实验报告中的预计变化是:典型路径从约 47 秒降至约 30 秒,单次模型成本从约 0.03 降至 0.015。这是实验得出的架构估算,不是对所有生产图片的保证。

局限与下一步

12 张图仍是小数据集,并且为了获得精确标准答案,生成图占比偏高。它足够支持本产品的流水线决策,但不能当作通用视觉模型排行榜。

下一步需要增加真实、多语言、低质量截图;按文字密度、交叉线和图标数量分层评分;在 Visio、PowerPoint、LibreOffice 与 draw.io 中做文件级测试;把人工修正时间也作为指标;并将模糊失败样本持续补入基准集。

更大的结论

可编辑图表重建不是"OCR 加 SVG 描摹",而是同时处理三类事实的结构化感知问题:

  • 语义事实:图里有哪些对象;
  • 几何事实:对象在哪里;
  • 拓扑事实:对象怎样连接。

测试中最好的方向并不是让一个昂贵模型解决全部问题,而是用 OCR 约束覆盖率、把拓扑专门处理、删除无价值裁决器,再用确定性代码生成文件。

这套架构服务于一个实际产品问题:把图表截图变成可编辑的 VSDX、PPTX、draw.io 和 SVG。漂亮预览并不难;难的是下一次编辑时,文字、图形和连接线仍然保持结构。

相关推荐
小小张说故事15 小时前
LightGBM 入门指南:更快的梯度提升树,Python 实战
后端·python·机器学习
拉你进_教堂15 小时前
小龙虾技能之【Intelligent Public Smoking Detection Skill | 公共场所吸烟行为智能检测技能】简介
人工智能·计算机视觉·多模态大模型·openclaw小龙虾技能
Omics Pro16 小时前
Cell封面|衰老生物学开源AI工具包
数据库·人工智能·算法·机器学习·自然语言处理
SJZR18 小时前
图解归一化
人工智能·机器学习
计算机源码社18 小时前
【27届大数据毕设】基于机器学习与数据挖掘的电影评分预测与可视化大屏 基于Spark内存计算的电影译名流向与主题词云可视化分析
大数据·hadoop·机器学习·数据挖掘·spark·毕业设计·课程设计
昨日之日20061 天前
【MiniMax H3】TaoMate-H3:3步LoRA让视频生成更快更高效,速度快10倍
人工智能·计算机视觉·音视频
小小张说故事1 天前
Seaborn 入门指南:让统计数据可视化更优雅
python·机器学习
小小张说故事1 天前
Transformers 入门指南:用 Python 调用预训练大模型
python·机器学习
小小张说故事1 天前
FastAPI 入门指南:用 Python 极速构建 API
python·机器学习
小小张说故事1 天前
pytest 入门指南:Python 自动化测试的标配工具
python·机器学习