ChartPoint:用定位反射指导多模态大语言模型进行图表推理(翻译与解读)

声明 :本文是对论文 ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning 的中文解读,仅供学习交流使用。版权归原作者所有,翻译如有疏漏以原文为准。

原文链接2512.00305 ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

收录会议:ICCV 2025


一、论文信息

项目 内容
中文标题 ChartPoint:用定位反射指导多模态大语言模型进行图表推理
英文标题 ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
作者 Zhengzhuo Xu, SiNan Du, Yiyan Qi, Siwen Lu, Chengjin Xu, Chun Yuan, Jian Guo
机构 清华大学、国际数字经济学院、北京航空航天大学、香港科技大学(广州)
arXiv arXiv:2512.00305
会议 ICCV 2025

二、一句话概括

以前的模型是"闭着眼"根据 OCR 文字猜数字;这篇论文让模型"睁着眼"指着图表上的位置算数字,并且画完框后还要再看一眼再继续算。

三、背景痛点

多模态大语言模型在处理图表时严重依赖 OCR 提取的文字。当图表上的柱子、折线没有直接标注具体数值时,模型就开始产生数值幻觉------给出看似合理但实际错误的数字。

现有方法(增加指令数据、提高分辨率、改进对齐训练)都治标不治本。根本原因在于:模型的推理过程与视觉感知是脱节的------它虽然在"想",但并没有真正在"看"。

作者做了一个关键实验:让模型在推理时同时输出每一步对应的图表位置(用边界框表示)。结果,模型要么忽略这个要求,要么乱指一通。这说明:思维链只是增加了推理长度,但并未让模型真正与视觉编码器形成有效互动。

四、创新点:PointCoT

用一句话说清楚创新点:在思维链的每一步中,强制模型输出边界框(BBox)并重渲染图表形成视觉反馈。

4.1 方法概述

【原文翻译】

研究者通过在 CoT 中加入反射式交互过程来增强它,让模型输出边界框并与重渲染的图表互动,称为 PointCoT。该方法通过结构化的推理过程增强模型的推理链,并引入了一条自动化标注流水线。

流水线包含四个阶段:

  1. 步骤分解:用 LLM 根据绘图代码生成问答对和推理步骤,将每步标记为 Grounding(定位)或 Reasoning(推理)

  2. 代码编辑 :修改原始代码,在 Grounding 步骤对应位置插入特殊符号(如 @

  3. 代码渲染 :执行修改后的代码,生成带 @ 符号的新图表

  4. 位置定位 :用 OCR 识别 @ 符号位置,自动获得边界框坐标

【解读】

这不是简单的"改提示词"------而是在训练环节把"画框"能力植入模型。

  1. 训练环节(核心):构建包含 6.2 万条"带边界框标准答案"的数据集,通过监督微调把"看图→定位→推理"的能力写入模型权重

  2. 推理环节(辅助):测试时用专门的提示词要求模型输出边界框。但图 6 显示,不经过微调的 GPT-4o 和原版 Qwen2.5-VL 根本不理睬这个要求;只有经过微调的 ChartPoint 才会乖乖听话

自动化标注流水线的巧妙之处 :不需要人工标注位置,而是利用生成图表的"源代码"------在代码里埋个 @,渲染后用 OCR 反向提取坐标,位置就是标准答案。

五、核心数学公式

5.1 坐标归一化(表 7)

论文比较了三种 BBox 坐标表示法:

  • 类型 A:归一化到 0,1,保留 4 位小数 → 提升 0.52%

  • 类型 B:归一化到 0,1,保留 3 位小数 → 提升 1.26%

  • 类型 C(最优):0--999 整数 → 提升 1.68%

原因:Qwen 的令牌化器将小数按三位分段(如 "0.1234" → "0" 、 "." 、 "123" 、 "4"),增加训练难度。0--999 整数与基座预训练坐标格式一致,效果最佳。

5.2 边界框表示

5.3 宽松准确率

设预测值为 p,真实值为 g:

其中 ττ 取 0.05、0.10、0.20。允许数值估计的微小偏差(例如视觉上估计柱高为 3.1 而真实值为 3.0 也算对),适合评估视觉估计任务。

六、实验结论

6.1 主实验结果

基准 基座模型 ChartPoint 提升
ChartQA(含文字标注) Qwen2-VL 83.16% 85.28% +2.12%
ChartQA Qwen2.5-VL 86.36% 87.74% +1.38%
ChartBench(无文字标注) Qwen2-VL 58.90% 62.61% +3.71%
ChartBench Qwen2.5-VL 60.91% 65.95% +5.04%

解读:ChartBench 无数据点标注,更考验视觉估计能力,因此 PointCoT 的优势被充分放大。在额外类型图表上提升高达 7.77%,说明学到的不是过拟合,而是泛化的定位-推理能力。

6.2 消融实验

训练设置 ChartBench 提升
仅第一阶段对齐 +0.58%
+ 纯文本 CoT +0.76%
+ PointCoT +3.71%

解读 :纯文本 CoT 几乎没用,关键变量是定位监督 ------边界框的引入。图表理解瓶颈是视觉定位能力,而非推理能力。

6.3 基座模型依赖

  • 定位能力弱的模型(Qwen-VL v1、ChartMoE)上 PointCoT 提升 < 0.5%

  • 定位能力强的模型(Qwen2-VL、Qwen2.5-VL)上提升 > 1%

结论:PointCoT 是"锦上添花",需要基座模型本身具备定位能力。

6.4 案例可视化(图 6)

对比 GPT-4o、Qwen2.5-VL-72B 和 ChartPointQ2.5,要求同时输出推理和边界框。只有 ChartPoint 按要求输出边界框,提取的数值更精确。

结论:"推理时定位"不是大模型的天然能力,需要专门训练。

七、总结

核心贡献

维度 内容
方法创新 将视觉定位从辅助能力提升为推理过程的核心组成部分
工程创新 利用"代码-图像"配对实现自动化边界框标注,无需人工
性能提升 ChartBench 上 +5.04%,尤其擅长无文字标注图表
可解释性 模型输出边界框作为推理证据,用户可验证其关注区域

局限性

  1. 依赖基座模型固有定位能力(需 Qwen2-VL 及以上)

  2. 坐标表示格式需与基座令牌化器适配

启示

  • 推理必须可验证:用户应能看到模型依据的视觉区域

  • 自动化数据构建范式可推广到其他有"代码-渲染"配对的领域

  • 思路可迁移:文档理解、场景理解等需要精确定位的任务

相关推荐
美摄科技1 小时前
视频一键成片SDK Skill:AI智能分析与语义理解
人工智能
fthux2 小时前
装闭 RenoPit 源码解析(05):FastAPI与Celery如何执行AI装修分析
人工智能·ai·开源·github·open source·renopit
格数致用2 小时前
数据库设计与表结构详解|信息化项目全流程管理系统源码逐行精讲(五)
人工智能·政务·数据库设计·外键约束
罗西的思考3 小时前
【OpenClaw具身硬件】MiniClaw 阅读笔记---(1)基础
人工智能·算法·机器学习
DevUI团队3 小时前
从“即兴创作”到“规格先行”,华为云码道(CodeArts)代码智能体持续深耕企业级规范驱动开发能力
前端·人工智能·后端
论文避坑指南3 小时前
论文写作全流程AI合规边界:从选题到投稿的“红绿灯“清单
大数据·人工智能·深度学习
Dawson Zhu3 小时前
工业世界模型——基于AI Agent+数学仿真架构
人工智能·架构·agi
冬奇Lab3 小时前
开源项目第183期:Ontology Playground — 微软出品的本体论可视化学习工具,零后端、浏览器直接运行
人工智能·microsoft·开源
Wang's Blog3 小时前
AI Agent白手起家52: 从零搭建钉钉智能助手——资源准备与核心架构实现
人工智能·架构·钉钉
冬奇Lab3 小时前
代码库知识库系列(13):评测——怎么知道知识库够不够好
人工智能