声明 :本文是对论文 ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning 的中文解读,仅供学习交流使用。版权归原作者所有,翻译如有疏漏以原文为准。
原文链接 :2512.00305 ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
收录会议:ICCV 2025
一、论文信息
| 项目 | 内容 |
|---|---|
| 中文标题 | ChartPoint:用定位反射指导多模态大语言模型进行图表推理 |
| 英文标题 | ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning |
| 作者 | Zhengzhuo Xu, SiNan Du, Yiyan Qi, Siwen Lu, Chengjin Xu, Chun Yuan, Jian Guo |
| 机构 | 清华大学、国际数字经济学院、北京航空航天大学、香港科技大学(广州) |
| arXiv | arXiv:2512.00305 |
| 会议 | ICCV 2025 |
二、一句话概括
以前的模型是"闭着眼"根据 OCR 文字猜数字;这篇论文让模型"睁着眼"指着图表上的位置算数字,并且画完框后还要再看一眼再继续算。
三、背景痛点
多模态大语言模型在处理图表时严重依赖 OCR 提取的文字。当图表上的柱子、折线没有直接标注具体数值时,模型就开始产生数值幻觉------给出看似合理但实际错误的数字。
现有方法(增加指令数据、提高分辨率、改进对齐训练)都治标不治本。根本原因在于:模型的推理过程与视觉感知是脱节的------它虽然在"想",但并没有真正在"看"。
作者做了一个关键实验:让模型在推理时同时输出每一步对应的图表位置(用边界框表示)。结果,模型要么忽略这个要求,要么乱指一通。这说明:思维链只是增加了推理长度,但并未让模型真正与视觉编码器形成有效互动。
四、创新点:PointCoT
用一句话说清楚创新点:在思维链的每一步中,强制模型输出边界框(BBox)并重渲染图表形成视觉反馈。
4.1 方法概述
【原文翻译】
研究者通过在 CoT 中加入反射式交互过程来增强它,让模型输出边界框并与重渲染的图表互动,称为 PointCoT。该方法通过结构化的推理过程增强模型的推理链,并引入了一条自动化标注流水线。
流水线包含四个阶段:
-
步骤分解:用 LLM 根据绘图代码生成问答对和推理步骤,将每步标记为 Grounding(定位)或 Reasoning(推理)
-
代码编辑 :修改原始代码,在 Grounding 步骤对应位置插入特殊符号(如
@) -
代码渲染 :执行修改后的代码,生成带
@符号的新图表 -
位置定位 :用 OCR 识别
@符号位置,自动获得边界框坐标
【解读】
这不是简单的"改提示词"------而是在训练环节把"画框"能力植入模型。
-
训练环节(核心):构建包含 6.2 万条"带边界框标准答案"的数据集,通过监督微调把"看图→定位→推理"的能力写入模型权重
-
推理环节(辅助):测试时用专门的提示词要求模型输出边界框。但图 6 显示,不经过微调的 GPT-4o 和原版 Qwen2.5-VL 根本不理睬这个要求;只有经过微调的 ChartPoint 才会乖乖听话
自动化标注流水线的巧妙之处 :不需要人工标注位置,而是利用生成图表的"源代码"------在代码里埋个 @,渲染后用 OCR 反向提取坐标,位置就是标准答案。
五、核心数学公式
5.1 坐标归一化(表 7)
论文比较了三种 BBox 坐标表示法:
-
类型 A:归一化到 0,1,保留 4 位小数 → 提升 0.52%
-
类型 B:归一化到 0,1,保留 3 位小数 → 提升 1.26%
-
类型 C(最优):0--999 整数 → 提升 1.68%

原因:Qwen 的令牌化器将小数按三位分段(如 "0.1234" → "0" 、 "." 、 "123" 、 "4"),增加训练难度。0--999 整数与基座预训练坐标格式一致,效果最佳。
5.2 边界框表示

5.3 宽松准确率
设预测值为 p,真实值为 g:

其中 ττ 取 0.05、0.10、0.20。允许数值估计的微小偏差(例如视觉上估计柱高为 3.1 而真实值为 3.0 也算对),适合评估视觉估计任务。
六、实验结论
6.1 主实验结果
| 基准 | 基座模型 | ChartPoint | 提升 |
|---|---|---|---|
| ChartQA(含文字标注) | Qwen2-VL 83.16% | 85.28% | +2.12% |
| ChartQA | Qwen2.5-VL 86.36% | 87.74% | +1.38% |
| ChartBench(无文字标注) | Qwen2-VL 58.90% | 62.61% | +3.71% |
| ChartBench | Qwen2.5-VL 60.91% | 65.95% | +5.04% |
解读:ChartBench 无数据点标注,更考验视觉估计能力,因此 PointCoT 的优势被充分放大。在额外类型图表上提升高达 7.77%,说明学到的不是过拟合,而是泛化的定位-推理能力。
6.2 消融实验
| 训练设置 | ChartBench 提升 |
|---|---|
| 仅第一阶段对齐 | +0.58% |
| + 纯文本 CoT | +0.76% |
| + PointCoT | +3.71% |
解读 :纯文本 CoT 几乎没用,关键变量是定位监督 ------边界框的引入。图表理解瓶颈是视觉定位能力,而非推理能力。
6.3 基座模型依赖
-
定位能力弱的模型(Qwen-VL v1、ChartMoE)上 PointCoT 提升 < 0.5%
-
定位能力强的模型(Qwen2-VL、Qwen2.5-VL)上提升 > 1%
结论:PointCoT 是"锦上添花",需要基座模型本身具备定位能力。
6.4 案例可视化(图 6)
对比 GPT-4o、Qwen2.5-VL-72B 和 ChartPointQ2.5,要求同时输出推理和边界框。只有 ChartPoint 按要求输出边界框,提取的数值更精确。
结论:"推理时定位"不是大模型的天然能力,需要专门训练。
七、总结
核心贡献
| 维度 | 内容 |
|---|---|
| 方法创新 | 将视觉定位从辅助能力提升为推理过程的核心组成部分 |
| 工程创新 | 利用"代码-图像"配对实现自动化边界框标注,无需人工 |
| 性能提升 | ChartBench 上 +5.04%,尤其擅长无文字标注图表 |
| 可解释性 | 模型输出边界框作为推理证据,用户可验证其关注区域 |
局限性
-
依赖基座模型固有定位能力(需 Qwen2-VL 及以上)
-
坐标表示格式需与基座令牌化器适配
启示
-
推理必须可验证:用户应能看到模型依据的视觉区域
-
自动化数据构建范式可推广到其他有"代码-渲染"配对的领域
-
思路可迁移:文档理解、场景理解等需要精确定位的任务