ChartPoint:用定位反射指导多模态大语言模型进行图表推理(翻译与解读)

声明 :本文是对论文 ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning 的中文解读,仅供学习交流使用。版权归原作者所有,翻译如有疏漏以原文为准。

原文链接2512.00305 ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

收录会议:ICCV 2025


一、论文信息

项目 内容
中文标题 ChartPoint:用定位反射指导多模态大语言模型进行图表推理
英文标题 ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
作者 Zhengzhuo Xu, SiNan Du, Yiyan Qi, Siwen Lu, Chengjin Xu, Chun Yuan, Jian Guo
机构 清华大学、国际数字经济学院、北京航空航天大学、香港科技大学(广州)
arXiv arXiv:2512.00305
会议 ICCV 2025

二、一句话概括

以前的模型是"闭着眼"根据 OCR 文字猜数字;这篇论文让模型"睁着眼"指着图表上的位置算数字,并且画完框后还要再看一眼再继续算。

三、背景痛点

多模态大语言模型在处理图表时严重依赖 OCR 提取的文字。当图表上的柱子、折线没有直接标注具体数值时,模型就开始产生数值幻觉------给出看似合理但实际错误的数字。

现有方法(增加指令数据、提高分辨率、改进对齐训练)都治标不治本。根本原因在于:模型的推理过程与视觉感知是脱节的------它虽然在"想",但并没有真正在"看"。

作者做了一个关键实验:让模型在推理时同时输出每一步对应的图表位置(用边界框表示)。结果,模型要么忽略这个要求,要么乱指一通。这说明:思维链只是增加了推理长度,但并未让模型真正与视觉编码器形成有效互动。

四、创新点:PointCoT

用一句话说清楚创新点:在思维链的每一步中,强制模型输出边界框(BBox)并重渲染图表形成视觉反馈。

4.1 方法概述

【原文翻译】

研究者通过在 CoT 中加入反射式交互过程来增强它,让模型输出边界框并与重渲染的图表互动,称为 PointCoT。该方法通过结构化的推理过程增强模型的推理链,并引入了一条自动化标注流水线。

流水线包含四个阶段:

  1. 步骤分解:用 LLM 根据绘图代码生成问答对和推理步骤,将每步标记为 Grounding(定位)或 Reasoning(推理)

  2. 代码编辑 :修改原始代码,在 Grounding 步骤对应位置插入特殊符号(如 @

  3. 代码渲染 :执行修改后的代码,生成带 @ 符号的新图表

  4. 位置定位 :用 OCR 识别 @ 符号位置,自动获得边界框坐标

【解读】

这不是简单的"改提示词"------而是在训练环节把"画框"能力植入模型。

  1. 训练环节(核心):构建包含 6.2 万条"带边界框标准答案"的数据集,通过监督微调把"看图→定位→推理"的能力写入模型权重

  2. 推理环节(辅助):测试时用专门的提示词要求模型输出边界框。但图 6 显示,不经过微调的 GPT-4o 和原版 Qwen2.5-VL 根本不理睬这个要求;只有经过微调的 ChartPoint 才会乖乖听话

自动化标注流水线的巧妙之处 :不需要人工标注位置,而是利用生成图表的"源代码"------在代码里埋个 @,渲染后用 OCR 反向提取坐标,位置就是标准答案。

五、核心数学公式

5.1 坐标归一化(表 7)

论文比较了三种 BBox 坐标表示法:

  • 类型 A:归一化到 0,1,保留 4 位小数 → 提升 0.52%

  • 类型 B:归一化到 0,1,保留 3 位小数 → 提升 1.26%

  • 类型 C(最优):0--999 整数 → 提升 1.68%

原因:Qwen 的令牌化器将小数按三位分段(如 "0.1234" → "0" 、 "." 、 "123" 、 "4"),增加训练难度。0--999 整数与基座预训练坐标格式一致,效果最佳。

5.2 边界框表示

5.3 宽松准确率

设预测值为 p,真实值为 g:

其中 ττ 取 0.05、0.10、0.20。允许数值估计的微小偏差(例如视觉上估计柱高为 3.1 而真实值为 3.0 也算对),适合评估视觉估计任务。

六、实验结论

6.1 主实验结果

基准 基座模型 ChartPoint 提升
ChartQA(含文字标注) Qwen2-VL 83.16% 85.28% +2.12%
ChartQA Qwen2.5-VL 86.36% 87.74% +1.38%
ChartBench(无文字标注) Qwen2-VL 58.90% 62.61% +3.71%
ChartBench Qwen2.5-VL 60.91% 65.95% +5.04%

解读:ChartBench 无数据点标注,更考验视觉估计能力,因此 PointCoT 的优势被充分放大。在额外类型图表上提升高达 7.77%,说明学到的不是过拟合,而是泛化的定位-推理能力。

6.2 消融实验

训练设置 ChartBench 提升
仅第一阶段对齐 +0.58%
+ 纯文本 CoT +0.76%
+ PointCoT +3.71%

解读 :纯文本 CoT 几乎没用,关键变量是定位监督 ------边界框的引入。图表理解瓶颈是视觉定位能力,而非推理能力。

6.3 基座模型依赖

  • 定位能力弱的模型(Qwen-VL v1、ChartMoE)上 PointCoT 提升 < 0.5%

  • 定位能力强的模型(Qwen2-VL、Qwen2.5-VL)上提升 > 1%

结论:PointCoT 是"锦上添花",需要基座模型本身具备定位能力。

6.4 案例可视化(图 6)

对比 GPT-4o、Qwen2.5-VL-72B 和 ChartPointQ2.5,要求同时输出推理和边界框。只有 ChartPoint 按要求输出边界框,提取的数值更精确。

结论:"推理时定位"不是大模型的天然能力,需要专门训练。

七、总结

核心贡献

维度 内容
方法创新 将视觉定位从辅助能力提升为推理过程的核心组成部分
工程创新 利用"代码-图像"配对实现自动化边界框标注,无需人工
性能提升 ChartBench 上 +5.04%,尤其擅长无文字标注图表
可解释性 模型输出边界框作为推理证据,用户可验证其关注区域

局限性

  1. 依赖基座模型固有定位能力(需 Qwen2-VL 及以上)

  2. 坐标表示格式需与基座令牌化器适配

启示

  • 推理必须可验证:用户应能看到模型依据的视觉区域

  • 自动化数据构建范式可推广到其他有"代码-渲染"配对的领域

  • 思路可迁移:文档理解、场景理解等需要精确定位的任务

相关推荐
大模型任我行2 小时前
谷歌:“课程学习”融入扩散模型强化学习
人工智能·语言模型·自然语言处理·论文笔记
AIGCmagic社区2 小时前
具身智能专题:机器人也有Scaling Law?智元GE-Act 2.0用3万小时真机数据给出答案
人工智能·aigc·具身智能
Rosanci3 小时前
谷歌浏览器插件开发实战指南:从 Hello World 到上架发布
大数据·人工智能·chrome·程序人生
明月_清风3 小时前
AI 越来越强,程序员真正的价值到底是什么?
人工智能·后端
m0_466525293 小时前
云从科技上线云起ModelHub:AI团队时代的模型算力基础设施
大数据·人工智能·科技
火山引擎开发者社区4 小时前
OpenViking:给 Codex 加上长期记忆
人工智能
荆棘鸟智能4 小时前
城市感知设备怎么统一接入?从多协议网关到设备模型的中间件架构设计
人工智能·算法·边缘计算
火山引擎开发者社区4 小时前
当 AI 内容真假难辨,谁来为真实签名 —— 证书中心 C2PA 内容可信溯源服务正式发布
人工智能
百万蹄蹄向前冲4 小时前
风扇转了一晚上MVP专家团翻车事故
前端·人工智能
米小虾4 小时前
你的 harness 技巧有保质期:176 组对照实验显示,上下文管理的收益从 35.7 分跌到 2.7 分
人工智能·agent