遇见数据集

1fanj/Chartographer

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Chartographer是一个图表推理数据集,用于评估视觉语言模型是否通过视觉推理而非捷径或对图表的先验熟悉度来回答图表问题。每个图表问题家族包含一个上游原始图表、一个重建图表以及十个具有相同Chartographer `chart_id`和`question_id`的种子控制反事实变体。数据集支持视觉问答和问答任务,适用于图表、视觉语言、图表问答和合成数据相关研究,数据规模在1K到10K之间,语言为英语,来源数据集包括ChartMuseum、ChartQA和CharXiv。

Chartographer is a chart reasoning dataset developed to evaluate whether vision-language models (VLMs) answer chart-related questions through visual reasoning rather than relying on shortcuts or prior familiarity with charts. Each chart question family consists of one upstream original chart, one reconstructed chart, and ten seed-controlled counterfactual variants that share identical Chartographer `chart_id` and `question_id` values. This dataset supports both visual question answering (VQA) and general question answering tasks, and is applicable to research in the fields of charts, vision-language models, chart question answering, and synthetic data. With a scale ranging from 1K to 10K, all texts in this dataset are in English, and its source datasets include ChartMuseum, ChartQA, and CharXiv.

提供机构:
1fanj
搜集汇总
数据集介绍
1fanj/Chartographer 数据集图片
构建方式
Chartographer数据集专为评估视觉-语言模型在图表问答中的视觉推理能力而构建,旨在识别模型是否依赖捷径或对图表的先验知识而非真实视觉理解。其构建流程始于从ChartMuseum、ChartQA和CharXiv三个上游数据集中选取原始图表,进而生成重构图表及十个种子控制的反事实变体。每个图表-问题家族共享唯一的chart_id和question_id,确保变体间的一致性。原始图像不包含在发布中,用户需通过source_row_index追溯上游来源。
特点
该数据集的核心特点在于其反事实变体的设计,每个图表-问题家族包含原始、重构及十个受控变体,允许对模型在不同视觉条件下的推理一致性进行系统性比较。变体通过种子控制生成,确保变化受控且可重复。数据集涵盖多样化的图表类型和问题,强调视觉-语言模型的鲁棒性评估。此外,已评估的question和answer字段独立于上游数据,避免了原始标注偏差。
使用方法
Chartographer主要用于图表视觉问答的评估,尤其适合对比模型在原始、重构及反事实变体上的表现。用户可通过HuggingFace Datasets库加载JSON文件,支持chartmuseum_dev、chartqa_val和charxiv_validation三个分片。每个样本包含chart_id、question_id、variant、image、question、answer、chart_data等字段。评估时,建议比较同一chart_id和question_id下不同variant的答案,以分析模型推理的视觉依赖性。详细协议见配套论文。
背景与挑战
背景概述
Chartographer数据集由Yifan Jiang、Dae Yon Hwang、Jesse C. Cresswell和Freda Shi等研究人员于2026年创建,旨在评估视觉-语言模型在图表问答任务中是否真正依赖视觉推理而非捷径或先验知识。该数据集通过构建原始图表、重构图表及其十种受控反事实变体,形成图表-问题家族,为模型推理能力提供了严苛的测试基准。Chartographer整合了ChartMuseum、ChartQA和CharXiv等多个源数据集,其发布填补了图表推理领域缺乏反事实评估标准的空白,对于推动视觉-语言模型在图表理解任务中的可解释性与鲁棒性研究具有重要影响力。
当前挑战
Chartographer所解决的领域核心挑战在于现有视觉-语言模型常利用图表中的统计捷径或记忆性先验知识来回答问题,而非进行真正的视觉推理,导致模型泛化能力被高估。在数据集构建过程中,面临的挑战包括:如何生成语义一致且视觉可控的反事实图表变体以消除混淆因素;如何确保重构图表与原始图表在视觉特征上保持平衡,避免引入新的偏差;以及如何从多个异构源数据集中提取并标准化图表与问答数据,保证数据质量和跨数据集的兼容性。这些挑战的克服对于构建可靠的图表推理评估基准至关重要。
常用场景
经典使用场景
Chartographer数据集专为评估视觉-语言模型在图表问答任务中的视觉推理能力而设计。其核心使用场景在于通过构建原始图表、重构图表以及十种受控反事实变体,系统性地检验模型是否真正基于图表视觉信息进行推理,而非依赖捷径或先验知识。研究者可基于相同的chart_id和question_id,比较模型在不同变体上的表现差异,从而精准识别模型在图表理解中的脆弱性。该数据集尤其适用于探究模型在面对数据分布偏移、视觉干扰或语义冲突时,其问答能力是否具有鲁棒性。
实际应用
在实际应用中,Chartographer可作为自动化图表问答系统的质量评估工具,帮助开发者诊断模型是否具备可靠的视觉推理能力,而非仅记忆训练数据中的模式。例如,在金融数据分析、科学报告解读、教育评估等场景中,系统需要处理各类真实图表,而Chartographer的反事实变体能模拟用户可能提出的包含数据偏差或视觉扰动的挑战性问题。通过在该数据集上验证,可筛选出真正具备图表理解能力的模型,确保其在部署时能抵御数据分布变化带来的性能下降,从而提升AI系统在专业领域的可信度与安全性。
衍生相关工作
Chartographer数据集催生了多个方向的后续研究:基于其反事实评估框架,研究者拓展了面向更复杂图表类型(如三维图、动态图)的推理测试集;受其启发,出现了专门设计用于增强模型反事实鲁棒性的训练方法,通过联合优化原始与扰动图表对比学习,提升视觉语言模型对数据细节的敏感性。此外,Chartographer的受控变体生成管线被迁移至其他视觉推理任务,如地图理解、科学示意图解析,推动了跨模态评估方法论的发展。其配套的反事实分析工具也被用于诊断多模态大模型在长尾分布下的失败案例,成为视觉-语言可解释性研究的重要基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务