Chart-to-text
收藏arXiv2025-09-30 收录
数据链接:
官方服务:
资源简介:
该数据集名为Chart-to-Text,是一个以图表图像为输入、文本摘要为目标的数据集。它包含两个子集:Pew和Statista。其中,Pew的摘要是由自动提取生成的,而Statista的摘要则是由人类编写的。该任务的名称是Chart-To-Text图表文本摘要。
This dataset is named Chart-to-Text, which is a dataset for chart text summarization that takes chart images as input and text summaries as the target output. It consists of two subsets: Pew and Statista. The summaries for the Pew subset are generated through automatic extraction, while the summaries for the Statista subset are written by human experts. The corresponding task is named Chart-To-Text Chart Text Summarization.
搜集汇总
数据集介绍

构建方式
Chart-to-text数据集的构建依托于两个权威数据源:Statista与Pew Research。Statista部分通过爬取34,810个公开网页,获取图表图像、数据表格、标题、轴标签及人工撰写的描述,并依据数据表格列数将图表划分为简单与复杂两类。Pew Research部分则更具挑战性,由于多数图表缺乏底层数据表格,研究团队采用OCR技术提取图表文本,训练梯度提升分类器识别标题、轴标签、图例与数据标签,并设计启发式算法结合人工标注,从邻近段落中筛选出与图表高度相关的摘要文本。最终,两个数据集合计包含44,096张图表,覆盖条形图、折线图、饼图等多种类型,主题涵盖经济、社会、健康等广泛领域。
特点
该数据集的核心特点在于其规模庞大、类型多样且任务定义清晰。44,096张图表来自不同源,视觉风格与主题分布各异,Statista数据集中于经济与市场话题,Pew则偏重美国政治与社会议题。数据集支持两种任务变体:一种假设底层数据表格可用,另一种则模拟更真实的场景,仅提供图表图像。摘要文本语义层次丰富,Statista摘要多包含统计比较信息,而Pew摘要则更多涉及趋势、因果关系等需要认知推理的内容。此外,数据集还提供了基于OCR的文本提取与自动表格生成基线,为模型评估设立了多维度的挑战。
使用方法
使用Chart-to-text数据集时,研究者可根据任务变体选择输入形式。若数据表格可用,可将表格行序化后与图表元数据(标题、类型、轴标签)拼接,输入至BART或T5等预训练序列到序列模型进行微调。若仅有图表图像,则需先利用OCR技术提取文本,并可选地嵌入边界框坐标以提供空间信息,再输入模型生成摘要。评估时,可采用BLEU、CIDEr、BLEURT等自动指标,并结合人工评价关注事实正确性、连贯性与流畅性。数据集已公开划分训练、验证与测试集,便于复现与比较。
背景与挑战
背景概述
图表作为数据探索与信息传达的重要媒介,在日常生活与专业领域中扮演着不可或缺的角色。然而,从图表中提炼关键洞见往往需要大量的认知与感知努力,这促使了自动图表摘要任务的诞生。Chart-to-text数据集由来自约克大学、南洋理工大学及Salesforce Research Asia的研究人员于2022年构建,旨在解决这一领域缺乏大规模基准的困境。该数据集整合了来自Statista与Pew Research两大来源的44,096个图表,涵盖了柱状图、折线图、饼图等多种类型及广泛主题。其核心研究问题在于如何从图表中生成准确、连贯的自然语言摘要,从而辅助用户快速理解数据趋势、异常值及比较关系。这一数据集的发布为自然语言处理与计算机视觉的交叉研究提供了重要支撑,推动了图表理解与自动摘要技术的进步。
当前挑战
Chart-to-text数据集所面临的挑战主要体现于三个层面。首先,从领域问题角度看,图表摘要任务要求模型不仅能够识别视觉元素(如条柱、折线),还需理解其中蕴含的复杂模式与趋势,如相关性、异常点及因果推理,这远超传统图像描述或表格转文本任务的能力范畴。其次,在构建过程中,数据收集与标注面临显著困难:Pew数据集缺乏底层数据表,需依赖OCR技术提取文本并训练分类器识别标题、轴标签等角色,同时通过启发式算法与人工标注筛选相关段落,过程繁复且易引入噪声。此外,模型生成的摘要常出现幻觉现象(输出与图表无关的内容)及事实错误,尤其在缺乏数据表的情况下更为严重,这凸显了当前模型在视觉与语言信息融合、数值推理及泛化能力上的局限性。
常用场景
经典使用场景
在数据可视化与自然语言处理交叉领域,Chart-to-text数据集被广泛用于图表摘要生成任务。该数据集包含44,096张涵盖柱状图、折线图、饼图等多种类型的图表,覆盖政治、经济、健康等多元主题。研究者利用该数据集训练模型,将图表中的视觉信息(如趋势、极值、异常点)转化为流畅的自然语言描述,从而降低用户从复杂图表中提取关键洞察的认知负荷。其经典使用场景包括:从图表图像或底层数据表自动生成摘要,为信息检索、辅助报告撰写提供支持。
实际应用
在实际应用中,Chart-to-text数据集赋能了多个关键场景:为视障人士提供图表内容的语音解读,增强信息无障碍访问;辅助新闻编辑或数据分析师自动撰写数据报道中的图表说明,提升工作效率;支持教育领域中学生对图表含义的自动理解与解释;还可用于优化包含图表的文档索引与检索系统,提升信息获取的精准度。这些应用显著降低了人类从视觉数据中提取信息的门槛,推动了数据素养的普及。
衍生相关工作
该数据集衍生了一系列具有影响力的后续工作:研究者基于其基线模型(如TAB-T5、OCR-T5)进一步探索了图表语义图表示与逻辑推理增强的摘要生成方法;针对幻觉问题,涌现了结合外部知识库或数据表约束的解码策略;在跨领域泛化方面,衍生了从Statista到Pew的迁移学习实验,验证了预训练在多源图表摘要中的有效性。此外,Chart-to-text还启发了图表数据自动提取(如ChartOCR扩展)与用户交互式摘要生成等新兴研究方向。
以上内容由遇见数据集搜集并总结生成



