遇见数据集

TeeA/ChartQA

收藏
Hugging Face2024-05-29 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: - config_name: default features: - name: id_image dtype: string - name: image dtype: image - name: table dtype: string - name: chart_type dtype: string - name: qa list: - name: label dtype: string - name: query dtype: string - name: vi_qa list: - name: label dtype: string - name: query dtype: string - name: vi_table dtype: string splits: - name: train num_bytes: 863105949.214 num_examples: 18317 - name: validation num_bytes: 50520962.392 num_examples: 1056 - name: test num_bytes: 70162622.487 num_examples: 1509 download_size: 963469804 dataset_size: 983789534.0929999 - config_name: dictionary features: - name: id_image dtype: string - name: id_table dtype: string - name: cell_value dtype: string - name: cell_type dtype: string splits: - name: train num_bytes: 30090420 num_examples: 523696 - name: validation num_bytes: 1655359 num_examples: 27796 - name: test num_bytes: 2299282 num_examples: 39417 download_size: 5615841 dataset_size: 34045061 - config_name: gemini-translate features: - name: id_image dtype: string - name: image dtype: image - name: table dtype: string - name: chart_type dtype: string - name: qa list: - name: label dtype: string - name: query dtype: string - name: vi_qa list: - name: label dtype: string - name: query dtype: string - name: gemini_response dtype: string splits: - name: train num_bytes: 860931675.061 num_examples: 18317 - name: validation num_bytes: 48369553.096 num_examples: 1056 - name: test num_bytes: 67244461.03 num_examples: 1509 download_size: 954876861 dataset_size: 976545689.1869999 - config_name: vietnam-3000-gemini features: - name: id_image dtype: string - name: image dtype: image - name: table dtype: string - name: chart_type dtype: string - name: qa list: - name: label dtype: string - name: query dtype: string - name: vi_qa list: - name: label dtype: string - name: query dtype: string - name: gemini_response dtype: string - name: vi_image dtype: image - name: vi_table dtype: string - name: vi_title dtype: string - name: vi_x_label dtype: string - name: vi_y_label dtype: string splits: - name: train num_bytes: 258211841.452 num_examples: 3332 download_size: 252747999 dataset_size: 258211841.452 - config_name: vietnamese features: - name: id_image dtype: string - name: image dtype: image - name: table dtype: string - name: chart_type dtype: string - name: qa list: - name: label dtype: string - name: query dtype: string - name: vi_qa list: - name: label dtype: string - name: query dtype: string - name: title dtype: string - name: x_label dtype: string - name: y_label dtype: string - name: Python dtype: string splits: - name: train num_bytes: 855859414.646 num_examples: 18317 - name: validation num_bytes: 47988247.376 num_examples: 1056 - name: test num_bytes: 66717750.575 num_examples: 1509 download_size: 951094106 dataset_size: 970565412.5970001 - config_name: vin features: - name: id_image dtype: string - name: image dtype: image - name: table dtype: string - name: chart_type dtype: string - name: qa list: - name: label dtype: string - name: query dtype: string - name: vi_qa list: - name: label dtype: string - name: query dtype: string - name: vi_table dtype: string splits: - name: train num_bytes: 870471769.214 num_examples: 18317 - name: validation num_bytes: 50822738.392 num_examples: 1056 - name: test num_bytes: 70633671.487 num_examples: 1509 download_size: 967825853 dataset_size: 991928179.0929999 configs: - config_name: default data_files: - split: train path: data/train-* - split: validation path: data/validation-* - split: test path: data/test-* - config_name: dictionary data_files: - split: train path: dictionary/train-* - split: validation path: dictionary/validation-* - split: test path: dictionary/test-* - config_name: gemini-translate data_files: - split: train path: gemini-translate/train-* - split: validation path: gemini-translate/validation-* - split: test path: gemini-translate/test-* - config_name: vietnam-3000-gemini data_files: - split: train path: vietnam-3000-gemini/train-* - config_name: vietnamese data_files: - split: train path: vietnamese/train-* - split: validation path: vietnamese/validation-* - split: test path: vietnamese/test-* - config_name: vin data_files: - split: train path: vin/train-* - split: validation path: vin/validation-* - split: test path: vin/test-* --- Dataset is converted from https://github.com/vis-nlp/ChartQA vin là tập đã dịch các qa 3000 là tập các chart đã dịch

数据集信息: 1. 配置名称:default 特征: - 图像标识(id_image):数据类型为字符串 - 图像(image):数据类型为图像 - 表格(table):数据类型为字符串 - 图表类型(chart_type):数据类型为字符串 - 问答对(qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - 越南语问答对(vi_qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - 越南语表格(vi_table):数据类型为字符串 数据集划分: - 训练集(train):占用字节数863105949.214,样本量18317 - 验证集(validation):占用字节数50520962.392,样本量1056 - 测试集(test):占用字节数70162622.487,样本量1509 整体信息:下载大小963469804,数据集总大小983789534.0929999 2. 配置名称:dictionary 特征: - 图像标识(id_image):数据类型为字符串 - 表格标识(id_table):数据类型为字符串 - 单元格值(cell_value):数据类型为字符串 - 单元格类型(cell_type):数据类型为字符串 数据集划分: - 训练集:占用字节数30090420,样本量523696 - 验证集:占用字节数1655359,样本量27796 - 测试集:占用字节数2299282,样本量39417 整体信息:下载大小5615841,数据集总大小34045061 3. 配置名称:gemini-translate 特征: - 图像标识(id_image):数据类型为字符串 - 图像(image):数据类型为图像 - 表格(table):数据类型为字符串 - 图表类型(chart_type):数据类型为字符串 - 问答对(qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - 越南语问答对(vi_qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - Gemini响应结果(gemini_response):数据类型为字符串 数据集划分: - 训练集:占用字节数860931675.061,样本量18317 - 验证集:占用字节数48369553.096,样本量1056 - 测试集:占用字节数67244461.03,样本量1509 整体信息:下载大小954876861,数据集总大小976545689.1869999 4. 配置名称:vietnam-3000-gemini 特征: - 图像标识(id_image):数据类型为字符串 - 图像(image):数据类型为图像 - 表格(table):数据类型为字符串 - 图表类型(chart_type):数据类型为字符串 - 问答对(qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - 越南语问答对(vi_qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - Gemini响应结果(gemini_response):数据类型为字符串 - 越南语图像(vi_image):数据类型为图像 - 越南语表格(vi_table):数据类型为字符串 - 越南语标题(vi_title):数据类型为字符串 - 越南语X轴标签(vi_x_label):数据类型为字符串 - 越南语Y轴标签(vi_y_label):数据类型为字符串 数据集划分:仅包含训练集:占用字节数258211841.452,样本量3332 整体信息:下载大小252747999,数据集总大小258211841.452 5. 配置名称:vietnamese 特征: - 图像标识(id_image):数据类型为字符串 - 图像(image):数据类型为图像 - 表格(table):数据类型为字符串 - 图表类型(chart_type):数据类型为字符串 - 问答对(qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - 越南语问答对(vi_qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - 标题(title):数据类型为字符串 - X轴标签(x_label):数据类型为字符串 - Y轴标签(y_label):数据类型为字符串 - Python代码(Python):数据类型为字符串 数据集划分: - 训练集:占用字节数855859414.646,样本量18317 - 验证集:占用字节数47988247.376,样本量1056 - 测试集:占用字节数66717750.575,样本量1509 整体信息:下载大小951094106,数据集总大小970565412.5970001 6. 配置名称:vin 特征: - 图像标识(id_image):数据类型为字符串 - 图像(image):数据类型为图像 - 表格(table):数据类型为字符串 - 图表类型(chart_type):数据类型为字符串 - 问答对(qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - 越南语问答对(vi_qa):列表类型,包含两个字段:标签(label,字符串类型)、查询语句(query,字符串类型) - 越南语表格(vi_table):数据类型为字符串 数据集划分: - 训练集:占用字节数870471769.214,样本量18317 - 验证集:占用字节数50822738.392,样本量1056 - 测试集:占用字节数70633671.487,样本量1509 整体信息:下载大小967825853,数据集总大小991928179.0929999 所有配置的数据文件路径: - 配置名称default:训练集数据文件路径为data/train-*,验证集为data/validation-*,测试集为data/test-* - 配置名称dictionary:训练集数据文件路径为dictionary/train-*,验证集为dictionary/validation-*,测试集为dictionary/test-* - 配置名称gemini-translate:训练集数据文件路径为gemini-translate/train-*,验证集为gemini-translate/validation-*,测试集为gemini-translate/test-* - 配置名称vietnam-3000-gemini:训练集数据文件路径为vietnam-3000-gemini/train-* - 配置名称vietnamese:训练集数据文件路径为vietnamese/train-*,验证集为vietnamese/validation-*,测试集为vietnamese/test-* - 配置名称vin:训练集数据文件路径为vin/train-*,验证集为vin/validation-*,测试集为vin/test-* 本数据集源自开源仓库https://github.com/vis-nlp/ChartQA,其中vin配置为已完成问答对翻译的子集,vietnam-3000-gemini配置为已完成图表翻译的子集。

提供机构:
TeeA
原始信息汇总

数据集概述

数据集配置

默认配置 (default)

  • 特征:
    • id_image: 字符串
    • image: 图像
    • table: 字符串
    • chart_type: 字符串
    • qa: 列表
      • label: 字符串
      • query: 字符串
    • vi_qa: 列表
      • label: 字符串
      • query: 字符串
    • vi_table: 字符串
  • 分割:
    • train: 863105949.214 字节, 18317 个样本
    • validation: 50520962.392 字节, 1056 个样本
    • test: 70162622.487 字节, 1509 个样本
  • 下载大小: 963469804 字节
  • 数据集大小: 983789534.0929999 字节

字典配置 (dictionary)

  • 特征:
    • id_image: 字符串
    • id_table: 字符串
    • cell_value: 字符串
    • cell_type: 字符串
  • 分割:
    • train: 30090420 字节, 523696 个样本
    • validation: 1655359 字节, 27796 个样本
    • test: 2299282 字节, 39417 个样本
  • 下载大小: 5615841 字节
  • 数据集大小: 34045061 字节

Gemini 翻译配置 (gemini-translate)

  • 特征:
    • id_image: 字符串
    • image: 图像
    • table: 字符串
    • chart_type: 字符串
    • qa: 列表
      • label: 字符串
      • query: 字符串
    • vi_qa: 列表
      • label: 字符串
      • query: 字符串
    • gemini_response: 字符串
  • 分割:
    • train: 860931675.061 字节, 18317 个样本
    • validation: 48369553.096 字节, 1056 个样本
    • test: 67244461.03 字节, 1509 个样本
  • 下载大小: 954876861 字节
  • 数据集大小: 976545689.1869999 字节

Vietnam 3000 Gemini 配置 (vietnam-3000-gemini)

  • 特征:
    • id_image: 字符串
    • image: 图像
    • table: 字符串
    • chart_type: 字符串
    • qa: 列表
      • label: 字符串
      • query: 字符串
    • vi_qa: 列表
      • label: 字符串
      • query: 字符串
    • gemini_response: 字符串
    • vi_image: 图像
    • vi_table: 字符串
    • vi_title: 字符串
    • vi_x_label: 字符串
    • vi_y_label: 字符串
  • 分割:
    • train: 258211841.452 字节, 3332 个样本
  • 下载大小: 252747999 字节
  • 数据集大小: 258211841.452 字节

越南语配置 (vietnamese)

  • 特征:
    • id_image: 字符串
    • image: 图像
    • table: 字符串
    • chart_type: 字符串
    • qa: 列表
      • label: 字符串
      • query: 字符串
    • vi_qa: 列表
      • label: 字符串
      • query: 字符串
    • title: 字符串
    • x_label: 字符串
    • y_label: 字符串
    • Python: 字符串
  • 分割:
    • train: 855859414.646 字节, 18317 个样本
    • validation: 47988247.376 字节, 1056 个样本
    • test: 66717750.575 字节, 1509 个样本
  • 下载大小: 951094106 字节
  • 数据集大小: 970565412.5970001 字节

VIN 配置 (vin)

  • 特征:
    • id_image: 字符串
    • image: 图像
    • table: 字符串
    • chart_type: 字符串
    • qa: 列表
      • label: 字符串
      • query: 字符串
    • vi_qa: 列表
      • label: 字符串
      • query: 字符串
    • vi_table: 字符串
  • 分割:
    • train: 870471769.214 字节, 18317 个样本
    • validation: 50822738.392 字节, 1056 个样本
    • test: 70633671.487 字节, 1509 个样本
  • 下载大小: 967825853 字节
  • 数据集大小: 991928179.0929999 字节
搜集汇总
数据集介绍
TeeA/ChartQA 数据集图片
构建方式
在视觉与自然语言处理的交叉领域中,图表问答任务要求模型同时理解图像语义与结构化数据。TeeA/ChartQA数据集源自ChartQA基准,通过系统化收集与标注构建而成。数据集中每张图表均配备对应的底层数据表格、图表类型标签以及人工标注的问答对,确保了视觉信息与文本描述的严格对齐。此外,数据集特别提供了越南语翻译版本,通过将原始问答对及图表元数据(如标题、坐标轴标签)进行本地化处理,扩展了多语言场景下的适用性。整体数据划分包含训练集、验证集与测试集,样本规模均衡,为模型评估提供了标准化基础。
特点
该数据集的核心特点在于其多维度、多语言的丰富性。一方面,它涵盖了多种图表类型,并同时提供原始图像、结构化表格以及问答对,形成了视觉-语言-结构化数据的多模态关联。另一方面,数据集创新性地引入了越南语翻译配置,包括由Gemini模型生成的翻译结果以及人工校验的越南语版本,为跨语言图表理解研究提供了独特资源。此外,数据集中还包含一个独立的字典配置,用于存储表格中每个单元格的值与类型,支持细粒度的表格解析能力。这些特性使该数据集成为评估模型在多语言、多模态图表推理任务上表现的重要基准。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载不同配置以实现特定研究目标。默认配置(default)适用于标准的图表问答任务,直接加载图像、表格与问答对进行训练。对于多语言研究,可选择vietnamese或vin配置,利用越南语问答对开展跨语言模型微调。gemini-translate配置则提供了机器翻译的中间结果,便于对比不同翻译质量对任务性能的影响。数据集中的字典配置(dictionary)可用于单独预训练表格理解模块。研究者应依据任务需求选择相应配置,并注意不同配置间数据划分的一致性,以确保评估结果的可靠性。
背景与挑战
背景概述
ChartQA数据集由视觉与自然语言处理领域的研究团队创建,旨在推动图表理解与问答任务的发展。该数据集诞生于对复杂图表信息自动化解析的迫切需求,核心研究问题在于如何使模型能够从包含多种类型图表(如折线图、柱状图等)的图像中,准确提取结构化数据并回答自然语言问题。ChartQA通过提供大规模、多样化的图表-问答对,为评估和提升多模态模型的推理能力提供了标准化基准,对视觉语言理解领域产生了深远影响,促进了从简单数据检索到复杂逻辑推理的跨越。
当前挑战
ChartQA所面临的挑战主要源于图表理解任务的固有复杂性。领域问题方面,模型需克服图表元素(如坐标轴、图例)的视觉歧义、数据与文本的跨模态对齐难题,以及回答涉及趋势比较、数值计算等高级推理问题的能力。构建过程中,挑战则包括自动化生成高质量问答对的难度、确保图表类型与问题分布的均衡性,以及处理多语言(如越南语)扩展时翻译准确性与文化适应性的平衡,这些因素共同制约着数据集的实用性和模型的泛化表现。
常用场景
经典使用场景
ChartQA数据集作为视觉问答与图表理解领域的标杆性资源,其经典使用场景聚焦于训练和评估多模态模型在复杂图表上的推理能力。该数据集包含超过两万张涵盖折线图、柱状图、饼图等多种类型的图表图像,每张图均配有由人工标注的问答对。研究者常基于此数据集构建端到端的图表问答系统,要求模型不仅能精准识别图表中的视觉元素(如坐标轴、图例、数据点),还需结合表格化结构化信息进行数值计算与逻辑推断,从而回答从简单检索到复杂比较的多层次问题。
实际应用
在实际应用中,ChartQA所催生的技术已广泛渗透至数据新闻自动生成、商业智能报表解读与教育辅助决策等领域。基于该数据集训练的模型能够自动解析金融趋势图、销售业绩看板或学术统计图表,将视觉信息转化为可操作的文字摘要与问答交互。例如,分析师可通过自然语言询问「上季度增长最快的产品线」,系统即可定位图表中的对应数据点并给出精确答案。这种能力极大降低了非专业用户从复杂图表中获取洞察的门槛,加速了数据驱动决策的普及。
衍生相关工作
ChartQA的出现催生了一系列富有影响力的衍生工作,例如ChartT5与Pix2Struct等模型专门针对图表理解进行了架构优化。后续研究如PlotQA进一步扩展了问答难度,引入更复杂的数值计算与多步推理任务。此外,ChartQA的标注范式也被迁移至多语言场景,衍生出如Vietnam-3000-Gemini等子集,探索跨语言图表问答的可行性。这些工作共同构建了从图表解析到语义推理的完整技术栈,持续推动着视觉语言模型在结构化信息理解领域的边界拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务