遇见数据集

khhuang/CHOCOLATE

收藏
Hugging Face2024-01-22 更新2024-03-04 收录
官方服务:

资源简介:

--- annotations_creators: - expert-generated - found language_creators: - expert-generated - found language: - en license: apache-2.0 multilinguality: - monolingual size_categories: - 1K<n<10K paperswithcode_id: chocolate pretty_name: CHOCOLATE tags: - chart - plot - chart-to-text - vistext - statista - pew - chart-understanding - chart-captioning - chart-summarization - document-image configs: - config_name: default data_files: - split: test path: chocolate.json --- # Dataset Card for CHOCOLATE - [Dataset Description](https://huggingface.co/datasets/khhuang/CHOCOLATE/blob/main/README.md#dataset-description) - [Paper Information](https://huggingface.co/datasets/khhuang/CHOCOLATE/blob/main/README.md#paper-information) - [Citation](https://huggingface.co/datasets/khhuang/CHOCOLATE/blob/main/README.md#citation) ## Dataset Description **CHOCOLATE** is a benchmark for detecting and correcting factual inconsistency in generated chart captions. It consists of captions produced by six most advanced models, which are categorized into three subsets: - **LVLM**: GPT-4V, Bard (before Gemini) - **LLM-based Pipeline**: DePlot + GPT-4 - **Fine-tuned Model**: ChartT5, MatCha, UniChart The charts are from two datasets: VisText and the Pew split of Chart-to-Text. In total, **CHOCOLATE** consists of **1,187 examples**. Each instance in **CHOCOLATE** consists of a caption generated by one of the model and the annotations of the factual errors for each caption sentence. ## Paper Information - Paper: https://arxiv.org/abs/2312.10160 - Code: https://github.com/khuangaf/CHOCOLATE/ - Project: https://khuangaf.github.io/CHOCOLATE ## Citation If you use the **CHOCOLATE** dataset in your work, please kindly cite the paper using this BibTeX: ``` @misc{huang-etal-2023-do, title = "Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning", author = "Huang, Kung-Hsiang and Zhou, Mingyang and Chan, Hou Pong and Fung, Yi R. and Wang, Zhenhailong and Zhang, Lingyu and Chang, Shih-Fu and Ji, Heng", year={2023}, eprint={2312.10160}, archivePrefix={arXiv}, primaryClass={cs.CL} } ```

annotations_creators: - 专家生成 - 公开获取 language_creators: - 专家生成 - 公开获取 language: - 英语(en) license: Apache-2.0许可证 multilinguality: - 单语言 size_categories: - 1000 < 样本数 < 10000 paperswithcode_id: chocolate pretty_name: CHOCOLATE tags: - 图表(chart) - 绘图(plot) - 图表转文本(chart-to-text) - 视觉文本(VisText) - Statista - 皮尤(Pew) - 图表理解(chart-understanding) - 图表标题生成(chart-captioning) - 图表摘要(chart-summarization) - 文档图像(document-image) configs: - 配置名称:默认配置(default) 数据文件: - 拆分方式:测试集(test) 文件路径:chocolate.json --- # CHOCOLATE 数据集卡片 - [数据集说明](https://huggingface.co/datasets/khhuang/CHOCOLATE/blob/main/README.md#dataset-description) - [论文信息](https://huggingface.co/datasets/khhuang/CHOCOLATE/blob/main/README.md#paper-information) - [引用方式](https://huggingface.co/datasets/khhuang/CHOCOLATE/blob/main/README.md#citation) ## 数据集说明 **CHOCOLATE** 是一款用于检测并修正生成式图表标题中事实不一致性的评测基准数据集。该数据集包含由当前六款最先进模型生成的图表标题,这些模型被划分为三个子集: - **大视觉语言模型(LVLM)**:GPT-4V、Gemini发布前的Bard - **基于大语言模型的流水线模型**:DePlot + GPT-4 - **微调模型**:ChartT5、MatCha、UniChart 所用图表来源于两个数据集:视觉文本(VisText)数据集以及图表转文本(Chart-to-Text)数据集的皮尤(Pew)拆分子集。**CHOCOLATE** 总计包含**1187个样本**。数据集中的每个样本均包含由上述某一模型生成的标题,以及针对标题每一句的事实错误标注。 ## 论文信息 - 论文:https://arxiv.org/abs/2312.10160 - 代码:https://github.com/khuangaf/CHOCOLATE/ - 项目页面:https://khuangaf.github.io/CHOCOLATE ## 引用说明 若您在研究工作中使用 **CHOCOLATE** 数据集,请采用以下BibTeX格式引用该论文: @misc{huang-etal-2023-do, title = "Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning", author = "Huang, Kung-Hsiang and Zhou, Mingyang and Chan, Hou Pong and Fung, Yi R. and Wang, Zhenhailong and Zhang, Lingyu and Chang, Shih-Fu and Ji, Heng", year={2023}, eprint={2312.10160}, archivePrefix={arXiv}, primaryClass={cs.CL} }

提供机构:
khhuang
原始信息汇总

数据集卡片 CHOCOLATE

数据集描述

CHOCOLATE 是一个用于检测和纠正生成图表标题中事实不一致性的基准数据集。它包含由六个最先进的模型生成的标题,分为三个子集:

  • LVLM: GPT-4V, Bard (before Gemini)
  • LLM-based Pipeline: DePlot + GPT-4
  • Fine-tuned Model: ChartT5, MatCha, UniChart

图表来自两个数据集:VisText 和 Chart-to-Text 的 Pew 分割。CHOCOLATE 总共包含 1,187 个示例CHOCOLATE 中的每个实例包含由其中一个模型生成的标题以及每个标题句子的事实错误注释。

论文信息

  • 论文: https://arxiv.org/abs/2312.10160
  • 代码: https://github.com/khuangaf/CHOCOLATE/
  • 项目: https://khuangaf.github.io/CHOCOLATE

引用

如果您在工作中使用了 CHOCOLATE 数据集,请使用以下 BibTeX 引用论文:

@misc{huang-etal-2023-do, title = "Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning", author = "Huang, Kung-Hsiang and Zhou, Mingyang and Chan, Hou Pong and Fung, Yi R. and Wang, Zhenhailong and Zhang, Lingyu and Chang, Shih-Fu and Ji, Heng", year={2023}, eprint={2312.10160}, archivePrefix={arXiv}, primaryClass={cs.CL} }

搜集汇总
数据集介绍
khhuang/CHOCOLATE 数据集图片
构建方式
在图表理解与自动描述的研究领域中,准确评估生成性模型输出的真实性是核心挑战之一。CHOCOLATE数据集应运而生,旨在系统性地检测与修正图表描述中的事实不一致问题。该数据集以来自VisText以及Chart-to-Text数据集中Pew子集的图表为基础,汇集了六种前沿模型生成的描述文本。这些模型涵盖了大型视觉语言模型(如GPT-4V、Bard)、基于大型语言模型的流水线(如DePlot结合GPT-4)以及微调专用模型(如ChartT5、MatCha、UniChart)。每一份描述中的每个句子均经过专家标注,精确标记其中的事实错误类型,从而构建起一个包含1,187个实例的高质量评估基准。
特点
CHOCOLATE数据集最显著的特点在于其精细化的错误标注粒度与多元化的模型来源。不同于仅提供整体正确性标签的数据集,它针对每一条描述中的每个句子进行事实错误标注,使研究者能够深入分析模型在图表理解中产生错误的微观模式。此外,数据集的实例源自三种截然不同的技术路线——端到端视觉语言模型、基于图表的语言模型流水线以及微调模型,这为全面比较不同范式的鲁棒性提供了独特视角。其规模虽精简(约千余条),但覆盖了多种图表类型与描述风格,确保了评估的深度与代表性。
使用方法
使用CHOCOLATE数据集时,研究者可将其作为图表描述事实一致性的标准测试基准。数据集以JSON格式提供,默认配置包含测试集分割,可直接加载用于评估新模型输出的准确性。用户可通过Hugging Face Datasets库轻松调用,例如使用load_dataset函数加载'khhuang/CHOCOLATE'并指定分割。每条数据包含原始图表、模型生成的描述以及逐句的事实错误注释,便于进行细粒度分析。该数据集尤其适合用于开发错误检测模型、训练事实纠正系统或对比不同图表描述模型的表现,其Apache-2.0许可协议也保障了广泛的应用自由。
背景与挑战
背景概述
在数据可视化与自然语言处理的交叉领域,图表描述生成任务旨在将复杂的统计图形转化为人类可理解的文本摘要,这一技术对于提升信息可及性与辅助决策具有重要意义。然而,现有模型生成的描述常存在与图表事实不符的谬误,严重制约了其在真实场景中的可靠性。为此,由伊利诺伊大学厄巴纳-香槟分校等机构的研究人员于2023年创建的CHOCOLATE数据集应运而生,其核心研究问题聚焦于系统性地检测与修正图表描述中的事实性错误。该数据集整合了GPT-4V、Bard等六种前沿模型生成的1187个描述实例,覆盖从视觉语言模型到微调模型的多类范式,为评估模型的事实一致性提供了标准化基准。CHOCOLATE的发布填补了图表理解领域缺乏细粒度错误标注资源的空白,对推动更精准、可信的图表自动描述技术发展具有里程碑式的影响。
当前挑战
CHOCOLATE数据集所应对的核心挑战在于图表描述中事实错误的多样性与隐蔽性。领域问题层面,现有模型在解析图表时易出现数值误读、趋势误判、类别混淆等事实偏差,这些错误往往与文本流畅性共存,使得传统评估指标无法有效甄别。构建过程中,研究团队面临双重挑战:其一,需从VisText和Chart-to-Text两个异质数据源中筛选图表,确保覆盖折线图、柱状图等不同视觉形态,并平衡模型生成描述的分布;其二,标注工作需设计精细的错误分类体系,将每个句子级错误归入数值、比较、结构等类型,同时要求标注者具备图表解读与语言学双重素养,以保证标注一致性与可靠性。这些挑战共同塑造了CHOCOLATE作为事实一致性评估基准的独特价值。
常用场景
经典使用场景
在图表理解与自动描述生成领域,CHOCOLATE数据集被广泛用作评估与提升图表描述模型事实一致性的标准基准。该数据集汇集了GPT-4V、Bard等大型视觉语言模型以及ChartT5、MatCha等专用微调模型生成的图表描述,并针对每句描述标注了事实性错误。研究者通过分析这些错误类型与分布,系统性地衡量现有模型在解读图表时存在的幻觉与偏差,从而推动更精准、可靠的图表描述生成技术发展。
实际应用
在实际应用中,CHOCOLATE数据集所揭示的事实错误模式直接服务于新闻图表自动报道、商业报告生成、教育材料辅助解读等场景。例如,新闻机构利用图表描述模型自动生成数据可视化摘要时,该数据集帮助开发人员识别并修正模型在关键数据点上的误读,确保生成内容符合原始图表信息。此外,在金融分析、医疗统计等对数据准确性要求严苛的领域,基于该数据集的评估方法被用于筛选与优化图表描述模型,降低因事实错误导致的决策风险。
衍生相关工作
基于CHOCOLATE数据集,学术界衍生出一系列重要工作。研究者提出了面向图表描述的事实性错误检测与纠正框架,探索利用对比学习、外部知识注入等方法提升模型对图表数据的理解能力。同时,该数据集激发了关于图表描述评估指标的研究,推动开发能够自动识别数值错误、趋势误判等事实不一致性问题的度量标准。此外,部分工作将CHOCOLATE中的错误分类体系迁移至更广泛的文档图像理解任务,如信息图表与科学图表描述,拓展了事实一致性评估的适用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务