遇见数据集

ibm-granite/ChartNet

收藏
Hugging Face2026-05-15 更新2026-04-12 收录
官方服务:

资源简介:

ChartNet是一个大规模、高质量的多模态数据集,专门设计用于图表理解和推理。它包含170万个丰富的注释图表样本,每个样本都提供了视觉、数值和文本组件的紧密对齐。数据集支持多种图表理解任务,如图表重建、数据提取、图表总结和推理问答。数据集包括多个子集,如核心数据集、推理子集和人工验证子集,每个子集都有不同的特征和用途。此外,数据集还提供了详细的加载指南和许可信息。

ChartNet is a large-scale, high-quality multimodal dataset designed for robust chart interpretation and reasoning. It contains 1.7 million richly annotated chart samples, each offering tightly aligned visual, numerical, and textual components. The dataset supports a broad range of chart understanding tasks, including chart reconstruction, data extraction, chart summarization, and reasoning and QA. It includes several specialized subsets such as the core dataset, reasoning subset, and human-verified subset, each with distinct features and purposes. Additionally, the dataset provides detailed loading instructions and licensing information.

提供机构:
ibm-granite
搜集汇总
数据集介绍
ibm-granite/ChartNet 数据集图片
构建方式
ChartNet的构建依托于一种创新的代码引导式合成流水线。该方法始于一个小规模的图表图像种子集,借助视觉语言模型生成近似重构代码,进而利用代码表示实现多样化的风格与语义变体图表再生。在此过程中,同步推导出紧密对齐的结构化属性,包括表格数据、自然语言摘要以及包含详细思维链的问答对。每个样本均整合了绘图代码、渲染图像、底层数据表和文本摘要四个组件,覆盖了图表理解任务的完整谱系。
使用方法
ChartNet可通过HuggingFace datasets库便捷加载,支持按子集名称直接下载。用户可分别加载核心许可子集、核心子集、推理子集及人工验证子集的训练与测试划分。由于各子集体积可达数百吉字节,推荐按需下载单个parquet文件,例如通过指定数据文件路径仅加载前10,000条记录。该数据集适用于图表重建、数据提取、摘要生成及推理问答等多种端到端任务。
背景与挑战
背景概述
图表理解任务要求模型同步推理几何视觉模式、结构化数值数据与自然语言描述,这构成了多模态人工智能领域的核心挑战。当前视觉语言模型在此类任务中仍显不足。为应对这一缺口,IBM研究团队于2026年发布了ChartNet数据集,旨在推动稳健的图表解释与推理能力。该数据集由来自IBM Granite团队的专家构建,核心包含170万高质量图表样本,每个样本均提供紧密对齐的视觉、数值与文本组件。通过严格的质检流程确保视觉保真度、语义正确性与数据集多样性,ChartNet支持图表重建、数据提取、摘要生成及推理问答等多项任务,已成功应用于Granite Vision 4系列模型的训练,并在CVPR 2026会议上发表相关论文,对多模态图表理解领域产生了深远影响。
当前挑战
ChartNet所解决的核心领域挑战在于,现有模型难以同时处理图表中的几何视觉模式、结构化数值数据与自然语言描述,实现端到端的可解释推理。构建过程中面临的挑战包括:如何从少量种子图表出发,利用代码引导的合成管道生成覆盖24种图表类型、6种绘图库的420万样本;如何确保每个样本包含生成代码、渲染图像、数据表格与自然语言摘要的高度对齐;如何通过人类验证机制对94,643个样本进行质量把关,并在2000个测试集上保持客观评估标准。此外,数据集版本的许可证调整、原始数据可用性限制以及第三方许可合规性问题,也为数据的广泛使用带来了额外复杂性。
常用场景
经典使用场景
在图表理解这一多模态挑战中,ChartNet以其百万级规模的精细标注,成为训练视觉语言模型完成从图表图像到结构化信息的端到端推理的基石。经典使用场景包括:根据图表图像恢复出生成该图表的绘图代码(chart2code),实现图表的重构;从视觉信息中精确提取底层表格数据(chart2csv),替代传统OCR与手动解析;生成自然语言摘要(chart2text),捕捉数据的趋势与模式;以及结合思维链推理的复杂问答,回答涉及语义关系、数值比较和逻辑推理的问题。
解决学术问题
当前视觉语言模型在联合推理几何视觉模式、结构化数值与自然语言描述的能力上仍显不足,ChartNet正是为攻克这一瓶颈而生。它解决了跨模态对齐与精细推理的学术难题,通过海量合成数据与人工验证子集,提供了视觉、数值与文本紧密耦合的标注范式。这一资源使得研究者能够系统性地评估和提升模型在图表信息抽取、语义理解与因果推理上的表现,推动了多模态学习领域向更鲁棒、更可解释的图表智能迈进。
实际应用
在实际产业应用中,ChartNet赋能了从金融报告分析、科研数据可视化到商业智能仪表盘解读的自动化流程。借助该数据集训练的模型能够自动将PDF或截图中的复杂图表转化为可编辑的表格和摘要,极大提升数据分析师的工作效率。在教育领域,可用于为视障人群生成图表的口述描述;在数据新闻中,辅助快速提取图表关键指标并生成解释性文本。这些应用显著降低了图表信息的获取门槛,加速了数据驱动决策的普及。
数据集最近研究
最新研究方向
ChartNet数据集聚焦于图表理解领域的前沿研究,尤其是通过大规模多模态数据推动视觉语言模型在结构化推理上的突破。该数据集包含170万高质量图表样本,覆盖24种图表类型和6种绘图库,并采用代码引导的合成流程生成紧密对齐的视觉、数值和文本信息。ChartNet已用于训练Granite Vision 4系列模型,在图表重建、数据提取、摘要生成和问答推理等任务上展现出显著能力。其独特的推理子集和人工验证子集为评估模型在复杂逻辑链上的表现提供了坚实基准,反映了当前研究热点——将几何视觉模式与表格化结构化数据及自然语言无缝融合,以实现端到端的可解释图表理解,这对自动化数据分析、智能报告生成等应用具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务