遇见数据集

ChartStyle-100K

收藏
github2026-07-01 更新2026-07-03 收录
官方服务:

资源简介:

ChartStyle-100K是一个大规模数据集,用于结构化可视化风格迁移任务,包含100,744个图像三元组(风格参考、内容图像、目标图像),涵盖图表、流程图、示意图和表格。该数据集通过ChartForge四阶段管道合成,旨在保持内容图像的数据、文本和结构语义,同时匹配风格参考的视觉外观。

ChartStyle-100K is a large-scale dataset for structured visual style transfer tasks, which contains 100,744 image triplets (style reference, content image, target image) covering charts, flowcharts, schematic diagrams, and tables. This dataset is synthesized via the four-stage ChartForge pipeline, aiming to preserve the data, textual and structural semantics of the content image while matching the visual appearance of the style reference.

创建时间:
2026-06-30
原始信息汇总

ChartStyle-100K 数据集概述

ChartStyle-100K 是一个面向 结构化可视化风格迁移 的大规模数据集,已被 ECCV 2026 接收。该数据集包含 100,744 个图像三元组,每个三元组由风格参考图像、内容图像和目标图像组成。

数据集核心组成

  • ChartStyle-100K:训练数据集,包含 100,744 个图像三元组。
  • ChartStyle-Bench:评估基准,包含 300 个人工筛选的输入对(风格参考图像 + 内容图像),与训练数据无重叠。

数据集内容分布

内容类型 数量 占比
图表 (Chart) 76,122 75.6%
图表 (Diagram) 11,244 11.2%
流程图 (Flowchart) 10,143 10.1%
表格 (Table) 3,235 3.2%
总计 100,744 100%

数据集涵盖多种细粒度图表类型(条形图、饼图、折线图、漏斗图、环形图、树图、子弹图、桑基图、瀑布图、雷达图、热力图等)及均衡的主题领域(市场营销、心理学、教育、公共卫生、生物学、统计学、金融、物理学等)。

数据格式(训练集)

每个记录包含以下字段:

字段 类型 描述
sample_id string 三元组唯一标识符
style_reference image 定义所需视觉风格的图像
content_image image 需保留数据与语义内容的图像
target_image image 风格迁移后的目标图像
content_type string 细粒度图表类型;流程图/示意图/表格为 null
content_subject string 内容主题领域

评估基准(ChartStyle-Bench)

  • 300 个输入对(风格参考图像 + 内容图像)
  • 基准图像独立收集,与合成训练数据无重叠
  • 分布:图表 150 对、流程图 66 对、示意图 42 对、表格 42 对
  • 包含content_leakage指标,检测风格参考中的内容是否泄露到输出中

数据生成管道(ChartForge)

数据集通过四阶段合成管道生成:

  1. 阶段 I - 参考驱动的目标生成:从风格参考图像生成高质量目标可视化
  2. 阶段 II - 基于重样式的内容生成:从目标图像反向构建内容图像
  3. 阶段 III - 风格空间重采样:使用阶段 II 的输出作为新参考,扩展风格覆盖
  4. 阶段 IV - 多维质量评估与过滤:
    • GPT-4o 评估:视觉质量、内容一致性、风格一致性
    • PaddleOCR 评估:内容与目标间的文本 F1 分数
    • 聚合过滤:按阈值筛选

评估指标

类型 指标 描述
LLM content_consistency 输出保留原始内容的程度(1-5)
LLM style_similarity 输出遵循参考风格的紧密程度(1-5)
LLM content_leakage 参考内容泄漏检测(0/1)
CLIP semantic_consistency 内容与输出之间的 CLIP 余弦相似度
CLIP clip_stylistic_fidelity 风格参考与输出之间的 CLIP 余弦相似度
OCR ocr_score 内容与输出间 PaddleOCR 词级 F1 分数

许可协议

  • 代码(pipeline/ 和 evaluation/):Apache License 2.0
  • 数据集(ChartStyle-100K 和 ChartStyle-Bench):CC BY-SA 4.0

数据加载方式

python from datasets import load_dataset

快速预览(100 个样本)

preview = load_dataset("ChartFoundation/ChartStyle-100k", "preview", split="preview")

完整训练集(100,744 个三元组)

dataset = load_dataset("ChartFoundation/ChartStyle-100k", "train", split="train")

搜集汇总
数据集介绍
ChartStyle-100K 数据集图片
构建方式
ChartStyle-100K数据集的构建依托于名为ChartForge的四阶段合成管道,旨在生成结构化可视化风格迁移所需的训练三元组(风格参考图、内容图、目标图)。第一阶段从给定的风格参考图像出发,借助GPT-Image模型随机采样主题、类型及信息密度,生成高保真的目标可视化图像。第二阶段以目标图像为蓝本,通过改变其视觉风格并保持底层结构,反向构造出对应的内容图像,从而完成三元组的初步创建。第三阶段进一步扩展风格覆盖范围,将第二阶段生成的优质内容图像重新用作风格参考,重复前两阶段的操作以丰富风格多样性。最后,第四阶段引入多维度质量评估与过滤机制,包括GPT-4o驱动的视觉质量评分、PaddleOCR的文本保留度校验以及聚合阈值筛选,确保最终保留的三元组兼具视觉一致性与语义完整性。
特点
该数据集的核心特色在于其大规模、结构化与高保真度。它包含100,744个精心构建的图像三元组,覆盖图表、流程图、图示和表格四大可视化家族,其中图表类型细致多样,涵盖柱状图、饼图、桑基图、雷达图等数十种子类。每一训练样本均提供精确的三元组监督,即风格参考、内容图像与真实目标图像一一对应,为模型学习风格迁移中的内容保持提供了坚实支撑。数据集还特别强调内容保留能力,基准测试被设计为能够暴露风格参考图像中内容泄露的风险,从而引导模型关注几何、文字、标签与布局等核心语义要素的完整性。此外,整个生成管道的开放性使得研究者可复现或扩展数据集,进一步提升了其实用价值。
使用方法
该数据集的使用方式便捷且结构化,支持多种应用场景。研究者可通过Hugging Face Datasets库直接加载训练数据,简单调用即可获取包含风格参考、内容图像及目标图像的PIL格式实例。在此基础上,推荐采用Qwen-Image-Edit-2509作为基座模型进行LoRA微调,训练时将风格参考与内容图像作为双图像输入,目标图像作为预期输出,配合DiffSynth-Studio提供的适配脚本即可高效执行。评估环节依托ChartStyle-Bench基准,该基准包含300个与训练数据无重叠的手工筛选输入对,通过运行官方评估框架,可对模型输出的内容一致性、风格相似度、内容泄露风险及OCR得分等多维度指标进行自动化打分,最终获得详尽的性能分析报告。
背景与挑战
背景概述
在数据可视化领域,风格迁移技术虽已取得显著进展,然而现有方法多聚焦于自然图像或艺术风格,缺乏针对结构化可视化内容的系统性研究。为填补这一空白,ChartStyle-100K数据集于2025年由澳大利亚国立大学、清华大学及Canva Research的研究团队联合创建,并被ECCV 2026收录。该数据集的核心研究问题是如何在保留图表、流程图、示意图及表格的精确数据、文本与结构语义的前提下,实现对其视觉风格的忠实转换。通过提供逾十万组三元组样本(风格参考图、内容图、目标图),ChartStyle-100K为结构化可视化风格迁移任务奠定了大规模、高质且可复现的训练基础。该数据集的提出不仅推动了计算机视觉与信息可视化的交叉研究,亦为智能设计工具在商业与学术场景中的实际应用铺平了道路。
当前挑战
ChartStyle-100K所面临的挑战主要源于结构化可视化风格迁移的本质复杂性。该领域问题的核心挑战在于:风格迁移过程中需同时确保几何形状、文字标签与布局结构的完整保留,任何细微的语义或文本失真均可能导致内容泄漏与信息误读。在数据集构建过程中,团队遭遇了多重技术难关。首先,生成高保真的目标图像需协调复杂的视觉元素与多样的风格家族,这对图像生成模型的结构理解能力提出了极高要求。其次,逆向重构内容图像时,需巧妙地在保持原结构的同时引入多样化的随机风格,平衡风格丰富性与语义不变性。进一步地,风格空间的重采样需在不破坏数据质量的前提下扩展风格覆盖范围。最后,通过GPT-4o多维度评分与OCR文本一致性检验等质量过滤手段,确保每对三元组均满足严格的视觉质量与内容保真标准,这一系列筛选环节的精密设计与高效执行本身就是一项艰巨的工程挑战。
常用场景
经典使用场景
在信息可视化与计算机视觉的交叉领域,结构化可视化风格迁移任务旨在将一张参考图表的视觉风格(如配色、纹理、字体)迁移至另一张内容图表,同时严格保留后者的数据、文本与结构语义。ChartStyle-100K数据集为这一任务提供了大规模三胞胎训练样本(风格参考图、内容图、目标图),覆盖图表、流程图、示意图和表格四大可视化家族,支持模型端到端学习从风格参考到目标图像的映射关系,从而在保留内容语义的前提下实现精准的风格适配。
衍生相关工作
围绕ChartStyle-100K,研究者已开发了若干衍生工作。开源的数据合成管线ChartForge为后续研究提供了可复现的四阶段生成流程,包括参考驱动目标生成、基于重绘的内容构造、风格空间重采样及多维度质量筛选,使得其他团队能够低成本扩展或定制数据集。基于该数据训练的Qwen-Image-Edit模型通过LoRA微调实现了高效的图表风格迁移推理流程。此外,ChartStyle-Bench已作为标准化测试平台,用于评估多种图像编辑模型在图表情境下的内容保留与风格适配表现。
数据集最近研究
最新研究方向
ChartStyle-100K数据集聚焦于结构化可视化风格迁移这一前沿课题,旨在解决图表、流程图、示意图及表格等结构化视觉内容在保持数据、文本和布局语义完整性的前提下完成风格迁移的挑战。该数据集提供了超过10万组高保真三元组训练样本及300组人工精选评测基准,并结合了GPT-4o多维度质量评估、OCR文本一致性校验与CLIP语义相似度打分等创新评估体系,有效推动了风格迁移领域从非结构化图像向结构化可视化的关键跨越。其开源的四阶段生成管道ChartForge实现了完全可复现的数据合成流程,为面向可视化设计自动化、智能数据叙事和跨域图表美化等热点应用提供了坚实的数据与评测基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务