ChartStyle-100K
收藏资源简介:
ChartStyle-100K是一个大规模数据集,用于结构化可视化风格迁移任务,包含100,744个图像三元组(风格参考、内容图像、目标图像),涵盖图表、流程图、示意图和表格。该数据集通过ChartForge四阶段管道合成,旨在保持内容图像的数据、文本和结构语义,同时匹配风格参考的视觉外观。
ChartStyle-100K is a large-scale dataset for structured visual style transfer tasks, which contains 100,744 image triplets (style reference, content image, target image) covering charts, flowcharts, schematic diagrams, and tables. This dataset is synthesized via the four-stage ChartForge pipeline, aiming to preserve the data, textual and structural semantics of the content image while matching the visual appearance of the style reference.
ChartStyle-100K 数据集概述
ChartStyle-100K 是一个面向 结构化可视化风格迁移 的大规模数据集,已被 ECCV 2026 接收。该数据集包含 100,744 个图像三元组,每个三元组由风格参考图像、内容图像和目标图像组成。
数据集核心组成
- ChartStyle-100K:训练数据集,包含 100,744 个图像三元组。
- ChartStyle-Bench:评估基准,包含 300 个人工筛选的输入对(风格参考图像 + 内容图像),与训练数据无重叠。
数据集内容分布
| 内容类型 | 数量 | 占比 |
|---|---|---|
| 图表 (Chart) | 76,122 | 75.6% |
| 图表 (Diagram) | 11,244 | 11.2% |
| 流程图 (Flowchart) | 10,143 | 10.1% |
| 表格 (Table) | 3,235 | 3.2% |
| 总计 | 100,744 | 100% |
数据集涵盖多种细粒度图表类型(条形图、饼图、折线图、漏斗图、环形图、树图、子弹图、桑基图、瀑布图、雷达图、热力图等)及均衡的主题领域(市场营销、心理学、教育、公共卫生、生物学、统计学、金融、物理学等)。
数据格式(训练集)
每个记录包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
sample_id |
string | 三元组唯一标识符 |
style_reference |
image | 定义所需视觉风格的图像 |
content_image |
image | 需保留数据与语义内容的图像 |
target_image |
image | 风格迁移后的目标图像 |
content_type |
string | 细粒度图表类型;流程图/示意图/表格为 null |
content_subject |
string | 内容主题领域 |
评估基准(ChartStyle-Bench)
- 300 个输入对(风格参考图像 + 内容图像)
- 基准图像独立收集,与合成训练数据无重叠
- 分布:图表 150 对、流程图 66 对、示意图 42 对、表格 42 对
- 包含
content_leakage指标,检测风格参考中的内容是否泄露到输出中
数据生成管道(ChartForge)
数据集通过四阶段合成管道生成:
- 阶段 I - 参考驱动的目标生成:从风格参考图像生成高质量目标可视化
- 阶段 II - 基于重样式的内容生成:从目标图像反向构建内容图像
- 阶段 III - 风格空间重采样:使用阶段 II 的输出作为新参考,扩展风格覆盖
- 阶段 IV - 多维质量评估与过滤:
- GPT-4o 评估:视觉质量、内容一致性、风格一致性
- PaddleOCR 评估:内容与目标间的文本 F1 分数
- 聚合过滤:按阈值筛选
评估指标
| 类型 | 指标 | 描述 |
|---|---|---|
| LLM | content_consistency |
输出保留原始内容的程度(1-5) |
| LLM | style_similarity |
输出遵循参考风格的紧密程度(1-5) |
| LLM | content_leakage |
参考内容泄漏检测(0/1) |
| CLIP | semantic_consistency |
内容与输出之间的 CLIP 余弦相似度 |
| CLIP | clip_stylistic_fidelity |
风格参考与输出之间的 CLIP 余弦相似度 |
| OCR | ocr_score |
内容与输出间 PaddleOCR 词级 F1 分数 |
许可协议
- 代码(pipeline/ 和 evaluation/):Apache License 2.0
- 数据集(ChartStyle-100K 和 ChartStyle-Bench):CC BY-SA 4.0
数据加载方式
python from datasets import load_dataset
快速预览(100 个样本)
preview = load_dataset("ChartFoundation/ChartStyle-100k", "preview", split="preview")
完整训练集(100,744 个三元组)
dataset = load_dataset("ChartFoundation/ChartStyle-100k", "train", split="train")





