ProvTales
收藏资源简介:
ProvTales 是首个大规模用于将可视化探索历史(溯源图)转换为连贯数据叙事的基准数据集。该数据集包含 22,560 个溯源图与数据叙事对(11,280 个受限版本和 11,280 个非受限版本),这些数据对源自 16 个不同领域的 365 个真实世界表格数据集。数据集采用“叙事优先,图其次”的构建流程:首先通过主题规划、蓝图设计和利用大型语言模型(LLMs)进行数据事实实例化,从真实表格数据生成目标叙事;随后围绕这些叙事反向合成溯源图,通过引入模拟真实探索行为的辅助非叙事节点。数据集适用于溯源图关键叙事提取、数据叙事生成、视觉分析等任务。
ProvTales 数据集概述
数据集基本信息
- 数据集名称:ProvTales
- 简介:首个用于将可视化探索历史(溯源图)转换为连贯数据叙事的大规模基准数据集。
- 数据量:包含 22,560 个溯源图-数据叙事对(11,280 个受限设置 + 11,280 个非受限设置)。
- 数据源:源自 16 个不同领域的 365 个真实世界表格数据集。
- 构建方法:遵循 叙事优先,图其次 的构建流程。首先通过主题规划、蓝图设计和利用大语言模型进行数据事实实例化,从真实表格数据生成目标叙事;随后围绕这些叙事,通过引入模拟真实探索行为的辅助非叙事节点,反向合成溯源图。
- 许可证:cc-by-4.0
- 语言:英语 (en)
- 规模类别:10K<n<100K
数据集结构
数据集仓库包含以下文件夹:
ProvTales/ ├── data/ # 源表格数据集 (CSV格式) ├── data_summary/ # 源表的模式概要和统计摘要 ├── topics/ # 主题规划输出(每个数据集的叙事主题) ├── storyline/ # 完整的叙事序列(有序的数据事实节点) ├── datafact/ # 实例化的数据事实节点及节点间的语义关系 └── graph/ # 溯源图(节点 + 边,包含受限和非受限设置)
关键组件说明
- 图表图像:在
graph/文件夹中,每个数据事实节点都渲染为符合 Vega-Lite 规范的 PNG 图表图像。由于文件大小和上传限制,渲染的 PNG 图表单独托管在 ModelScope — ProvTales_Chart。 - 溯源图设置:提供两种设置的溯源图:
- 非受限设置:
graph/G - 受限设置:
graph/GT(共享相同的节点/边格式,但包含额外的意图信息)
- 非受限设置:
构建流程示例
以示例数据集 cleaned_Chess games stats.csv(领域:体育)中的一个主题为例,展示从原始数据到溯源图的完整构建阶段。
1. 原始数据与模式概要
- 源数据文件:cleaned_Chess games stats.csv
- 数据摘要:包含文件基本信息、总行数(500行)及各列(如
White Rating,Black Rating等)的数据类型、唯一值数量、样本和统计信息(最小值、最大值、标准差等)。
2. 叙事构建
阶段一:主题规划
为数据规划多个叙事主题。示例主题意图为探索玩家技能(白方和黑方评分)与走棋准确性(厘兵损失)之间的宏观相关性。
阶段二:蓝图规划
为每个主题设计叙事蓝图,包括选择叙事结构(如“因果线性”)、推理过程、叙事目标和详细的蓝图模板。蓝图模板描述了从介绍数据背景到得出最终结论的完整叙事流,并嵌入了数据事实图表的占位符。
阶段三:叙事实例化
将蓝图中的占位符实例化为具体的数据事实序列。每个数据事实定义了要绘制的图表类型(如散点图、条形图、弧图)、观察的属性、映射关系等。数据事实之间通过语义关系(如“时间顺序”、“并行探索”、“详细阐述”、“聚焦”、“编码切换”)链接,形成有序的叙事链。
3. 溯源图反向构建
基于实例化的数据事实叙事序列,反向合成包含数据事实节点和辅助非叙事节点的溯源图,以模拟真实的探索行为。




