遇见数据集

AI Provenance Corpus

收藏
github2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

一个机器可读的溯源事件语料库,描述了AI辅助产物如何被检索、生成、引用、编辑、验证、评审和发布的过程。该语料库记录过程元数据而非产物内容,适用于研究、基准测试、标准开发、审计、RAG评估、信任建模和溯源图实验。

A machine-readable corpus of provenance events that documents the processes through which AI-assisted outputs are retrieved, generated, cited, edited, validated, reviewed, and published. This corpus records process metadata rather than the content of the outputs, and is applicable to research, benchmarking, standard development, auditing, RAG evaluation, trust modeling, and provenance graph experiments.

创建时间:
2026-07-19
原始信息汇总

数据集概述

AI Provenance Corpus 是一个机器可读的来源事件语料库,用于描述 AI 辅助制品在检索、生成、引用、编辑、验证、审核及发布过程中的历史记录。该语料库记录的是过程元数据而非制品内容,适用于研究、基准测试、标准开发、审计、RAG 评估、信任建模及来源图实验。

设计原则

  • 以事件为中心:有意义的行为被表示为仅追加的事件。
  • 内容最小化:记录描述制品的产生过程,无需包含制品主体或私有提示。
  • 图就绪:稳定的标识符和显式边支持属性图和 RDF 风格转换。
  • 验证优先:每个核心实体均遵循 JSON Schema Draft 2020-12 规范。
  • 分层结构:合成记录、公开衍生记录、参考记录和研究记录可共存且可区分。
  • 可复现:数据集元数据、版本控制、校验和及引用文件支持正式发布。

仓库结构

ai-provenance-corpus/ ├── data/ │ ├── artifacts/artifacts.jsonl │ ├── events/events.jsonl │ ├── sources/sources.jsonl │ └── relationships/graph_edges.jsonl ├── docs/ ├── examples/ ├── schemas/ ├── scripts/ ├── tests/ ├── CITATION.cff ├── LICENSE ├── metadata.json └── pyproject.toml

核心实体

实体 用途
Artifact 标识被描述生产历史的制品。
Event 记录检索、生成、编辑、引用、验证、审核或发布行为。
Source 描述在检索、引用或验证过程中使用的来源。
Edge 表达语料库实体之间的图关系。

快速开始

需要 Python 3.10 或更高版本。

bash python scripts/validate.py python scripts/build_manifest.py python scripts/export_graph.py --format csv --output build/graph

基础结构检查无需第三方 Python 包。完整的 JSON Schema 验证可通过可选的 validation 依赖实现:

bash python -m pip install -e .[validation] python scripts/validate.py --json-schema

示例来源链

提供的示例追踪一个合成研究简报的完整流程,包括:语义检索、模型生成、引用附加、人工编辑、自动及人工验证、编辑审批、发布。记录有意省略了生成的散文内容。哈希和元数据可用于将记录绑定到外部制品,而无需重新分发这些制品。

数据集分层

每个制品和事件均包含 dataset_layer 值:

  • synthetic:专门构建的测试或基准记录;
  • public:从公开可观察工作流中衍生的记录;
  • reference:精心策划的规范示例;
  • research:通过记录在案的研究协议收集的记录。

信任与置信度字段

置信度值为可选的观测结果,而非真实性声明。模式支持检索、引用、验证、编辑和整体维度。生产者应记录每个分数是如何计算的,在未进行校准的情况下不应跨不同采集协议比较数值。

标识符策略

标识符是带有类型前缀的不透明字符串:

  • art_ 用于制品
  • evt_ 用于事件
  • src_ 用于来源
  • agt_ 用于参与者或代理
  • edge_ 用于关系

标识符在已发布版本内及版本间应保持稳定。

隐私与许可

不得包含私有提示、个人信息、专有源文本、凭据或模型秘密。在需要内容绑定时,应使用哈希、受控词汇表和外部引用。仓库代码和模式依据 Apache-2.0 许可。除非版本另有说明,否则数据集记录依据 CC0-1.0 贡献。来源元数据不覆盖底层来源附带的权限。

引用

使用 CITATION.cff 中的元数据或正式版本附带的 DOI。在发布前,需替换 CITATION.cffmetadata.json.zenodo.json 中的占位符作者和仓库字段。

状态

这是一个已准备好发布的 v0.1 基础版本,并非声称是全面的真实语料库。包含的记录展示了数据模型、验证工作流及预期的研究用途。

搜集汇总
数据集介绍
AI Provenance Corpus 数据集图片
构建方式
AI Provenance Corpus是一个以事件为中心的机器可读语料库,其构建遵循若干严谨的设计原则。数据采用仅追加的事件记录模型,聚焦于描述AI辅助工件的获取、生成、引用、编辑、验证、审校与发布等过程元数据,而非工件内容本身。核心实体包括工件、事件、来源和边,每类实体均受JSON Schema Draft 2020-12约束。仓库通过分层机制融合合成、公开衍生、参考和研究四类记录,并借助稳定标识符与显式边支持属性图及RDF转换。所有记录均附带数据集层标识符,便于区分与溯源。
特点
该数据集的核心特色在于其内容最小化与图就绪特性。记录仅描述工件的产生流程,避免包含私有提示或敏感信息,因而在保护隐私的同时支持审计与信任建模。事件记录涵盖从检索到发布的完整生命周期,并可选嵌入检索、引用、验证等多维度置信度字段,为RAG评估与溯源图实验提供基准。此外,严格的版本管理、校验和与引用文件保障了正式发布的可重现性,而层级化设计使得不同来源的记录共存且可区分。
使用方法
使用该数据集需Python 3.10及以上环境。基础操作通过内置脚本实现:执行validate.py进行结构验证,build_manifest.py生成清单,export_graph.py可导出为CSV等图格式。为启用完整JSON Schema验证,需安装可选依赖validation。记录可通过稳定标识符与外部工件绑定,而隐私与授权指南要求仅使用哈希与受控词汇进行内容关联。用户可依据CITATION.cff引用正式版本,并在发布前更新元数据文件中的作者与仓库字段。
背景与挑战
背景概述
随着大型语言模型与生成式人工智能的广泛部署,AI辅助产出物的可信度与可追溯性成为关键研究议题。由多机构联合开发的AI Provenance Corpus数据集应运而生,旨在以机器可读的形式记录AI辅助工件的检索、生成、编辑、验证与发布等全生命周期溯源事件。该数据集遵循事件中心、内容最小化与面向图结构的设计原则,采用分层架构容纳合成、公开推导、参考与研究四类记录,为AI系统的审计、RAG评估、信任建模及溯源图实验提供了标准化的基准资源。其通过稳定标识符、JSON Schema校验与可复现的元数据管理,推动了AI溯源领域的规范化研究。
当前挑战
当前该数据集面临的核心挑战在于领域问题的复杂性与构建过程的严苛性。在领域层面,AI生成内容的溯源需要区分人类编辑与模型自动操作的混合贡献,同时避免泄露私有提示或敏感信息,这对事件粒度的界定与隐私保护机制提出了高要求。在构建过程中,如何确保跨机构、跨协议的溯源记录在置信度评分上具备可比性,以及如何在分层数据集中维持实体间关系的一致性,仍是亟待突破的难点。此外,由于人工标注代价高昂且自动化提取可能引入偏差,验证工作流的可扩展性与数据集的真实世界覆盖度之间的平衡构成了持续的技术挑战。
常用场景
经典使用场景
在人工智能与数据治理交叉领域中,AI Provenance Corpus被经典地用于构建与验证AI辅助产物的全生命周期溯源图谱。研究人员通过该语料库中标准化的合成与参考记录层,设计并评估追踪AI生成内容从检索、生成到发布各环节的图形模型。其事件中心与图就绪的数据结构,使其尤其适合作为基准数据集,用以比较不同溯源算法在属性图与RDF表示下的性能与兼容性,从而推动溯源数据表示与查询技术的规范化发展。
实际应用
在实际部署中,AI Provenance Corpus为内容审核平台、RAG系统评估工具链以及AI生成物合规审计框架提供了标准化的数据底座。例如,在新闻报道与学术出版领域,该语料库可用于验证AI辅助稿件从源引用到编辑批准的完整血统,从而支持可追溯的责任归属声明。此外,其在企业级知识管理系统中的应用,能够实现智能体间协作历史的透明化记录,辅助管理者识别流程瓶颈或验证置信度衰减模式,进而优化人机协同的决策流水线。
衍生相关工作
围绕该语料库,学界已开展了多项衍生工作:在表示学习方向,研究者基于其图边数据设计了面向溯源事件嵌入的对比学习框架;在系统工具方向,出现了利用其合成层记录进行RAG管道端到端审计的开源方案;在标准化方向,其JSON Schema定义与图谱导出脚本被采纳为若干领域内私有溯源协议互操作的参考实现。这些工作共同丰富了AI溯源生态,使得语料库从单纯的数据集演化为连接理论验证与工程实践的枢纽性工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务