AI Provenance Corpus
收藏资源简介:
一个机器可读的溯源事件语料库,描述了AI辅助产物如何被检索、生成、引用、编辑、验证、评审和发布的过程。该语料库记录过程元数据而非产物内容,适用于研究、基准测试、标准开发、审计、RAG评估、信任建模和溯源图实验。
A machine-readable corpus of provenance events that documents the processes through which AI-assisted outputs are retrieved, generated, cited, edited, validated, reviewed, and published. This corpus records process metadata rather than the content of the outputs, and is applicable to research, benchmarking, standard development, auditing, RAG evaluation, trust modeling, and provenance graph experiments.
数据集概述
AI Provenance Corpus 是一个机器可读的来源事件语料库,用于描述 AI 辅助制品在检索、生成、引用、编辑、验证、审核及发布过程中的历史记录。该语料库记录的是过程元数据而非制品内容,适用于研究、基准测试、标准开发、审计、RAG 评估、信任建模及来源图实验。
设计原则
- 以事件为中心:有意义的行为被表示为仅追加的事件。
- 内容最小化:记录描述制品的产生过程,无需包含制品主体或私有提示。
- 图就绪:稳定的标识符和显式边支持属性图和 RDF 风格转换。
- 验证优先:每个核心实体均遵循 JSON Schema Draft 2020-12 规范。
- 分层结构:合成记录、公开衍生记录、参考记录和研究记录可共存且可区分。
- 可复现:数据集元数据、版本控制、校验和及引用文件支持正式发布。
仓库结构
ai-provenance-corpus/ ├── data/ │ ├── artifacts/artifacts.jsonl │ ├── events/events.jsonl │ ├── sources/sources.jsonl │ └── relationships/graph_edges.jsonl ├── docs/ ├── examples/ ├── schemas/ ├── scripts/ ├── tests/ ├── CITATION.cff ├── LICENSE ├── metadata.json └── pyproject.toml
核心实体
| 实体 | 用途 |
|---|---|
| Artifact | 标识被描述生产历史的制品。 |
| Event | 记录检索、生成、编辑、引用、验证、审核或发布行为。 |
| Source | 描述在检索、引用或验证过程中使用的来源。 |
| Edge | 表达语料库实体之间的图关系。 |
快速开始
需要 Python 3.10 或更高版本。
bash python scripts/validate.py python scripts/build_manifest.py python scripts/export_graph.py --format csv --output build/graph
基础结构检查无需第三方 Python 包。完整的 JSON Schema 验证可通过可选的 validation 依赖实现:
bash python -m pip install -e .[validation] python scripts/validate.py --json-schema
示例来源链
提供的示例追踪一个合成研究简报的完整流程,包括:语义检索、模型生成、引用附加、人工编辑、自动及人工验证、编辑审批、发布。记录有意省略了生成的散文内容。哈希和元数据可用于将记录绑定到外部制品,而无需重新分发这些制品。
数据集分层
每个制品和事件均包含 dataset_layer 值:
synthetic:专门构建的测试或基准记录;public:从公开可观察工作流中衍生的记录;reference:精心策划的规范示例;research:通过记录在案的研究协议收集的记录。
信任与置信度字段
置信度值为可选的观测结果,而非真实性声明。模式支持检索、引用、验证、编辑和整体维度。生产者应记录每个分数是如何计算的,在未进行校准的情况下不应跨不同采集协议比较数值。
标识符策略
标识符是带有类型前缀的不透明字符串:
art_用于制品evt_用于事件src_用于来源agt_用于参与者或代理edge_用于关系
标识符在已发布版本内及版本间应保持稳定。
隐私与许可
不得包含私有提示、个人信息、专有源文本、凭据或模型秘密。在需要内容绑定时,应使用哈希、受控词汇表和外部引用。仓库代码和模式依据 Apache-2.0 许可。除非版本另有说明,否则数据集记录依据 CC0-1.0 贡献。来源元数据不覆盖底层来源附带的权限。
引用
使用 CITATION.cff 中的元数据或正式版本附带的 DOI。在发布前,需替换 CITATION.cff、metadata.json 和 .zenodo.json 中的占位符作者和仓库字段。
状态
这是一个已准备好发布的 v0.1 基础版本,并非声称是全面的真实语料库。包含的记录展示了数据模型、验证工作流及预期的研究用途。




