certified-document-qa
收藏资源简介:
Certified Document QA 是一个经过严格验证的文档问答数据集,其核心特征是每一条数据都附带机器可检查的证书(certificate),允许用户独立验证答案的正确性。数据集专注于两个关键方面:1) **跨度验证(Span-verified)**:对于“needle”类数据,答案必须是给定上下文(context)中精确出现的文本片段,确保抽取式问答的可靠性。2) **缺席感知(Absence-aware)**:对于“absence”类数据,问题针对文档中确实不存在的事实,其黄金答案是“NOT PRESENT IN DOCUMENT”,旨在评估模型诚实弃权(abstention)和避免幻觉的能力。数据集包含多个配置,主要数据来自真实的法律合同(CUAD)、企业电子邮件(Enron)以及最新的美国证券交易委员会(SEC)公开文件。特别地,“fresh”系列配置的数据源文件日期(2026年7月)晚于所有主要大语言模型的训练截止日期,从构造上避免了训练数据污染问题。数据集总规模超过12,800条认证数据,具体包括`needle_public`(3,088条)、`needle_expansion_v120`(1,876条)、`absence_public`(2,889条)、`multihop_public`(12条跨文档推理问题)以及多个按月更新的fresh配置。此外,还提供一个包含127K令牌的已验证长上下文任务演示包(`demo_pack_128K/`)。数据集适用于问答、文本检索、长上下文建模、幻觉检测等任务,尤其适合需要高质量、可验证、无前沿模型内容污染的法律金融领域模型评估与训练。数据集整体采用CC-BY-4.0许可,问题由开源模型生成,验证由专有工具完成,不包含任何前沿模型的输出内容。
数据集概述:Certified Document QA
- 数据集名称: Certified Document QA: span-verified, absence-aware
- 发布方: SovNodeAI LLC
- 许可证: CC-BY-4.0
- 语言: 英语 (en)
- 任务类别: 问答 (question-answering),文本检索 (text-retrieval)
- 标签: 长上下文 (long-context),法律 (legal),金融 (finance),幻觉 (hallucination),弃权 (abstention),已验证 (verified),证书 (certificates)
- 数据规模: 1K < n < 10K (总计超过12,800条)
核心特性
- 所有数据点均带有机器可验证的证书:每个数据点都包含一个
certificate字段,其中包含了跨度验证结果、难度地板探测、缺失事实验证(如适用)、事实唯一性检查、来源语料库、许可证和内容哈希前缀。用户可以独立重新验证每一条数据,无需信任数据集发布者。 - 零前沿模型生成的token:所有问题均由开源的Apache-2.0许可证的模型生成,并由专有验证工具进行机器验证,不包含任何前沿模型(如GPT-4, Claude等)的衍生内容。
- 包含新鲜发布的子集:提供来自SEC文件(美国证券交易委员会)的新鲜子集,其发布日期晚于所有主要模型的训练截止日期,确保了数据在训练过程中不可能被污染。
配置与子集
数据集提供多个配置,可通过 load_dataset 的 config_name 参数加载:
| 配置名称 | 数据文件 | 描述 |
|---|---|---|
needle_public |
data/needle_public.jsonl |
3,088条,稀有事实的抽取式问答(needle in a haystack),答案均为原文中的连续跨度,可独立重验证。 |
needle_expansion_v120 |
data/needle_expansion_v120.jsonl |
1,876条,基于1,876个不同源文档的跨度基础问答扩展,每个新行都通过了归一化单次出现、清晰无上下文难度、证书、许可证和跨运行去重等门槛。 |
multihop_public |
data/multihop_public.jsonl |
12条,跨文档问题,通过认证协议v1.5.2+,包含读者级依赖门、世界知识地板探测等严格验证。 |
absence_public |
data/absence_public.jsonl |
2,889条,认证缺失项:关于文档中不包含的合理事实的问题,正确答案是诚实的弃权。 |
needle_fresh_teaser |
data/needle_fresh_teaser.jsonl |
25条,来自SEC文件(2026-06-25至2026-07-12),训练数据不可能污染。 |
absence_fresh_teaser |
data/absence_fresh_teaser.jsonl |
25条,来自SEC文件(2026-06-25至2026-07-12),训练数据不可能污染。 |
needle_fresh_20260719 |
data/needle_fresh_20260719.jsonl |
300条,来自2026-07-16至2026-07-18的SEC文件。 |
absence_fresh_20260719 |
data/absence_fresh_20260719.jsonl |
177条,来自2026-07-16至2026-07-18的SEC文件。 |
multihop_fresh_20260719 |
data/multihop_fresh_20260719.jsonl |
2条,由双重签名的跨文档推理数据点。 |
needle_fresh_20260721 |
data/needle_fresh_20260721.jsonl |
2,344条跨度验证行,来自2026年7月1日至13日的SEC文件。 |
absence_fresh_20260721 |
data/absence_fresh_20260721.jsonl |
2,085条经过筛选的不可回答行,来自2026年7月1日至13日的SEC文件。 |
multihop_fresh_20260721 |
data/multihop_fresh_20260721.jsonl |
4条,通过了一个强阅读器和独立对抗性第二次阅读的双重签名跨文档行。 |
附加资源
- demo_pack_128K/: 一个免费的127K token的已验证长上下文任务集,由一个来自训练截止日期后的SEC文件的打包上下文和7个经过认证的问题组成。
使用示例(Python)
python from datasets import load_dataset
加载公共needle(稀有事实问答)和absence(缺失项)子集
absence = load_dataset("SovNodeAI/certified-document-qa", "absence_public", split="train") needle = load_dataset("SovNodeAI/certified-document-qa", "needle_public", split="train")
验证needle行:答案必须出现在上下文中
row = needle[0] assert row["answer"] in row["context"]
验证absence行:证书中记录的缺失事实不在上下文中
row = absence[0] fact = row["certificate"]["probes"]["absent_fact"] assert fact.lower() not in row["context"].lower()
数据来源与许可
- 合同: CUAD (CC-BY-4.0, Atticus Project)
- 邮件: FERC Enron语料库 (公共记录)
- 新鲜文件: SEC EDGAR (公共可访问, 符合SEC公平访问指南)
- 问题生成模型: Apache-2.0许可的开源权重模型
- 验证工具: 专有的机器验证工具
适用人群
- 评估团队: 需要未受污染、可进行基准测试的数据集。
- 后训练团队: 需要经过认证的、数据来源清晰的、可用于反幻觉训练的数据。
- 长上下文构建者: 需要已验证的长上下文任务集。
联系信息
- 关于数据集、认证、付费新鲜层级、RL环境: admin1@sovnode.ai 或 contact@sovnodeai.com




