遇见数据集

certified-document-qa

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

Certified Document QA 是一个经过严格验证的文档问答数据集,其核心特征是每一条数据都附带机器可检查的证书(certificate),允许用户独立验证答案的正确性。数据集专注于两个关键方面:1) **跨度验证(Span-verified)**:对于“needle”类数据,答案必须是给定上下文(context)中精确出现的文本片段,确保抽取式问答的可靠性。2) **缺席感知(Absence-aware)**:对于“absence”类数据,问题针对文档中确实不存在的事实,其黄金答案是“NOT PRESENT IN DOCUMENT”,旨在评估模型诚实弃权(abstention)和避免幻觉的能力。数据集包含多个配置,主要数据来自真实的法律合同(CUAD)、企业电子邮件(Enron)以及最新的美国证券交易委员会(SEC)公开文件。特别地,“fresh”系列配置的数据源文件日期(2026年7月)晚于所有主要大语言模型的训练截止日期,从构造上避免了训练数据污染问题。数据集总规模超过12,800条认证数据,具体包括`needle_public`(3,088条)、`needle_expansion_v120`(1,876条)、`absence_public`(2,889条)、`multihop_public`(12条跨文档推理问题)以及多个按月更新的fresh配置。此外,还提供一个包含127K令牌的已验证长上下文任务演示包(`demo_pack_128K/`)。数据集适用于问答、文本检索、长上下文建模、幻觉检测等任务,尤其适合需要高质量、可验证、无前沿模型内容污染的法律金融领域模型评估与训练。数据集整体采用CC-BY-4.0许可,问题由开源模型生成,验证由专有工具完成,不包含任何前沿模型的输出内容。

创建时间:
2026-07-14
原始信息汇总

数据集概述:Certified Document QA

  • 数据集名称: Certified Document QA: span-verified, absence-aware
  • 发布方: SovNodeAI LLC
  • 许可证: CC-BY-4.0
  • 语言: 英语 (en)
  • 任务类别: 问答 (question-answering),文本检索 (text-retrieval)
  • 标签: 长上下文 (long-context),法律 (legal),金融 (finance),幻觉 (hallucination),弃权 (abstention),已验证 (verified),证书 (certificates)
  • 数据规模: 1K < n < 10K (总计超过12,800条)

核心特性

  • 所有数据点均带有机器可验证的证书:每个数据点都包含一个 certificate 字段,其中包含了跨度验证结果、难度地板探测、缺失事实验证(如适用)、事实唯一性检查、来源语料库、许可证和内容哈希前缀。用户可以独立重新验证每一条数据,无需信任数据集发布者。
  • 零前沿模型生成的token:所有问题均由开源的Apache-2.0许可证的模型生成,并由专有验证工具进行机器验证,不包含任何前沿模型(如GPT-4, Claude等)的衍生内容。
  • 包含新鲜发布的子集:提供来自SEC文件(美国证券交易委员会)的新鲜子集,其发布日期晚于所有主要模型的训练截止日期,确保了数据在训练过程中不可能被污染。

配置与子集

数据集提供多个配置,可通过 load_datasetconfig_name 参数加载:

配置名称 数据文件 描述
needle_public data/needle_public.jsonl 3,088条,稀有事实的抽取式问答(needle in a haystack),答案均为原文中的连续跨度,可独立重验证。
needle_expansion_v120 data/needle_expansion_v120.jsonl 1,876条,基于1,876个不同源文档的跨度基础问答扩展,每个新行都通过了归一化单次出现、清晰无上下文难度、证书、许可证和跨运行去重等门槛。
multihop_public data/multihop_public.jsonl 12条,跨文档问题,通过认证协议v1.5.2+,包含读者级依赖门、世界知识地板探测等严格验证。
absence_public data/absence_public.jsonl 2,889条,认证缺失项:关于文档中不包含的合理事实的问题,正确答案是诚实的弃权。
needle_fresh_teaser data/needle_fresh_teaser.jsonl 25条,来自SEC文件(2026-06-25至2026-07-12),训练数据不可能污染。
absence_fresh_teaser data/absence_fresh_teaser.jsonl 25条,来自SEC文件(2026-06-25至2026-07-12),训练数据不可能污染。
needle_fresh_20260719 data/needle_fresh_20260719.jsonl 300条,来自2026-07-16至2026-07-18的SEC文件。
absence_fresh_20260719 data/absence_fresh_20260719.jsonl 177条,来自2026-07-16至2026-07-18的SEC文件。
multihop_fresh_20260719 data/multihop_fresh_20260719.jsonl 2条,由双重签名的跨文档推理数据点。
needle_fresh_20260721 data/needle_fresh_20260721.jsonl 2,344条跨度验证行,来自2026年7月1日至13日的SEC文件。
absence_fresh_20260721 data/absence_fresh_20260721.jsonl 2,085条经过筛选的不可回答行,来自2026年7月1日至13日的SEC文件。
multihop_fresh_20260721 data/multihop_fresh_20260721.jsonl 4条,通过了一个强阅读器和独立对抗性第二次阅读的双重签名跨文档行。

附加资源

  • demo_pack_128K/: 一个免费的127K token的已验证长上下文任务集,由一个来自训练截止日期后的SEC文件的打包上下文和7个经过认证的问题组成。

使用示例(Python)

python from datasets import load_dataset

加载公共needle(稀有事实问答)和absence(缺失项)子集

absence = load_dataset("SovNodeAI/certified-document-qa", "absence_public", split="train") needle = load_dataset("SovNodeAI/certified-document-qa", "needle_public", split="train")

验证needle行:答案必须出现在上下文中

row = needle[0] assert row["answer"] in row["context"]

验证absence行:证书中记录的缺失事实不在上下文中

row = absence[0] fact = row["certificate"]["probes"]["absent_fact"] assert fact.lower() not in row["context"].lower()

数据来源与许可

  • 合同: CUAD (CC-BY-4.0, Atticus Project)
  • 邮件: FERC Enron语料库 (公共记录)
  • 新鲜文件: SEC EDGAR (公共可访问, 符合SEC公平访问指南)
  • 问题生成模型: Apache-2.0许可的开源权重模型
  • 验证工具: 专有的机器验证工具

适用人群

  • 评估团队: 需要未受污染、可进行基准测试的数据集。
  • 后训练团队: 需要经过认证的、数据来源清晰的、可用于反幻觉训练的数据。
  • 长上下文构建者: 需要已验证的长上下文任务集。

联系信息

  • 关于数据集、认证、付费新鲜层级、RL环境: admin1@sovnode.ai 或 contact@sovnodeai.com
搜集汇总
数据集介绍
certified-document-qa 数据集图片
构建方式
Certified-Document-QA数据集的构建遵循一套严谨的自动化生产管线,涵盖语料获取、问题生成、确定性门控验证与缺席筛查等环节。其中,needle与absence类别分别针对“稀有事实抽取”与“可验证的事实缺席”场景,其构建流程每一阶段均被哈希记录并公布审计日志。以v1.4.0版本为例,新批次从4855条初始行开始,经过线内硬标记剔除、独立二次验证以及近重复清洗,最终仅保留433条合格样本。多跳(multihop)类别更引入强弱双角色签名机制,1300余次生成尝试中最终仅12条通过全部门控,严格确保每一条样本均携带可独立重验的数字证书。
特点
该数据集最鲜明的特质在于所有样本均附有机器可核查的证书(certificate),允许任何用户逐条验证答案真实性,无需信任发布方。needle类别要求答案在上下文中逐字匹配,而absence类别则通过探针事实(absent_fact)的严格缺席判定来标注不可回答项,每一条均通过上下文小写化扫描确认缺失。此外,数据集包含大量发布于主流模型训练截止日期之后的全新语料片段(如2026年7月的SEC文件),从源头杜绝了数据污染。多跳样本则额外经读者级依赖检测与世界知识地板探针,确保跨文档推理的不可猜测性。
使用方法
研究者可通过HuggingFace datasets库便捷加载不同配置,例如使用load_dataset('SovNodeAI/certified-document-qa', 'needle_public', split='train')获取needle数据。对于datasets 4.3以上版本因Json特征解析错误的情况,建议直接读取JSONL文件的完整URL链接。使用时可利用每行自带的certificate字段进行零信任审计:needle样本需确保answer在context中出现,absence样本需验证certificate.probes.absent_fact不在context中。该数据集特别适用于评估模型的长上下文理解能力、幻觉抑制能力以及诚实拒绝机制,并支持在多轮训练和RL环境中作为确定性奖励信号源。
背景与挑战
背景概述
Certified Document QA数据集由SovNodeAI LLC于2026年7月发布,专注于长上下文、法律与金融领域的文档级问答与文本检索。其核心研究问题在于构建一个可独立验证的基准,以应对大规模语言模型在复杂文档推理中的幻觉与错误回答问题。该数据集不仅提供超过12,800个经机器可重验证的条目,还率先引入事后截止日期(post-cutoff)的SEC文件片段,确保评估数据免于训练数据污染。通过每项条目附带的‘证书’(certificate)机制,该数据集在可审计性与透明度上树立了新标准,对评估长上下文模型可靠性、以及推动开源可验证数据集的范式具有显著影响力。
当前挑战
该数据集主要解决两大挑战。其一,领域问题层面,现有问答基准缺乏对模型幻觉的系统性检测,尤其是当问题不包含答案(absence)时,模型常产生无依据的编造。数据集通过引入经逐条验证的‘无答案’条目,使模型诚实弃权(abstention)成为可测量的指标。其二,构建过程中的挑战极为严苛:每一行数据均需经过严格的多重验证管线,包括语义跨度验证、无上下文难度探测、跨文档双签名审计等。例如,多跳问答的生成漏斗仅从约1,300条候选条目中筛选出12条通过认证,且需对抗性重读审计;任何条目的修改痕迹皆通过哈希链完整保留,以保障不可抵赖性。
常用场景
经典使用场景
Certified Document QA数据集的核心应用在于对长文本场景下的开放域问答系统进行量化测评与诊断。该数据集精心设计了Needle(基于真实合同与商业邮件的精确片段定位问答)与Absence(基于文档中可验证不存在的合理事实,要求模型诚实弃答)两大核心子集。其独特之处在于每一条数据都附带了机器可复核的认证证书,研究者能够独立验证模型输出的正确性。尤为特别的是,数据集持续引入新鲜证券交易委员会(SEC)公开文件构建最新评测集,这些文件的时间戳甚至晚于所有主流大模型的训练截止日期,从而彻底杜绝了数据污染造成的评测干扰。
衍生相关工作
该数据集的发布催生了一系列围绕大语言模型忠实性与事实性保障的前沿探索。最为典型的衍生工作体现在对模型评测范式的反思与革新,该数据集首创的支持感知的回顾性评审(Support-aware Re-audit)方法论已被社区采纳,多个研究团队仿照其三元组评分框架重新审视了此前基于固定模式匹配的幻觉率指标,发现了大量被误判的上下文支持性回答,从而修正了对多个主流大模型能力的认知。同时,数据集内嵌的机器认证证书与哈希绑定审计链机制,激励了针对可验证数据集构建流程的规范化研究。更有团队基于其多跳问答子集开发了确定性分段级奖励(Span-level Reward)的文档推理强化学习环境,此举将文档问答从传统的精准评估延伸至模型训练与自我纠错的前沿地带,推动了证据驱动的智能体与训练框架的蓬勃发展。
数据集最近研究
最新研究方向
在长上下文文档理解与可信赖问答领域,Certified Document QA数据集开创性地引入了机器可验证的逐项认证机制,并特别聚焦于可证实的答案缺失检测。当前前沿研究方向集中于构建对抗性审核与双重签名协议以提升跨文档多跳推理的鲁棒性,同时采用支持感知的三元评分体系替代传统二值化幻觉评估,以揭示模型在世界知识与事实捏造之间的微妙界限。该数据集通过持续发布晚于所有主流模型训练截止日期的最新证券备案文件,彻底杜绝了数据污染可能,为评估和微调提供了一方不可侵蚀的净土,其意义在于定义了一种可独立复现、无需信任中介的数据质量与模型行为量化的新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务