遇见数据集

provbench

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

ProvBench 是 GSPC(全球安全与性能基准)框架中关于来源(provenance)的评估轴,专注于测试 AI 模型对 C2PA 数字内容来源清单存续性的分类能力。数据集包含 15 个样本,每个样本被标注为“DESTROYED”(已销毁)或“SURVIVES”(存续),属于文本分类任务。该数据集由 CSOAI Ltd 发布,采用 Apache-2.0 许可证。数据集规模极小(n<1K),旨在作为衡量 AI 模型在来源信息可信度方面表现的工具,但因其可用项数较低(usable_n=7),目前尚不足以发布可靠的置信区间。

ProvBench is a provenance-focused evaluation axis under the GSPC (Global Security and Performance Benchmark) framework, which specializes in testing AI models' capability to classify the persistence of C2PA digital content provenance manifests. This dataset consists of 15 samples, each annotated with either "DESTROYED" or "SURVIVES", belonging to the text classification task domain. It is released by CSOAI Ltd. under the Apache-2.0 license. With an extremely small scale (n<1K), this dataset is intended as a tool for measuring AI models' performance regarding the credibility of provenance information. However, due to its low number of usable samples (usable_n=7), it is currently insufficient to publish reliable confidence intervals.

创建时间:
2026-08-03
原始信息汇总

ProvBench 数据集详情

基本信息

  • 名称:ProvBench — C2PA manifest survival(provenance 轴,GSPC)
  • 许可证:Apache-2.0
  • 语言:英语
  • 任务类别:文本分类
  • 数据规模:n < 1K(15 个条目)
  • 发布机构:CSOAI Ltd(英国公司编号 16939677),独立 AI 测量机构
  • DOI10.5281/zenodo.21755657

数据集内容

  • 主题:评估 C2PA 清单(C2PA manifest)的存续情况
  • 标签及分布:
    • DESTROYED:8 条
    • SURVIVES:7 条
  • 总分:15 个条目
  • 该数据集是 GSPC 工具的六个轴之一,每个轴对应一个基准测试

性能测量(基于 30 个模型,参数量 494M 至 20B,三种架构)

统计量 数值 含义
平均难度 0.562 正确回答条目的模型比例
区分度跨度(最大−最小) 0.400 最佳模型与最差模型的分离程度
无效条目(dead items) 5 / 15 所有模型均通过或均未通过的条目,无信息量
负向区分条目 3 整体更好的模型表现更差的条目,已进入仲裁而非删除
有效样本量(usable n) 7 既非无效也无负向区分的条目数
可引用性 (低于 usable_n ≥ 30) 是否应发布该轴的 95% 区间
  • 该轴尚未饱和:区分度跨度 0.400 表明能分离模型,但 usable_n = 7 时无法支撑有报告价值的差异(95% Wilson 区间需 usable_n ≥ 30 才能收窄至 ±0.169)
  • 无效条目计数仅在 N > 19 个模型时可信;本次运行在 N = 30 下认证

分数解读规则

  • 三种结果,而非两种:measured / unmeasured / failed。无法评分的生成标记为 UNMEASURED,不计分且不视为错误答案
  • 报告 usable_n 而非 n:避免条目部分无效时夸大证据量
  • 区间优先于点估计:95% 区间重叠的比较均标记为 NOT_RESOLVED
  • 测量而非认证:分数带为描述性,监管判定由权威机构保留

已知局限性

  • 无前沿评判模型验证,评分采用精确标签或经 98.9% 验证的拒绝检测器(基于 92 条人工标注响应,单一标注者,无交叉标注者一致性)
  • 条目难度是“条目 × 模型群”的属性,而非条目本身的属性;若模型群偏重小模型,难度结论反映的是该模型群
  • 在当前模型群规模下,条目区分度仅为估计值,尚未最终确定

来源:Hugging Face 数据集页面 | 卡片许可:CC-BY-4.0,条目集许可:Apache-2.0

搜集汇总
数据集介绍
provbench 数据集图片
构建方式
ProvBench数据集源于全球安全与合规基准(GSPC)框架下的来源轴,由CSOAI Ltd构建,聚焦于C2PA清单的存活性评估。该数据集包含15个精心设计的测试项,每个项目均基于冻结的语料锚定基础事实进行评分,标注为DESTROYED或SURVIVES,分别对应清单被破坏或存续的情形。构建过程严格遵循测量科学原则,排除了死项和负向区分项,最终保留7个有效项,确保了数据集的严谨性与可靠性。
使用方法
使用ProvBench时,研究人员需依据其三态评分规则解读模型输出,即仅有明确匹配标签的响应才计为正确,未分级生成标记为UNMEASURED且不计分。报告结果时应优先呈现usable_n而非原始n,并采用置信区间进行点估计比较,若区间重叠则判定为NOT_RESOLVED。该基准明确禁止将其用于合规认证,仅作为描述性测量工具。用户可通过Hugging Face或Kaggle平台访问数据集,并结合GSPC其他轴(如治理、安全等)构建综合评估体系。
背景与挑战
背景概述
ProvBench作为GSPC(通用系统性能综合基准)的溯源轴,由英国独立AI测量机构CSOAI Ltd于2026年发布,旨在评估AI模型对C2PA内容凭证清单存续性的判断能力。该基准根植于欧盟《人工智能法案》对内容溯源与透明性的监管要求,聚焦于模型在数字内容来源验证中的表现,弥补了现有基准在溯源维度上的空白。其核心研究问题在于量化不同规模与架构的模型(494M至20B参数,涵盖三种架构)对C2PA清单存续状态的判别准确性,以支撑AI治理中的可追溯性测量。ProvBench的发布为AI治理领域提供了标准化的测量工具,推动了溯源能力评估从定性描述向定量分析的转变,对相关学术研究与政策制定具有重要参考价值。
当前挑战
ProvBench面临的挑战主要体现在领域问题和构建过程两个层面。领域问题方面,溯源评估的复杂性源于C2PA清单在模型处理中的脆弱性,当前基准的可用项数仅为7(低于30的最低标准),导致95%置信区间无法收窄至±0.169,无法可靠区分模型性能,且存在5个死项和3个负判别项,虽经仲裁保留,却削减了测量效能。构建过程中,挑战在于缺乏前沿审判者验证,评分依赖精确标签或经98.9%准确率验证的拒绝检测器(基于92条人工标注,单一标注者无一致性检验);此外,项目难度受模型群组特征影响,当前群组偏向小模型,难度判定反映的是群组而非项目本身,且判别能力在现有群组规模下仅是估计值,而非确定值,这些均限制了基准的鲁棒性与推广性。
常用场景
经典使用场景
ProvBench 作为 GSPC 仪器中溯源轴的核心基准,专注于评测 AI 模型对 C2PA 内容来源清单(manifest)存续性的判别能力。该数据集包含 15 个精心构造的测试项,每个项标注为 `DESTROYED` 或 `SURVIVES`,旨在检验模型能否准确识别数字内容中嵌入的溯源信息是否在传播、转换或生成过程中得以保留。经典使用方式为:在固定语料库锚定的基准下,对模型输出进行精确标签匹配或基于拒绝检测器的评分,从而量化模型在溯源完整性判断上的表现。研究者通常借助该基准开展跨模型比较,分析不同架构、不同参数规模(从 494M 到 20B)的模型在此任务上的能力差异,并依据难度、区分度等统计指标筛选有效测试项,为 AI 治理中溯源可靠性的度量提供标准化工具。
解决学术问题
该数据集直面生成式人工智能时代内容溯源验证的科学挑战,解决了学术界缺乏统一、可量化基准来评估模型对 C2PA 标准溯源信息感知能力的问题。通过引入严格的测量方法论,ProvBench 首先区分了“已测量”“未测量”“已失败”三种结果,避免将模型无法生成的可评分输出误判为错误,提高了评估的公平性。其次,它强调报告 'usable_n' 而非表面样本量 n,并利用 95% Wilson 置信区间判断模型间差异是否具有统计显著性,有效避免了因死项(dead items)或负区分度项导致的误导性结论。这一严谨的评估框架为 AI 溯源能力研究提供了统计学基础,推动了可重复、可比较的实证研究,并促进了 EU AI Act 等监管框架下对溯源声明的科学验证。
实际应用
在实际应用中,ProvBench 可作为内容真实性验证系统的重要评测组件。媒体机构、社交平台及数字内容分发商可利用该基准测试其部署的 AI 模型能否有效识别 C2PA 清单在图像、视频或文本编辑后是否存活,从而决定是否信任该内容的来源声明。对于开发内容来源检测工具的企业,ProvBench 提供了一套标准化测试集,用以验证产品在对抗性篡改场景下的鲁棒性,优化模型对溯源元数据完整性的敏感度。此外,监管科技公司可借鉴其测量框架,构建符合 EU AI Act 高风险 AI 系统要求的评估流程,确保系统输出的可追溯性。该数据集还支持模型迭代中的回归测试,帮助工程师在更新模型时快速评估对溯源判断能力的影响,保障实际部署中的可靠性。
数据集最近研究
最新研究方向
在AI治理与内容溯源的前沿探索中,ProvBench作为GSPC框架下的溯源轴心,聚焦于C2PA(内容来源与真实性联盟)凭证在模型处理下的存续性评估。该数据集为15个精筛项目,跨越30个模型(参数规模从4.94亿至200亿),揭示出模型对来源凭证的破坏与保留倾向,其测量难度均值达0.562,区分度达0.400,虽尚未达到可引用的统计阈值,却为欧盟《人工智能法案》下的来源透明度义务提供了实证参照。当前研究趋势强调模型行为的可量化治理,通过死项目与负向区分项的审查,推动基准测试从简单的正确率迈向测量严谨性的提升,为AI可追溯性标准的制定奠定了数据驱动的基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务