provbench
收藏资源简介:
ProvBench 是 GSPC(全球安全与性能基准)框架中关于来源(provenance)的评估轴,专注于测试 AI 模型对 C2PA 数字内容来源清单存续性的分类能力。数据集包含 15 个样本,每个样本被标注为“DESTROYED”(已销毁)或“SURVIVES”(存续),属于文本分类任务。该数据集由 CSOAI Ltd 发布,采用 Apache-2.0 许可证。数据集规模极小(n<1K),旨在作为衡量 AI 模型在来源信息可信度方面表现的工具,但因其可用项数较低(usable_n=7),目前尚不足以发布可靠的置信区间。
ProvBench is a provenance-focused evaluation axis under the GSPC (Global Security and Performance Benchmark) framework, which specializes in testing AI models' capability to classify the persistence of C2PA digital content provenance manifests. This dataset consists of 15 samples, each annotated with either "DESTROYED" or "SURVIVES", belonging to the text classification task domain. It is released by CSOAI Ltd. under the Apache-2.0 license. With an extremely small scale (n<1K), this dataset is intended as a tool for measuring AI models' performance regarding the credibility of provenance information. However, due to its low number of usable samples (usable_n=7), it is currently insufficient to publish reliable confidence intervals.
ProvBench 数据集详情
基本信息
- 名称:ProvBench — C2PA manifest survival(provenance 轴,GSPC)
- 许可证:Apache-2.0
- 语言:英语
- 任务类别:文本分类
- 数据规模:n < 1K(15 个条目)
- 发布机构:CSOAI Ltd(英国公司编号 16939677),独立 AI 测量机构
- DOI:10.5281/zenodo.21755657
数据集内容
- 主题:评估 C2PA 清单(C2PA manifest)的存续情况
- 标签及分布:
DESTROYED:8 条SURVIVES:7 条
- 总分:15 个条目
- 该数据集是 GSPC 工具的六个轴之一,每个轴对应一个基准测试
性能测量(基于 30 个模型,参数量 494M 至 20B,三种架构)
| 统计量 | 数值 | 含义 |
|---|---|---|
| 平均难度 | 0.562 | 正确回答条目的模型比例 |
| 区分度跨度(最大−最小) | 0.400 | 最佳模型与最差模型的分离程度 |
| 无效条目(dead items) | 5 / 15 | 所有模型均通过或均未通过的条目,无信息量 |
| 负向区分条目 | 3 | 整体更好的模型表现更差的条目,已进入仲裁而非删除 |
| 有效样本量(usable n) | 7 | 既非无效也无负向区分的条目数 |
| 可引用性 | 否(低于 usable_n ≥ 30) | 是否应发布该轴的 95% 区间 |
- 该轴尚未饱和:区分度跨度 0.400 表明能分离模型,但 usable_n = 7 时无法支撑有报告价值的差异(95% Wilson 区间需 usable_n ≥ 30 才能收窄至 ±0.169)
- 无效条目计数仅在 N > 19 个模型时可信;本次运行在 N = 30 下认证
分数解读规则
- 三种结果,而非两种:measured / unmeasured / failed。无法评分的生成标记为
UNMEASURED,不计分且不视为错误答案 - 报告 usable_n 而非 n:避免条目部分无效时夸大证据量
- 区间优先于点估计:95% 区间重叠的比较均标记为
NOT_RESOLVED - 测量而非认证:分数带为描述性,监管判定由权威机构保留
已知局限性
- 无前沿评判模型验证,评分采用精确标签或经 98.9% 验证的拒绝检测器(基于 92 条人工标注响应,单一标注者,无交叉标注者一致性)
- 条目难度是“条目 × 模型群”的属性,而非条目本身的属性;若模型群偏重小模型,难度结论反映的是该模型群
- 在当前模型群规模下,条目区分度仅为估计值,尚未最终确定
来源:Hugging Face 数据集页面 | 卡片许可:CC-BY-4.0,条目集许可:Apache-2.0





