遇见数据集

govbench

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

GovBench 是 GSPC(Governance, Safety, Provenance, Continuity, Conformance, Openness)评估体系中治理轴(Governance Axis)下的基准测试数据集,专注于根据欧盟 AI 法案(EU AI Act)对 AI 系统进行风险等级分类。该数据集包含 24 个样本,每个样本被标注为以下四种风险等级之一:PROHIBITED(禁止)、HIGH_RISK(高风险)、LIMITED_RISK(有限风险)、MINIMAL_RISK(最低风险)。数据集以文本分类任务的形式呈现,用于评估语言模型对欧盟 AI 法案风险层级的理解能力。数据由独立 AI 测量机构 CSOAI Ltd 发布,基于冻结的语料锚定真值进行评分。在 30 个模型(参数规模 494M 至 20B,三种架构)上的测试显示,该轴的平均难度为 0.227,区分度(最大-最小)为 0.440,有效样本数(usable_n)为 23(因一个死项被排除)。该轴尚未饱和,但已能区分模型性能。数据集附带详细的评分指南和已知限制,强调测量而非认证,并建议报告有效样本数而非原始样本数。

GovBench is a benchmark dataset under the Governance Axis of the GSPC (Governance, Safety, Provenance, Continuity, Conformance, Openness) evaluation framework, focusing on classifying AI systems into risk levels according to the EU AI Act. The dataset contains 24 samples, each labeled as one of four risk levels: PROHIBITED, HIGH_RISK, LIMITED_RISK, or MINIMAL_RISK. It is presented as a text classification task to evaluate language models understanding of the EU AI Act risk tiers. The data is released by CSOAI Ltd, an independent AI measurement organization, and scored based on frozen corpus-anchored ground truth. Tests on 30 models (parameters ranging from 494M to 20B, with three architectures) show an average difficulty of 0.227, a discrimination (max-min) of 0.440, and a usable sample count (usable_n) of 23 (due to one dead item excluded). The axis is not yet saturated but can already distinguish model performance. The dataset includes detailed scoring guidelines and known limitations, emphasizing measurement rather than certification, and recommends reporting usable sample count instead of raw sample count.

创建时间:
2026-08-03
原始信息汇总

GovBench — EU AI Act 风险等级基准(GSPC 治理轴)

基本信息

  • 数据集名称:GovBench — EU AI Act risk tier
  • 发布机构:CSOAI Ltd(英国,公司编号 16939677),独立 AI 测量机构
  • 许可协议:Apache-2.0(数据集条目),卡片为 CC-BY-4.0
  • 语言:英语
  • 任务类型:文本分类
  • 数据规模:n < 1K(共 24 个条目)
  • DOI:10.5281/zenodo.21755657

数据集内容

该基准是 GSPC 仪器六大轴之一,用于评估模型对欧盟 AI 法案风险等级的分类能力。数据条目以冻结的、基于语料锚定的真实标签为评分依据。

标签分布(共 24 条)

标签 数量
PROHIBITED 7
HIGH_RISK 8
LIMITED_RISK 3
MINIMAL_RISK 6

测量表现(30 个模型,参数量 494M 至 20B,三种架构)

统计量 说明
平均难度 0.227 正确回答某个条目的模型比例
区分度(最大−最小) 0.440 最佳与最差模型间的分离程度
无效条目 1/24 所有模型均通过或均未通过,无信息量
负向区分条目 0 整体更优模型表现更差的条目(已转裁决,未删除)
可用条目数 23 非无效且非负向区分的条目

可引用性结论:由于可用条目数(23)低于 30,本轴暂不可发布 95% 置信区间。虽然区分度 0.440 表明该轴能区分模型,但需 usable_n ≥ 30 才能将 95% Wilson 区间收窄至 ±0.169。该限制被明确公布而非引用无法支持的区间。

评分规则

  • 三种结果:measured / unmeasured / failed。无法评分的生成为 UNMEASURED,不计分,也不计为错误答案。
  • 报告 usable_n 而非 n:避免因无效条目而高估证据量。
  • 区间优先于点估计:95% 区间重叠的比较标记为 NOT_RESOLVED
  • 测量而非认证:分数带仅为描述性,监管判定权归权威机构。

已知局限

  • 无前沿裁判验证;评分基于精确标签或经 98.9% 准确率验证的拒绝检测器(基于 92 条人工标注响应,单一标注者,无交叉一致性)。
  • 条目难度是“条目 × 模型群”的属性,而非条目独立属性;模型群偏向小模型时,难度结论描述的是该模型群。
  • 条目区分度为估计值,尚未在当前模型群规模下解决。

所属体系

GovBench 是 GSPC 六大轴之一,共计 90 个条目,各轴均从实时数据集中读取计数:

基准 任务 条目数 Hugging Face Kaggle
治理 GovBench EU AI Act 风险等级 24 csoai/govbench gspc-govbench
安全 DefBench 校准拒绝 14 csoai/defbench gspc-defbench
溯源 ProvBench C2PA 清单存续 15 csoai/provbench gspc-provbench
连续性 PQCBench 后量子迁移 13 csoai/pqcbench gspc-pqcbench
合规性 MCPBench MCP 工具契约合规 11 csoai/mcpbench gspc-mcpbench
开放性 OSSBench 许可证-用途兼容 13 csoai/ossbench gspc-ossbench
搜集汇总
数据集介绍
govbench 数据集图片
构建方式
GovBench作为GSPC治理轴的核心基准,专司EU AI Act风险分级任务,其构建以冻结的语料锚定真实标签为基石,确保评估的客观性与可复现性。数据集涵盖24个精心设计的项目,横跨四类风险层级:禁止、高风险、有限风险与最小风险,项目分布均衡体现了对监管框架各层级的充分采样。每项均基于精确标签或经92条人工标注响应验证的拒答检测器(准确率达98.9%)进行评分,虽未引入前沿裁判模型验证,但这一构建路径在保障数据纯净性的同时,为后续测量确立了可靠基线。
特点
该基准展现出鲜明的测量科学特质:跨30个模型(参数规模494M至20B)的实测揭示平均难度0.227,区分跨度0.440,表明其具备有效分离模型能力的关键属性,未饱和状态为进阶评估预留空间。在24个项目中,仅1个死项,且无负向歧视项,可用n达23,尽管未达到可引用95%置信区间所需的30项下限,但所有统计量均来自实时数据,非主观断言。其评分采用三态逻辑(可测/不可测/失败),不可测响应不计入错误,这种做法规避了传统二值化评分的信息损失,凸显测量工具的严谨性。
使用方法
使用者应当遵循三项核心准则以正确解读评分:首要原则是报告可用n而非名义n,以避免死项导致证据虚增;其次,比较模型性能时须采用置信区间而非点估计,若区间重叠则判定为未决;最后,该基准系测量工具而非认证机制,得分带属于描述性范畴,监管定性权归当局所有。对于研究者而言,可直接调用HuggingFace上的数据集资源,并参考附带的六轴框架以定位GovBench的治理语境,从而在跨模型评测中实现标准化、可解释的AI治理度量。
背景与挑战
背景概述
随着欧盟《人工智能法案》的正式实施,对AI系统进行风险分级已成为合规评估的关键环节。在此背景下,CSOAI Ltd于2024年发布了GovBench基准,作为GSPC评估体系中的治理轴,专注于测试模型对EU AI Act风险层级的分类能力。该基准由独立AI测量机构CSOAI Ltd开发,包含24个精心设计的测试项,覆盖禁止、高风险、有限风险及最小风险四个类别。GovBench的发布填补了针对AI治理合规性量化评估的空白,其采用冻结的语料锚定真值,确保评估的稳定性和可复现性。通过对30个模型(参数规模从4.94亿至200亿)的实测,该基准展现了良好的区分度(跨度0.440),为AI治理研究提供了重要的测量工具,对推动负责任的AI发展具有里程碑意义。
当前挑战
GovBench面临的挑战主要源于领域问题的复杂性和构建过程的严谨性。领域层面,EU AI Act的风险分类具有法律解释的模糊性,模型需精准把握法律条文与具体场景的映射,而当前模型在24个测试项上的平均正确率仅0.227,揭示了对法规理解的显著不足。构建过程中,基准的可靠性受限于样本规模——仅有23个可用项,未达到可发表95%置信区间所需的30项门槛,且死项和负面区分项的处理需谨慎校准。此外,评分依赖单一标注者的拒绝检测器(准确率98.9%),缺乏交叉验证,可能导致评分偏差。模型规模从4.94亿到200亿的跨度虽增强了泛化性,但也增加了难度评估的异质性,使得基准对模型差异的敏感度难以精确量化。
常用场景
经典使用场景
GovBench作为GSPC治理轴的基准测试,专注于欧盟《人工智能法案》下风险等级分类任务。其核心使用场景是对大型语言模型进行自动化文本分类评估,要求模型从有限的法律描述中准确区分‘禁止’、‘高风险’、‘有限风险’与‘最低风险’四类标签。该基准以24个经语料锚定的固实样本为测试集,强调精确标签匹配,并采用三分法(实测/未实测/失败)处理模型输出,确保评估的严谨性。研究者利用此基准衡量模型对AI治理法规的理解程度,为模型治理能力提供可量化的指标。
实际应用
在实际应用中,GovBench为AI开发者和合规团队提供了预先合规筛查工具,帮助其识别模型在风险分类上的潜在偏差。企业可利用该基准对内部模型进行初步治理健康检查,优先关注在‘禁止’类项上表现不佳的系统,以避免法规风险。同时,监管科技公司可将其集成至产品中,作为持续监控工具,跟踪模型更新后的治理能力变化。由于基准基于公开的欧盟法案条文,其评估结果具有透明度与可复现性,便于审计与第三方验证,从而赋能负责任的AI部署流程。
衍生相关工作
GovBench的发布催生了多项衍生研究。其一,通过其公开的测量统计数据,研究者可探讨模型规模、架构与治理能力之间的相关性,推动‘模型能力与合规性’的理论建模。其二,该基准的‘死项’与‘错误区分’概念被引入其他治理基准设计,促进了如DefBench(安全)和ProvBench(溯源)等姊妹轴的发展,形成了多维度治理评估体系。此外,基于其拒绝检测器验证方法,衍生了更多关于模型输出鲁棒性和评估器设计的研究。最后,GovBench的统计阈值(如usable_n≥30)准则,已成为构建高质量基准的参考标准,影响后续基准的可靠性报告规范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务