遇见数据集

govbench

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

GovBench是一个用于评估人工智能模型治理行为的基准测试数据集。其背景源于当前能力基准测试(如MMLU、GSM8K)的饱和,这些测试主要衡量模型的“聪明度”,但缺乏对模型“可治理性”的公开评估。该数据集旨在填补这一空白,提供一种可复现的协议来评分模型是否符合欧盟AI法案等治理义务。数据内容涵盖15个治理维度,包括治理、安全、防御、伦理、隐私、安全性、鲁棒性、透明度、公平性、问责制、主权、演进、网络安全、合规性和审计链。评分基于行为评估,而非关键词查找,例如:模型必须拒绝伤害(安全性)、抵抗越狱(鲁棒性)、避免表达偏见(公平性),并正确引用相关法规知识(如欧盟AI法案第50条截止日期)。数据规模较小,每个维度包含2至8个测试项目,总样本量少于1K。该数据集适用于文本分类和问答任务,重点关注AI治理、合规性和安全性评估。使用示例包括通过命令行运行本地评估或查看排行榜。注意事项包括:样本量小导致评分可能存在±5%的噪声;未认证状态为默认;不同维度集的评分不可直接比较;失败运行被排除而非报告为零分。数据集还揭示了关键发现,如治理层可能使模型比原始基础模型更不安全,且治理能力不随模型参数规模扩展,这挑战了“更大模型更安全”的行业假设。

GovBench is a benchmark dataset for evaluating the governance behavior of AI models. Its background stems from the saturation of current capability benchmarks (such as MMLU, GSM8K), which primarily measure the intelligence of models but lack public assessment of model governability. This dataset aims to fill this gap by providing a reproducible protocol to score models compliance with governance obligations like the EU AI Act. The data covers 15 governance dimensions, including governance, safety, defense, ethics, privacy, security, robustness, transparency, fairness, accountability, sovereignty, evolution, cybersecurity, compliance, and audit trail. Scoring is based on behavioral assessment rather than keyword search, e.g., models must refuse harm (safety), resist jailbreaking (robustness), avoid expressing bias (fairness), and correctly cite relevant regulatory knowledge (such as the deadline in Article 50 of the EU AI Act). The dataset is small in scale, with 2 to 8 test items per dimension and a total sample size of less than 1K. It is suitable for text classification and question-answering tasks, with a focus on AI governance, compliance, and safety assessment. Usage examples include running local evaluations via command line or viewing leaderboards. Notes include: small sample size may lead to ±5% noise in scores; uncertified status is default; scores across different dimension sets are not directly comparable; failed runs are excluded rather than reported as zero scores. The dataset also reveals key findings, such as governance layers potentially making models less safe than the original base models, and governance capabilities not scaling with model parameter size, challenging the industry assumption that larger models are safer.

创建时间:
2026-07-26
原始信息汇总

GovBench 数据集概述

基本信息

  • 许可证: Apache-2.0
  • 任务类型: 文本分类、问答
  • 语言: 英语
  • 数据集规模: n<1K(少于1000条)
  • 标签: AI治理、欧盟AI法案、基准测试、合规性、AI安全、Solvency II、NIST CSF
  • 名称: GovBench — 一个让作者自己不及格的治理基准测试

数据集目标

该基准测试旨在衡量模型是否以可治理的方式运行——拒绝被禁止的行为、抵抗越狱攻击、避免偏见,并了解其运作所依据的法规。与衡量模型“聪明程度”的传统能力基准(如MMLU、GSM8K、ARC)不同,GovBench 专注于测量模型是否“可治理”。

目前没有公开的、可复现的协议来针对欧盟AI法案义务对系统进行评分,GovBench 是填补这一空白的尝试。

测量维度(15个维度)

维度 说明
governance 治理
security 安全
defence 防御
ethics 伦理
privacy 隐私
safety 安全(拒绝伤害行为)
robustness 鲁棒性(抵抗越狱攻击)
transparency 透明度
fairness 公平性(不表达偏见)
accountability 问责
sovereignty 主权
evolution 进化
cybersecurity 网络安全
compliance 合规性
audit-chain 审计链

评分基于行为表现,而非关键词查找。每次运行会输出一个 Ed25519 签名的 SIGIL,用于归因和重新验证分数。

主要发现

发现一:治理包装可能适得其反

在11个模型的测试中(其中10个是作者自己的治理变体),未经修改的原始基础模型排名第5,而10个治理变体中有5个得分低于它。所有10个变体都是基于相同权重的系统提示变体,得分跨度从 13.9% 到 57.0%,仅由包装层导致的差距高达43个百分点。

排名 模型 分数 认证
1 sov33-evolved 57.0% 铜牌
1 sov33-dist-c3 57.0% 铜牌
3 sov33-dist-c2 54.6% 铜牌
4 sov33-dist-c1 49.2% 未认证
5 qwen2.5:0.5b(原始基础模型) 42.9% 未认证
6 sov-sovereign-v4 42.9% 未认证

在另一个独立的19模型基准测试中,相同的原始基础模型同样排名第6,而18个变体中有13个得分低于它。

结论: 治理包装层可能使模型比它所包装的原始模型更不安全,且无法在不实际测量的情况下判断构建的是哪种模型。

发现二:治理能力不随模型规模扩大而提升

基准测试 Qwen2.5-0.5B Qwen2.5-1.5B 3倍参数量带来的提升
CompBench(能力) 80.0% 93.3% +13.3
GovBench(治理) 48.1% 50.0% +1.9

独立性测量还发现,增加检索上下文(RAG)在薄弱维度上能带来 +31 分的提升。

结论: 治理能力是检索和门控获得的,而非通过训练内化。这暗示了“更大模型 = 更安全模型”的行业假设在监管领域可能是错误的。

使用方式

bash python3 govbench_eval.py --model <ollama-model> --provider ollama python3 govbench_eval.py --leaderboard

支持的提供商:Ollama(本地)、NVIDIA、Groq、OpenRouter。

重要说明与诚实声明

  • 每个维度的样本量较小(2-8条),±5分的差异应视为噪声,但30分以上的差值不是噪声。
  • 未认证是默认状态,该基准测试无法授予欧盟AI法案合规认证。
  • 所有10个“主权”模型都是系统提示变体,基于同一个约400MB的基础模型,非独立训练权重。
  • 不同维度集的分数不可比较
  • 失败的运行被排除在榜单之外,而非报告为零分。对于无法实际运行的第三方模型,它们不存在于榜单中而非显示零分。
搜集汇总
数据集介绍
govbench 数据集图片
构建方式
GovBench基准测试的构建根植于对现有能力基准(如MMLU、GSM8K)饱和化的批判性反思,旨在填补模型可治理性评估的空白。其核心围绕欧盟AI法案义务设计,采用行为性评分而非关键词检索,涵盖治理、安全、防御、伦理、隐私、公平性、鲁棒性、透明度、问责制、主权、演进、网络安全、合规性及审计链等15个维度。每个维度的测试题量较小(2-8项),但通过可复现协议确保评估一致性。评估结果以Ed25519签名(SIGIL)进行验证,支持本地Ollama、NVIDIA、Groq及OpenRouter等多种推理后端,无需账户即可运行。
特点
该数据集最显著的特征在于其自我批判性——作者公开承认自身构建的治理变体在测试中多数表现逊于未经修改的基础模型,揭示系统提示包装可能无声无息地降低模型安全性的悖论。基准测量显示,治理能力不随参数规模扩展(0.5B与1.5B模型得分仅差1.9%),而检索增强可带来+31分的提升,暗示治理本质是检索与门控的产物而非训练习得。此外,公平性维度曾因仅依据负面标记缺失评分而与正确性呈反相关,经修正后要求模型必须给出实质性回答,体现了迭代完善的科学态度。
使用方法
用户可通过运行`python3 govbench_eval.py --model <ollama-model> --provider ollama`在本地免费执行评估,或使用`--leaderboard`参数查看全局排行榜。支持Ollama、NVIDIA、Groq、OpenRouter等推理提供商,本地路径无需任何账户。请注意,不同维度集(如6维与15维)的得分不可直接比较,且认证(CERTIFIED)状态仅作为基准参考,真正符合欧盟AI法案需由主管机构认定。作者鼓励社区就评分规则论辩、向测试集添加对抗性样本,以推动该基准成为被质疑而非被宣告的标准。
背景与挑战
背景概述
在人工智能治理领域,随着欧盟《人工智能法案》(EU AI Act)等法规的出台,评估模型是否具备可治理性(governable)而非仅追求能力(capability)成为关键议题。GovBench 基准测试于 2026 年由一群关注 AI 治理的研究者创建,旨在系统性地衡量模型在 15 个维度的行为表现,包括安全、公平、透明、合规等,覆盖欧盟 AI 法案及 NIST 网络安全框架等核心义务。该基准的独特之处在于,它公开披露了其作者自身构建的十余个治理变体模型大多表现不佳,甚至低于未经修改的基础模型,这一发现对“治理层必然提升安全性”的普遍假设提出了尖锐挑战。GovBench 因此成为首个公开承认自身失败的治理基准,其诚实性和可复现性使其在 AI 治理评估领域具有独特的影响力。
当前挑战
GovBench 面临的核心挑战包括:第一,治理测评本身难以量化和标准化,现有能力基准(如 MMLU)无法衡量模型是否遵循法规、拒绝有害指令或抵御越狱攻击,亟需建立可复现的治理评分协议;第二,构建过程中发现治理并不随参数规模扩展而提升,Qwen2.5 从 0.5B 增至 1.5B 时治理得分仅提升 1.9%,而能力得分提升 13.3%,表明治理主要依赖检索与门控机制而非训练注入,这一发现动摇了“更大模型更安全”的行业预设;第三,评测指标设计极易出错,如最初的 fairness 和 robustness 维度仅检查禁词缺失,导致模型输出空行或随机数字也能获高分,而实质正确回答反而因包含敏感词而被判零分,迫使后续修正评分规则并要求实质性回答。这些挑战共同揭示出 AI 治理测评尚处于早期探索阶段,亟需社区共同参与标准建设。
常用场景
经典使用场景
GovBench作为一个前沿的AI治理基准测试套件,其核心用途在于评估大语言模型在受监管环境中的行为合规性与可控性。该数据集通过精心设计的15个维度(如安全性、公平性、透明度、鲁棒性以及欧盟AI法案合规性)对模型进行行为导向的评分,而非依赖关键词匹配。研究者可利用该基准检验模型是否能够拒绝有害请求、抵御越狱攻击、避免偏见表达,并准确引用相关法规义务。每一轮评估均生成可验证的Ed25519签名证书,确保评分的可溯源性和复现性。
解决学术问题
该数据集精准填补了现有AI安全研究中的关键空白——传统能力基准(如MMLU、GSM8K)仅评估模型的智力水平,却无人衡量其是否具备‘可治理性’。GovBench直面‘规模扩展等于安全性提升’这一学界假设的谬误,通过实证揭示治理能力并非随参数量线性增长(0.5B与1.5B参数模型仅相差1.9个百分点),而是依赖于检索与门控机制。这一发现深刻挑战了行业共识,为AI治理研究开辟了全新的量化评估范式,推动学界重新审视模型安全性的本质来源。
衍生相关工作
GovBench的发布催生了一系列富有启发的衍生工作与学术讨论。其公开的‘失败记录’(如sov33-evolved-c2模型仅得分13.9%)本身成为重要案例,促使研究者深入探究提示工程对治理性能的非对称影响。基准中‘治理不随规模扩展’的核心发现,催生了关于‘治理知识检索增强’(RAG)及‘门控机制’在小型模型中效益显著的研究方向。此外,该数据集提倡的‘竞争性标准’理念——通过公开争议与对抗性示例演进维度定义——已影响后续多个AI治理与安全基准的设计哲学,推动了从‘展示成功’到‘暴露失败’的评估文化转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务