gps-bench-ai-bills
收藏资源简介:
GPS-Bench是一个用于评估语言模型对AI治理文件理解能力的数据集,包含984个来自全球41个国家和欧盟的AI治理相关文件(法案、法规、框架等)的全文,以及398份由法律专家、智库、民间社会研究者等独立撰写的分析(覆盖241个文件)。数据集旨在支持泄漏控制的评估:模型被要求回答问题,其回答与专家分析进行比较,且专家在写作时不知道模型会被评估。数据集按地域分为四个子集:美国(838条)、欧盟(4条)、中国(44条)、国际(98条),每个文件出现在唯一一个子集中。评价子集(gps_bench_bills_WITH_analyses.json)包含209个有分析的文件,按泄漏分割(训练前、截止后、训练、单分析)组织。每个文件条目包含丰富字段:bill_key、bill_name、jurisdiction、bill_date、bill_date_basis、bill_status、status_class、bill_text、bill_language、group、phase等,以及1-3个分析字段(human_analysis_N、analysis_N_source等)。数据集总文本字符数约46,363,560。适用任务包括文本分类(如状态分类、倾向性)、摘要、问答(基于文本的合规性、要求等),特别适合AI治理领域的模型评估与基准测试。
GPS-Bench is a dataset designed to evaluate language models understanding of AI governance documents. It contains 984 full texts of AI governance-related documents (bills, regulations, frameworks, etc.) from 41 countries and the European Union, along with 398 independently written analyses by legal experts, think tanks, civil society researchers, etc. (covering 241 documents). The dataset aims to support leakage-controlled evaluation: models are asked questions and their answers are compared to expert analyses, and experts were unaware of the model evaluation when writing. The dataset is divided into four regional subsets: US (838 entries), EU (4 entries), China (44 entries), and International (98 entries), with each document appearing in exactly one subset. The evaluation subset (gps_bench_bills_WITH_analyses.json) contains 209 documents with analyses, organized by leakage splits (pre-training, post-cutoff, training, single analysis). Each document entry includes rich fields: bill_key, bill_name, jurisdiction, bill_date, bill_date_basis, bill_status, status_class, bill_text, bill_language, group, phase, etc., and 1-3 analysis fields (human_analysis_N, analysis_N_source, etc.). The total text character count of the dataset is approximately 46,363,560. Applicable tasks include text classification (e.g., status classification, lean classification), summarization, and question answering (compliance, requirements based on text), making it particularly suitable for model evaluation and benchmarking in the AI governance domain.
数据集概述
GPS-Bench: AI Bills and Expert Analyses 是一个用于防泄露评估的多语言法律与政策数据集,收录了 996 项 AI 治理相关法律法规全文,并配以 411 篇独立专家分析,覆盖其中 249 项法规。数据集的单位不是单个法案,而是“法案 + 人类专家对其的评述”,模型可被询问某法规的要求、适用对象或预期效果,并根据律师、智库和公民社会研究者的书面分析进行评分——这些作者在撰写时并不知道模型会依据其文本被评分。
核心构成
数据文件与分区
| 文件 | 行数 | 内容 |
|---|---|---|
gps_us_ai_bills.json |
839 | 美国联邦、州及市级措施 |
gps_international_ai_bills.json |
100 | 美国、欧盟和中国以外的国家法律与框架 |
gps_china_ai_bills.json |
44 | 中国法律、行政法规、部门通知及 GB 标准 |
gps_intergov_ai_bills.json |
13 | 4 项欧盟文书 + 9 项政府间机构文书(东盟、七国集团、经合组织、联合国、非盟) |
gps_bench_bills_WITH_analyses.json |
249 | 已分析子集,按泄露分割分组——即评估集 |
四个板块文件对语料库进行分区:每项法案仅出现在一个文件中,bill_key 在文件内及跨文件均无重复。gps_bench_bills_WITH_analyses.json 是一个视图而非第五个分区,它按分割重新组织了已分析的法案。注意:文件名并不代表板块,在 gps_intergov_ai_bills.json 中须按行读取 bloc 字段(该文件 13 行均携带该字段);其他文件中 bloc 可能缺失,此时文件名是正确的回退依据。
覆盖范围
- 国家/地区:41 个国家,加上欧盟及 9 项政府间文书(分别报告)
- 美国:覆盖全部 50 个州及哥伦比亚特区(214 个州级、624 个联邦、1 个市级)
- 语言:英语、中文、日语、韩语、泰语、印尼语、越南语、波斯语、俄语、西班牙语、葡萄牙语、意大利语、法语、荷兰语、丹麦语
各国文书统计(节选)
| 国家/地区 | 文书数 | 有效 | 已分析 | 基准 |
|---|---|---|---|---|
| 美国 | 839 | 611 | 149 | 76 |
| 中国 | 44 | 44 | 25 | 16 |
| 英国 | 18 | 8 | 5 | 5 |
| 欧盟 | 4 | 3 | 4 | 4 |
| 政府间机构 | 9 | 9 | 9 | 6 |
| 总计 | 996 | 756 | 249 | 144 |
注意:伊朗、肯尼亚、尼日利亚和卢旺达(共 8 行)仅有法案文本无任何评述,可用于语料库级研究,但不能作为基准项(无答案可核对)。
评估集设计
249 项法案至少有一条专家分析,其中 144 项有两条或以上。 评估集按泄露风险分为四类:
| 分割桶 | 法案数 | 含义 |
|---|---|---|
before_cutoff |
68 | 最早分析早于参考模型的训练截止日期——记忆化基线 |
after_cutoff |
55 | 最早分析晚于截止日期——对参考模型无泄露,即泛化集 |
train |
21 | 确定性保留集,用于少样本提示或校准——切勿用于评分 |
one_analysis |
105 | 单独保留:单条分析是真实证据,但非双标注项 |
分割是基于**claude-opus-4-5-20251101(训练截止 2025-05-31)计算的,并记录在每行的 split_reference_model / split_reference_cutoff 字段中。分割仅相对该模型有意义;对其他模型,应使用每行的 leakage_free_for 列表,该列表列出训练截止日期严格早于该法案最早分析的模型。截止日期未公开的模型不出现在该列表中**。
行模式(Row Schema)
法案核心字段
| 字段 | 含义 |
|---|---|
bill_key |
稳定标识符,如 co-sb205、cn-genai-interim-2023 |
bill_name |
官方名称 |
jurisdiction |
管辖级别:federal、state:XX、city:XX、eu、national:XX、international |
bill_date |
精确 YYYY-MM-DD 日期,996 行全部携带;但所标记的里程碑因行而异 |
bill_date_basis |
说明 bill_date 实际代表什么(如 introduced、promulgated、Royal Assent 等);仅 592/996 行有值,跨司法辖区比较日期前必须读取 |
bill_status |
采集者原文的程序状态(104 种不同取值,故意不规范化)——应改用 status_class 过滤 |
status_class |
制度无关的分类:enacted、active、stalled、guidance、draft、other |
bill_text |
文书全文(全部 996 行均携带;总计 47,366,541 字符) |
bill_language |
根据字符测量,而非从管辖推断 |
group |
CAST 灾难类别:misuse、loss_of_control、systemic、geopolitical |
phase |
1_adoption、2_implementation、3_societal |
进展、发起人与结果字段
| 字段 | 含义 |
|---|---|
status_text |
统一阶梯上的进展(Introduced or Prefiled → ... → Enacted → Effective,以及 Vetoed 和 Failed) |
status_rank |
status_text 的可排序整数(1–7 阶梯,-1 为负面终态,0 为未知) |
primary_party |
主要发起人党派:Democrat、Republican、Independent、Non-Designated(Non-Designated 是积极发现,与 "" 表示“无人核查”不同) |
outcome_reason_kind |
enacted、failed、vetoed 或 ""(仍在推进) |
is_live |
“排除失败和否决”应过滤的字段;756/996 行为 true |
key_actors |
发起、支持或受该措施监管的主体 |
status_class 使用警告
status_class不是结果字段,它记录达到的最远程序阶段;220 个因国会休会而失效的联邦法案仍显示activeguidance表示已发布但无约束力的文书(33 行)- 115 个联邦行带有 govinfo 文档版本代码(如
ih、rs),只能归类为active——这是下限,非恢复的结果 - 跨板块比较请用
status_class;status_text仅在同一板块内使用(如美国板块),中国、欧盟等其他板块该字段为空属设计使然
分析字段(N = 1–3)
| 字段 | 含义 |
|---|---|
human_analysis_N |
逐字摘录——可引用的地面真相 |
human_analysis_N_full |
全文(供上下文参考) |
analysis_N_source / _author / _url / _date |
引用信息 |
analysis_N_source_type |
law_firm_legal_analysis、think_tank、civil_society、news_media、academic_analysis、industry_analysis、other_expert_analysis |
analysis_N_lean |
记录的意识形态倾向(用于控制视角,非过滤) |
analysis_N_date_precision |
day、month、year 或 none;411 个槽位中 337 个有完整日期,57 个尚未设置该字段 |
n_human_analyses |
有效分析槽位数 |
earliest_analysis_date / _precision |
三个槽位中的最早日期及其精度——驱动泄露分割 |
leakage_free_for |
不可能记忆该评述的模型 ID 列表 |
leakage_computable |
泄露声明是否可计算——在信任空的 leakage_free_for 前必须先读取 |
加载方式
板块文件将行包装在元数据对象中,需按键读取数组(如 ["bills"]、["instruments"]),而非裸列表;评估集按分割键(如 after_cutoff)组织。中国文件使用 instruments 键(因中国 AI 治理以法规、通知和标准形式发布),字段模式与其他文件相同。建议用 status_class 过滤(如 enacted),且“排除失败和否决”应使用 is_live 而非 status_class。
已知缺口与注意事项
bill_date_basis在 389 个美国行(242 联邦、147 州)及 32 个其他行上缺失- 美国州级
primary_party仅 66/214 行有值(联邦为 602/624) - 新加坡《议会选举法》因深度伪造修正案标注为 2024-10-15,而非原 1954 年;日本两行因无确切修正日期保留宿主法规日期并携带
ai_provision_year - 佐治亚州两行带有未来生效日期(
bill_date_basis: effective) - 五国(伊朗、肯尼亚、尼日利亚、卢旺达,共 8 行)无任何专家分析,不可作为基准项




