gps-bench-ai-bills
收藏资源简介:
GPS-Bench: AI Bills and Expert Analyses 是一个用于评估 AI 治理文书理解能力的数据集。它包含 922 个 AI 治理相关文书(包括美国联邦/州/市级法案、中国法规、欧盟法规、国际条约等)的全文,以及 354 份由独立专家撰写的分析,覆盖其中 209 个文书。每个数据条目以“文书-专家分析”对的形式组织,可询问模型文书要求什么、覆盖谁、将产生什么影响,并根据专家分析进行评分。数据集按地理区域划分为四个配置文件(us、eu、china、international),以及一个专门包含评估子集的配置文件(with_analyses)。每个文书条目包含完整的元数据(如唯一标识符、官方名称、管辖区域、日期、状态、全文等)和最多 3 份专家分析(每份包含原文摘录、来源、作者、类型、倾向性等)。数据集适用于文本分类、摘要、问答等任务,特别适合用于 AI 治理、政策分析、法律文本理解等场景。数据集规模为 n<1K(922 个文书,354 份分析)。
GPS-Bench: AI Bills and Expert Analyses is a dataset for evaluating AI governance document understanding. It contains the full text of 922 AI governance-related documents (including US federal/state/municipal bills, Chinese regulations, EU regulations, international treaties, etc.) and 354 expert analyses covering 209 of those documents. Each data entry is organized as a document-expert analysis pair, allowing models to be asked what the document requires, whom it covers, what impact it will have, and to be scored based on expert analysis. The dataset is divided into four configuration profiles by geographic region (us, eu, china, international) and one profile containing the evaluation subset (with_analyses). Each document entry includes complete metadata (such as unique identifier, official name, jurisdiction, date, status, full text, etc.) and up to 3 expert analyses (each containing excerpt, source, author, type, stance, etc.). The dataset is suitable for tasks such as text classification, summarization, and question answering, and is particularly suited for AI governance, policy analysis, and legal text understanding. The dataset size is n<1K (922 documents, 354 analyses).
GPS-Bench: AI Bills and Expert Analyses 数据集详情
数据集概览
该数据集包含 922个AI治理相关法律文件全文,以及 354份独立专家分析,覆盖其中209个文件,专为防泄漏控制的模型评估设计。数据集的基本单元是“法律文件与人类专家对其的评述配对”,模型可被询问文件要求、约束对象或影响,并依据律师、智库和民间社会研究者的分析进行评分。
数据文件与结构
| 文件 | 行数 | 内容 |
|---|---|---|
gps_us_ai_bills.json |
820 | 美国联邦、州及市级措施 |
gps_international_ai_bills.json |
54 | 美国、欧盟和中国以外的国家法律和框架,以及多边文件 |
gps_china_ai_bills.json |
44 | 中国法律、行政法规、部门通知及国家标准 |
gps_eu_ai_bills.json |
4 | 欧盟法规、指令和行为准则 |
gps_bench_bills_WITH_analyses.json |
209 | 按泄漏划分分组的已分析子集(评估集) |
其中,四个板块文件构成完整语料分区,每个文件只出现在一个板块中,bill_key 无重复。gps_bench_bills_WITH_analyses.json 是视图而非第五分区,按划分重新组合209个已分析文件。所有922行均携带精确的 YYYY-MM-DD 日期,并通过 bill_date_basis 标明该日期对应的事件类型(如提出、颁布等)。
国家/地区覆盖
| 国家/地区 | 文件数 | 有效 | 基准 |
|---|---|---|---|
| 美国 | 820 | 592 | 73 |
| 中国 | 44 | 44 | 16 |
| 英国 | 14 | 14 | 5 |
| 加拿大 | 12 | 11 | 2 |
| 新加坡 | 8 | 8 | 6 |
| 印度 | 7 | 7 | 6 |
| 日本 | 4 | 4 | 3 |
| 欧盟 | 4 | 3 | 3 |
| 韩国 | 2 | 2 | 1 |
| 澳大利亚、巴西、丹麦、意大利、西班牙、越南 | 各1 | 各1 | 各1 |
| 多边 | 1 | 1 | 1 |
| 总计 | 922 | 692 | 122 |
美国覆盖全部50个州及哥伦比亚特区(214个州级、605个联邦、1个市级)。排除的230个包括228个美国(220个因国会休会而失效的联邦法案、2个被否决、6个州级)、欧盟撤回的AI责任指令,以及加拿大AIDA。
评估集设计
209个文件至少有一份专家分析,127个有两份或以上,构成基准合格集。按划分分组:
| 划分 | 文件数 | 含义 |
|---|---|---|
before_cutoff |
57 | 最早分析早于参考模型的训练截止日期,构成记忆化基线 |
after_cutoff |
50 | 最早分析晚于截止日期,对参考模型无泄漏,构成泛化集 |
train |
20 | 用于少样本提示或校准的确定性保留集 |
one_analysis |
82 | 单一分析的真实证据,但非双标注项 |
划分基于 claude-opus-4-5-20251101(训练截止 2025-05-31)计算。分析分布:109个文件有两份分析,18个有三份,82个有一份。
行结构核心字段
文件信息字段包括:bill_key(稳定标识)、bill_name(正式名称)、jurisdiction(管辖区)、bill_date(精确日期)、bill_date_basis(日期事件依据)、enacted_date/effective_date(如适用)、bill_status(程序状态,未规范化)、status_class(跨制度统一桶分类:enacted、active、stalled、guidance、draft、other)、bill_text(全文)、bill_language(语言判定)等。
进展与结果字段包括:status_text(程序阶梯)、status_rank(可排序整数)、primary_party(主要发起人党派)、is_live(是否为有效文件)、outcome_reason_kind(结果类别)、key_actors(关键参与者)等。注意:status_class 不是结果字段,只记录程序进展阶段;过滤“排除失败和否决”应使用 is_live。
分析字段(每行最多3份):human_analysis_N(逐字摘录)、analysis_N_source_type(来源类型)、analysis_N_lean(意识形态倾向)、analysis_N_date_precision(日期精度)、leakage_free_for(可无泄漏使用的模型列表)等。完整性规则:无来源名称、URL和逐字摘录的行不计入分析。
专家分析来源分布
| 来源类型 | 数量 |
|---|---|
| 律师事务所法律分析 | 73 |
| 智库 | 38 |
| 新闻媒体 | 14 |
| 学术分析 | 11 |
| 行业分析 | 7 |
| 民间社会 | 6 |
| 独立政策分析 | 6 |
| 民间社会政策分析 | 5 |
| 其他专家分析 | 5 |
| 咨询供应商 | 4 |
| 政府官员解读 | 3 |
| 其余九种单例类型 | 9 |
其中3份为 government_official_interpretation 标签,属非独立评论,建议排除。
语言情况
849行为英文,其余:6行中英双语,西班牙语、丹麦语、葡萄牙语、意大利语、越南语、日语、韩语各1行。非英文文本保留原文,部分配官方翻译。
数据加载说明
板块文件将行包裹在元数据对象中,需通过键读取数组而非直接作为列表。评估集按划分分区,而非单一数组。过滤时应使用 status_class 而非 bill_status(后者保留各收集者原始措辞)。





