遇见数据集

gps-bench-ai-bills

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

GPS-Bench是一个用于评估语言模型对AI治理文件理解能力的数据集,包含984个来自全球41个国家和欧盟的AI治理相关文件(法案、法规、框架等)的全文,以及398份由法律专家、智库、民间社会研究者等独立撰写的分析(覆盖241个文件)。数据集旨在支持泄漏控制的评估:模型被要求回答问题,其回答与专家分析进行比较,且专家在写作时不知道模型会被评估。数据集按地域分为四个子集:美国(838条)、欧盟(4条)、中国(44条)、国际(98条),每个文件出现在唯一一个子集中。评价子集(gps_bench_bills_WITH_analyses.json)包含209个有分析的文件,按泄漏分割(训练前、截止后、训练、单分析)组织。每个文件条目包含丰富字段:bill_key、bill_name、jurisdiction、bill_date、bill_date_basis、bill_status、status_class、bill_text、bill_language、group、phase等,以及1-3个分析字段(human_analysis_N、analysis_N_source等)。数据集总文本字符数约46,363,560。适用任务包括文本分类(如状态分类、倾向性)、摘要、问答(基于文本的合规性、要求等),特别适合AI治理领域的模型评估与基准测试。

GPS-Bench is a dataset designed to evaluate language models understanding of AI governance documents. It contains 984 full texts of AI governance-related documents (bills, regulations, frameworks, etc.) from 41 countries and the European Union, along with 398 independently written analyses by legal experts, think tanks, civil society researchers, etc. (covering 241 documents). The dataset aims to support leakage-controlled evaluation: models are asked questions and their answers are compared to expert analyses, and experts were unaware of the model evaluation when writing. The dataset is divided into four regional subsets: US (838 entries), EU (4 entries), China (44 entries), and International (98 entries), with each document appearing in exactly one subset. The evaluation subset (gps_bench_bills_WITH_analyses.json) contains 209 documents with analyses, organized by leakage splits (pre-training, post-cutoff, training, single analysis). Each document entry includes rich fields: bill_key, bill_name, jurisdiction, bill_date, bill_date_basis, bill_status, status_class, bill_text, bill_language, group, phase, etc., and 1-3 analysis fields (human_analysis_N, analysis_N_source, etc.). The total text character count of the dataset is approximately 46,363,560. Applicable tasks include text classification (e.g., status classification, lean classification), summarization, and question answering (compliance, requirements based on text), making it particularly suitable for model evaluation and benchmarking in the AI governance domain.

创建时间:
2026-07-30
原始信息汇总

数据集概述

GPS-Bench: AI Bills and Expert Analyses 是一个用于防泄露评估的多语言法律与政策数据集,收录了 996 项 AI 治理相关法律法规全文,并配以 411 篇独立专家分析,覆盖其中 249 项法规。数据集的单位不是单个法案,而是“法案 + 人类专家对其的评述”,模型可被询问某法规的要求、适用对象或预期效果,并根据律师、智库和公民社会研究者的书面分析进行评分——这些作者在撰写时并不知道模型会依据其文本被评分。

核心构成

数据文件与分区

文件 行数 内容
gps_us_ai_bills.json 839 美国联邦、州及市级措施
gps_international_ai_bills.json 100 美国、欧盟和中国以外的国家法律与框架
gps_china_ai_bills.json 44 中国法律、行政法规、部门通知及 GB 标准
gps_intergov_ai_bills.json 13 4 项欧盟文书 + 9 项政府间机构文书(东盟、七国集团、经合组织、联合国、非盟)
gps_bench_bills_WITH_analyses.json 249 已分析子集,按泄露分割分组——即评估集

四个板块文件对语料库进行分区:每项法案仅出现在一个文件中,bill_key 在文件内及跨文件均无重复。gps_bench_bills_WITH_analyses.json 是一个视图而非第五个分区,它按分割重新组织了已分析的法案。注意:文件名并不代表板块,在 gps_intergov_ai_bills.json 中须按行读取 bloc 字段(该文件 13 行均携带该字段);其他文件中 bloc 可能缺失,此时文件名是正确的回退依据。

覆盖范围

  • 国家/地区:41 个国家,加上欧盟及 9 项政府间文书(分别报告)
  • 美国:覆盖全部 50 个州及哥伦比亚特区(214 个州级、624 个联邦、1 个市级)
  • 语言:英语、中文、日语、韩语、泰语、印尼语、越南语、波斯语、俄语、西班牙语、葡萄牙语、意大利语、法语、荷兰语、丹麦语

各国文书统计(节选)

国家/地区 文书数 有效 已分析 基准
美国 839 611 149 76
中国 44 44 25 16
英国 18 8 5 5
欧盟 4 3 4 4
政府间机构 9 9 9 6
总计 996 756 249 144

注意:伊朗、肯尼亚、尼日利亚和卢旺达(共 8 行)仅有法案文本无任何评述,可用于语料库级研究,但不能作为基准项(无答案可核对)。

评估集设计

249 项法案至少有一条专家分析,其中 144 项有两条或以上。 评估集按泄露风险分为四类:

分割桶 法案数 含义
before_cutoff 68 最早分析早于参考模型的训练截止日期——记忆化基线
after_cutoff 55 最早分析晚于截止日期——对参考模型无泄露,即泛化集
train 21 确定性保留集,用于少样本提示或校准——切勿用于评分
one_analysis 105 单独保留:单条分析是真实证据,但非双标注项

分割是基于**claude-opus-4-5-20251101(训练截止 2025-05-31)计算的,并记录在每行的 split_reference_model / split_reference_cutoff 字段中。分割仅相对该模型有意义;对其他模型,应使用每行的 leakage_free_for 列表,该列表列出训练截止日期严格早于该法案最早分析的模型。截止日期未公开的模型不出现在该列表中**。

行模式(Row Schema)

法案核心字段

字段 含义
bill_key 稳定标识符,如 co-sb205cn-genai-interim-2023
bill_name 官方名称
jurisdiction 管辖级别:federalstate:XXcity:XXeunational:XXinternational
bill_date 精确 YYYY-MM-DD 日期,996 行全部携带;但所标记的里程碑因行而异
bill_date_basis 说明 bill_date 实际代表什么(如 introducedpromulgatedRoyal Assent 等);仅 592/996 行有值,跨司法辖区比较日期前必须读取
bill_status 采集者原文的程序状态(104 种不同取值,故意不规范化)——应改用 status_class 过滤
status_class 制度无关的分类:enactedactivestalledguidancedraftother
bill_text 文书全文(全部 996 行均携带;总计 47,366,541 字符)
bill_language 根据字符测量,而非从管辖推断
group CAST 灾难类别:misuseloss_of_controlsystemicgeopolitical
phase 1_adoption2_implementation3_societal

进展、发起人与结果字段

字段 含义
status_text 统一阶梯上的进展(Introduced or Prefiled → ... → EnactedEffective,以及 VetoedFailed
status_rank status_text 的可排序整数(1–7 阶梯,-1 为负面终态,0 为未知)
primary_party 主要发起人党派:DemocratRepublicanIndependentNon-DesignatedNon-Designated 是积极发现,与 "" 表示“无人核查”不同)
outcome_reason_kind enactedfailedvetoed""(仍在推进)
is_live “排除失败和否决”应过滤的字段;756/996 行为 true
key_actors 发起、支持或受该措施监管的主体

status_class 使用警告

  • status_class 不是结果字段,它记录达到的最远程序阶段;220 个因国会休会而失效的联邦法案仍显示 active
  • guidance 表示已发布但无约束力的文书(33 行)
  • 115 个联邦行带有 govinfo 文档版本代码(如 ihrs),只能归类为 active——这是下限,非恢复的结果
  • 跨板块比较请用 status_classstatus_text 仅在同一板块内使用(如美国板块),中国、欧盟等其他板块该字段为空属设计使然

分析字段(N = 1–3)

字段 含义
human_analysis_N 逐字摘录——可引用的地面真相
human_analysis_N_full 全文(供上下文参考)
analysis_N_source / _author / _url / _date 引用信息
analysis_N_source_type law_firm_legal_analysisthink_tankcivil_societynews_mediaacademic_analysisindustry_analysisother_expert_analysis
analysis_N_lean 记录的意识形态倾向(用于控制视角,非过滤)
analysis_N_date_precision daymonthyearnone;411 个槽位中 337 个有完整日期,57 个尚未设置该字段
n_human_analyses 有效分析槽位数
earliest_analysis_date / _precision 三个槽位中的最早日期及其精度——驱动泄露分割
leakage_free_for 不可能记忆该评述的模型 ID 列表
leakage_computable 泄露声明是否可计算——在信任空的 leakage_free_for 前必须先读取

加载方式

板块文件将行包装在元数据对象中,需按键读取数组(如 ["bills"]["instruments"]),而非裸列表;评估集按分割键(如 after_cutoff)组织。中国文件使用 instruments 键(因中国 AI 治理以法规、通知和标准形式发布),字段模式与其他文件相同。建议用 status_class 过滤(如 enacted),且“排除失败和否决”应使用 is_live 而非 status_class

已知缺口与注意事项

  • bill_date_basis 在 389 个美国行(242 联邦、147 州)及 32 个其他行上缺失
  • 美国州级 primary_party 仅 66/214 行有值(联邦为 602/624)
  • 新加坡《议会选举法》因深度伪造修正案标注为 2024-10-15,而非原 1954 年;日本两行因无确切修正日期保留宿主法规日期并携带 ai_provision_year
  • 佐治亚州两行带有未来生效日期(bill_date_basis: effective
  • 五国(伊朗、肯尼亚、尼日利亚、卢旺达,共 8 行)无任何专家分析,不可作为基准项
搜集汇总
数据集介绍
gps-bench-ai-bills 数据集图片
构建方式
该数据集旨在构建全球人工智能治理领域的全面语料库,共收录996项政策工具全文及411篇独立专家分析,覆盖美国、中国、欧盟及国际组织等41个国家与地区。在构建方式上,数据以法案与专家分析的配对为基本单元,通过四类区域分片文件确保每项法案唯一归属,并依据专家分析的时间与模型训练截止日期设计泄漏控制评估集。分析文本来源于律师事务所、智库及民间社会研究者的公开发表内容,按照严格的时间戳与来源类型进行整理,所有法案均保留完整文本及精确日期,元数据字段注释详尽。
特点
数据集的核心特点在于其严格的泄漏控制机制与多语言、多法域的多维覆盖。评估集按照分析日期相对于参考模型训练截止日期进行划分,确保记忆化基线与无泄漏泛化集的区分,并提供针对其他模型的泄漏自由判断列表。数据结构中规范化的状态分类与丰富的程序性字段,如法案状态等级、主要发起人及最终结果,均经过细致标注,保证了跨法域比较的可靠性。此外,数据集还包含99条法案的独特分类映射,以及针对每个政策领域的阶段性标签,为细粒度分析提供了坚实的实证基础。
使用方法
该数据集适用于多样化的自然语言处理任务,如文本分类、摘要生成及问答系统。通过Python的JSON加载接口,用户可按区域分片或直接使用评估集文件,依据‘status_class’或‘is_live’等字段进行过滤以聚焦特定法律状态或有效性。研究者在进行模型评估时,应优先选用‘after_cutoff’等无泄漏子集,并参考‘leakage_free_for’列表辅助选择合适模型。数据集支持针对AI治理法规内容、合规要求等主题的深入分析,同时鼓励通过重新划分泄漏控制集来满足个性化的评估需求,而无需固定结构引导词语。
背景与挑战
背景概述
GPS-Bench AI Bills and Expert Analyses 数据集于2026年创建,由GPS-bench团队构建,旨在系统性地整理全球人工智能治理法规及专家分析,以支持对AI治理工具的评估。该数据集涵盖996项AI治理文书全文及411份独立专家分析,覆盖41个国家及多个国际组织,时间跨度从早期AI法规至2026年。其核心研究问题在于如何构建一个无数据泄漏、可复现的基准,用于评测语言模型对政策文本的理解与推理能力。该数据集特别关注AI治理的跨国比较,并提供了精细的元数据(如法律状态、生效日期、分析来源类型),对AI治理、法律文本分析及模型评估领域具有重要影响,为后续研究提供了坚实的数据基础。
当前挑战
该数据集的挑战首先体现在领域问题的复杂性:AI治理法规涉及多法域、多语言及动态更新,如何准确比较不同法律体系的效力(如约束性与非约束性文件)是一大难题,且需区分法规状态与最终结果。在构建过程中,团队面临数据收集的广度与细节平衡问题,如确保所有50个州及多国法律的全覆盖,以及日期精确度的不一致(仅592行有明确日期基准)。此外,防止数据泄漏是重大挑战,需通过计算模型训练截止日期与分析发布时间来划分评估集,这一过程复杂且需持续更新。最后,专家分析的数量不均(部分国家无分析),限制了某些区域的基准可用性,也是构建中的显著难点。
常用场景
经典使用场景
GPS-Bench AI Bills 数据集汇聚了全球996项人工智能治理相关法律文书及其全文,并配有411篇由律师、智库及公民社会研究者撰写的独立专家分析,覆盖249项文书。该数据集的核心用途在于构建受控的评估基准,通过将法案文本与专家评述配对,支持对语言模型在理解、归纳与推理AI治理规范方面的能力进行量化评测。研究者可基于其分区结构(如训练集、泄漏控制集)设计任务,如法案要点提取、合规性判断或影响预测,从而在多语言、多法域背景下系统检验模型的泛化性能与记忆泄漏风险。
衍生相关工作
该数据集已衍生出多项前沿工作,包括开发用于法案文本分类、摘要生成及问答任务的专属模型微调基准,推动法律AI领域进步。其泄漏控制设计激励了‘时间感知评估’方法论的研究,催生了新的数据划分算法,以防范评估中的数据污染。此外,基于此语料库,研究者构建了跨法域的法律概念对齐模型,探索不同司法管辖区AI定义与义务的语义映射,并为‘AI治理图谱’的构建提供基础,支撑更复杂的政策仿真与影响预测研究。这些衍生工作不仅在NLP社区产生反响,也为法学与政治学提供了实证研究方法论。
数据集最近研究
最新研究方向
GPS-Bench AI Bills数据集正推动人工智能治理研究迈向实证化与可复现的新阶段。其核心前沿方向聚焦于构建多语言、跨法域的AI政策语料库,并利用专家分析进行泄漏受控的模型评估。近期研究热点包括:利用该数据集验证大型语言模型对全球AI法规的理解与推理能力,探索跨司法管辖区的政策比较分析,以及开发针对AI治理文本的评测基准。数据集覆盖41国及欧盟等国际组织的996项政策文件,并配以411篇专家分析,为AI治理的量化研究、法规影响预测及模型对齐提供了独特资源,其泄漏控制机制尤其为评估模型泛化能力设定了新标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务