遇见数据集

gps-bench-ai-bills

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

GPS-Bench: AI Bills and Expert Analyses 是一个用于评估 AI 治理文书理解能力的数据集。它包含 922 个 AI 治理相关文书(包括美国联邦/州/市级法案、中国法规、欧盟法规、国际条约等)的全文,以及 354 份由独立专家撰写的分析,覆盖其中 209 个文书。每个数据条目以“文书-专家分析”对的形式组织,可询问模型文书要求什么、覆盖谁、将产生什么影响,并根据专家分析进行评分。数据集按地理区域划分为四个配置文件(us、eu、china、international),以及一个专门包含评估子集的配置文件(with_analyses)。每个文书条目包含完整的元数据(如唯一标识符、官方名称、管辖区域、日期、状态、全文等)和最多 3 份专家分析(每份包含原文摘录、来源、作者、类型、倾向性等)。数据集适用于文本分类、摘要、问答等任务,特别适合用于 AI 治理、政策分析、法律文本理解等场景。数据集规模为 n<1K(922 个文书,354 份分析)。

GPS-Bench: AI Bills and Expert Analyses is a dataset for evaluating AI governance document understanding. It contains the full text of 922 AI governance-related documents (including US federal/state/municipal bills, Chinese regulations, EU regulations, international treaties, etc.) and 354 expert analyses covering 209 of those documents. Each data entry is organized as a document-expert analysis pair, allowing models to be asked what the document requires, whom it covers, what impact it will have, and to be scored based on expert analysis. The dataset is divided into four configuration profiles by geographic region (us, eu, china, international) and one profile containing the evaluation subset (with_analyses). Each document entry includes complete metadata (such as unique identifier, official name, jurisdiction, date, status, full text, etc.) and up to 3 expert analyses (each containing excerpt, source, author, type, stance, etc.). The dataset is suitable for tasks such as text classification, summarization, and question answering, and is particularly suited for AI governance, policy analysis, and legal text understanding. The dataset size is n<1K (922 documents, 354 analyses).

创建时间:
2026-07-30
原始信息汇总

GPS-Bench: AI Bills and Expert Analyses 数据集详情

数据集概览

该数据集包含 922个AI治理相关法律文件全文,以及 354份独立专家分析,覆盖其中209个文件,专为防泄漏控制的模型评估设计。数据集的基本单元是“法律文件与人类专家对其的评述配对”,模型可被询问文件要求、约束对象或影响,并依据律师、智库和民间社会研究者的分析进行评分。

数据文件与结构

文件 行数 内容
gps_us_ai_bills.json 820 美国联邦、州及市级措施
gps_international_ai_bills.json 54 美国、欧盟和中国以外的国家法律和框架,以及多边文件
gps_china_ai_bills.json 44 中国法律、行政法规、部门通知及国家标准
gps_eu_ai_bills.json 4 欧盟法规、指令和行为准则
gps_bench_bills_WITH_analyses.json 209 按泄漏划分分组的已分析子集(评估集)

其中,四个板块文件构成完整语料分区,每个文件只出现在一个板块中,bill_key 无重复。gps_bench_bills_WITH_analyses.json 是视图而非第五分区,按划分重新组合209个已分析文件。所有922行均携带精确的 YYYY-MM-DD 日期,并通过 bill_date_basis 标明该日期对应的事件类型(如提出、颁布等)。

国家/地区覆盖

国家/地区 文件数 有效 基准
美国 820 592 73
中国 44 44 16
英国 14 14 5
加拿大 12 11 2
新加坡 8 8 6
印度 7 7 6
日本 4 4 3
欧盟 4 3 3
韩国 2 2 1
澳大利亚、巴西、丹麦、意大利、西班牙、越南 各1 各1 各1
多边 1 1 1
总计 922 692 122

美国覆盖全部50个州及哥伦比亚特区(214个州级、605个联邦、1个市级)。排除的230个包括228个美国(220个因国会休会而失效的联邦法案、2个被否决、6个州级)、欧盟撤回的AI责任指令,以及加拿大AIDA。

评估集设计

209个文件至少有一份专家分析,127个有两份或以上,构成基准合格集。按划分分组:

划分 文件数 含义
before_cutoff 57 最早分析早于参考模型的训练截止日期,构成记忆化基线
after_cutoff 50 最早分析晚于截止日期,对参考模型无泄漏,构成泛化集
train 20 用于少样本提示或校准的确定性保留集
one_analysis 82 单一分析的真实证据,但非双标注项

划分基于 claude-opus-4-5-20251101(训练截止 2025-05-31)计算。分析分布:109个文件有两份分析,18个有三份,82个有一份。

行结构核心字段

文件信息字段包括:bill_key(稳定标识)、bill_name(正式名称)、jurisdiction(管辖区)、bill_date(精确日期)、bill_date_basis(日期事件依据)、enacted_date/effective_date(如适用)、bill_status(程序状态,未规范化)、status_class(跨制度统一桶分类:enactedactivestalledguidancedraftother)、bill_text(全文)、bill_language(语言判定)等。

进展与结果字段包括:status_text(程序阶梯)、status_rank(可排序整数)、primary_party(主要发起人党派)、is_live(是否为有效文件)、outcome_reason_kind(结果类别)、key_actors(关键参与者)等。注意status_class 不是结果字段,只记录程序进展阶段;过滤“排除失败和否决”应使用 is_live

分析字段(每行最多3份):human_analysis_N(逐字摘录)、analysis_N_source_type(来源类型)、analysis_N_lean(意识形态倾向)、analysis_N_date_precision(日期精度)、leakage_free_for(可无泄漏使用的模型列表)等。完整性规则:无来源名称、URL和逐字摘录的行不计入分析。

专家分析来源分布

来源类型 数量
律师事务所法律分析 73
智库 38
新闻媒体 14
学术分析 11
行业分析 7
民间社会 6
独立政策分析 6
民间社会政策分析 5
其他专家分析 5
咨询供应商 4
政府官员解读 3
其余九种单例类型 9

其中3份为 government_official_interpretation 标签,属非独立评论,建议排除。

语言情况

849行为英文,其余:6行中英双语,西班牙语、丹麦语、葡萄牙语、意大利语、越南语、日语、韩语各1行。非英文文本保留原文,部分配官方翻译。

数据加载说明

板块文件将行包裹在元数据对象中,需通过键读取数组而非直接作为列表。评估集按划分分区,而非单一数组。过滤时应使用 status_class 而非 bill_status(后者保留各收集者原始措辞)。

搜集汇总
数据集介绍
gps-bench-ai-bills 数据集图片
构建方式
GPS-Bench AI Bills 数据集精心汇集了922项人工智能治理相关法律文书及其全文,并辅以354篇独立专家分析,覆盖其中209项文书,构建起一套旨在防止数据泄漏的评测体系。其构建遵循严格的去重与分区原则,将文书按美国、欧盟、中国及国际四大板块划分,确保每项文书仅归属于一个板块。尤为关键的是,数据集以'文书-专家分析'配对为基本单元,所有分析均源自律师、智库及公民社会研究人员之手,且他们在撰写时并不知晓其文字将被用于模型评测,从而确保了分析的真实性与独立性。数据构建过程严谨,每项文书均附有精确的日期及其依据,并对全文缺失的条目予以剔除,保障了数据的完整性与可靠性。
特点
该数据集的核心特征在于其对评测泄漏控制的极致追求。通过为每项文书配备'最早分析日期'并标注其相对于参考模型(如Claude Opus 4.5)训练截止时间的先后,数据集将评测对象划分为记忆基线集与无泄漏泛化集,并明确列出'可无泄漏使用模型'列表,为不同模型提供个性化的泄漏风险参考。此外,数据集的元数据设计匠心独运:状态分类(status_class)、进程阶梯(status_text)与活跃状态(is_live)三套体系并行,既保证了跨法域的可比性,又避免了单一字段的误用。文书全文均保留原始语言,多语言支持覆盖九种语言,且所有分析均为逐字摘录,绝无生成或转述,确保了评测基准的权威性与可追溯性。
使用方法
使用此数据集时,研究者应首先通过HuggingFace接口加载相应板块的JSON文件,注意各文件的数据包装结构(如'bills'或'instruments'键)。过滤条件应优先采用标准化的'status_class'和'is_live'字段,而非原始的'bill_status',以避免因各收集者用词差异导致的误解。评测集的使用需遵循其预定义的分区:'train'分区用于少样本提示或校准,切勿用于评分;'after_cutoff'分区可安全用于评估模型的泛化能力;而'before_cutoff'分区则作为记忆化基线。对于其他模型,应依据每行的'leakage_free_for'列表判断其无泄漏属性,该列表仅包含训练截止日期明确早于最早分析日期的模型,对未知截止日期的模型不做任何猜测。
背景与挑战
背景概述
GPS-Bench AI Bills数据集由研究者于2025年创建,旨在系统化整理全球人工智能治理相关法案与专家分析,以支持对AI治理法规的理解与评估。该数据集覆盖922项AI治理文书,包括美国联邦与州级法案、中国法规、欧盟法律及多国政策,并配以354篇独立专家分析,其中209项法案拥有至少一篇分析,127项拥有两篇以上。其核心研究问题在于如何构建一个防泄漏的评估基准,以衡量语言模型在解读和预测AI政策影响方面的能力。该数据集的发布为AI治理领域提供了一个多语言、跨法域的资源库,推动了对AI法律文本的自动化分析与评估,并为后续研究提供了方法论参考。
当前挑战
该数据集面临的挑战包括:1) 领域问题:AI治理法律文本的复杂性要求模型理解跨法域、多语言的政策术语与程序差异,而现有模型在处理此类专业文本时往往缺乏准确性;2) 构建过程:整合来自不同司法管辖区的法案与专家分析需处理日期基准不统一、状态分类标准化困难等问题,如美国联邦法案与州级法案的立法程序差异,以及中国法规的发布机制不同于西方立法流程,增加了数据对齐的难度;此外,确保专家分析的独立性并防止数据泄漏至模型训练集也是一项关键技术挑战,需要精细的日期跟踪与泄漏控制策略。
常用场景
经典使用场景
GPS-Bench AI Bills数据集作为AI治理领域首个大规模、多法域、带专家标注的法律文本基准,其经典使用场景聚焦于评估大型语言模型(LLM)对人工智能相关法律与政策文本的理解与分析能力。研究者可基于该数据集构建文本分类、摘要生成、问答及推理任务,例如判断特定法案的管辖层级、状态类别(如已颁布或失效),或从冗长的法律条文中提取关键义务主体与合规要求。数据集的独特设计(如按模型训练截止时间划分泄漏控制集)使其成为测试模型泛化能力与记忆效应的标准平台,尤其适合评估模型在未见过的法律分析上的推理鲁棒性。
实际应用
在实际应用中,此数据集为立法机构、监管科技公司及法律实务界提供了高效的AI合规工具开发资源。例如,企业可利用其训练法律聊天机器人,快速回答案件是否适用新出台的AI法案、覆盖主体及核心义务;律所可借助基于该数据集的摘要模型,批量跟踪各国AI监管动态并生成客户警示。同时,政府机构可运用其分析功能评估法案间的异同(如欧盟AI法案与中国生成式AI管理办法的对比),辅助政策制定。数据集的负面案例(如未通过的法案)也被用于训练模型识别立法流产的早期信号,从而提升风险预警能力。
衍生相关工作
该数据集衍生出一系列经典学术工作,推动了AI治理与自然语言处理的交叉研究。在基准层面,其泄漏控制拆分方法启发了后续法律评测集的抗污染设计,如后续出现的LegalBench扩展版本或专门针对法规更新的去记忆评估框架。在任务层面,研究者基于其专家分析构建了法律论证抽取、立场检测及法规影响力预测等细粒度任务,部分工作还被用于训练法律专用语言模型(如LegalBERT的治理变体)。此外,数据集中的跨语言法律文本(含中、日、韩等)促进了多语言法律信息检索研究,而中国子集(44项法规)则催生了关于中国AI监管框架的量化分析与国际比较研究,成为政策学与计算法学交叉领域的重要数据源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务