遇见数据集

legislative-issue-tracker

收藏
Hugging Face2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

这是一个名为“立法议题跟踪器”(Legislative Issue Tracker)的数据集,专注于美国联邦法律《文书工作削减法案》(Paperwork Reduction Act, PRA, 44 U.S.C. ch. 35, subch. I)。数据集收集了与该法案相关的所有联邦立法活动,包括法案(bills)、立法行动(actions)、会议演讲(speeches)、听证会(hearings)和委员会报告(committee reports)。每一项提及都被分类为以下四种之一:amends(修正法案)、exempts(豁免项目)、references(引用)或related(相关)。该数据集旨在揭示国会如何频繁地修正PRA(254项法案)与豁免个别项目(845项法案)之间的区别。数据来源包括Congress.gov、GovInfo和EveryCRSReport.com等公开政府API,仅存储每个法定引用周围的短段落,不包含全文。数据以Parquet文件格式组织,包含多个表:bills(法案元数据)、actions(立法行动记录)、bill_issues(法案与议题的关联及分类)、candidates(搜索或批量扫描发现的法案文本版本)、text_matches(分类与段落缓存)、text_diffs(连续版本间的差异统计)、speeches(国会记录中的演讲者与发言类型)、documents(提及议题的听证会或委员会报告)、cosponsors(共同提案人)、crs(按标题匹配的CRS报告)以及scan_state(批量数据扫描水印)。此外,还有site/*.json文件用于Web UI展示。数据集覆盖时间范围从1993年至今,通过GovInfo全文搜索和自第113届国会以来的批量数据扫描获取。需要注意的是,分类基于规则而非人工审核,仅少量手工标注的行标记为confirmed=true。44 U.S.C. ch. 35还包含FISMA(子章节II)和CIPSEA(子章节III),这些被分类为related而非PRA。在国会记录中,大多数提及是重新印刷的法案或修正案文本,而非议员发言,speeches.mention_kind字段用于区分。该数据集适用于立法分析、政策研究、文本分类、时间序列分析等任务。

This is a dataset called Legislative Issue Tracker, focusing on the U.S. federal law Paperwork Reduction Act (PRA, 44 U.S.C. ch. 35, subch. I). The dataset collects all federal legislative activities related to this act, including bills, actions, speeches, hearings, and committee reports. Each mention is classified into one of four categories: amends, exempts, references, or related. The dataset aims to reveal the distinction between how often Congress amends the PRA (254 bills) versus exempting individual items (845 bills). Data sources include public government APIs such as Congress.gov, GovInfo, and EveryCRSReport.com, storing only short paragraphs around each statutory reference, not full text. The data is organized in Parquet file format, containing multiple tables: bills, actions, bill_issues, candidates, text_matches, text_diffs, speeches, documents, cosponsors, crs, and scan_state. Additionally, there are site/*.json files for Web UI display. The dataset covers the time period from 1993 to present, obtained through GovInfo full-text search and batch data scanning since the 113th Congress. Note that classifications are rule-based, not human-reviewed, with only a few manually annotated rows marked as confirmed=true. 44 U.S.C. ch. 35 also includes FISMA (subchapter II) and CIPSEA (subchapter III), which are classified as related rather than PRA. In the Congressional Record, most mentions are reprinted bill or amendment texts rather than floor speeches, and the speeches.mention_kind field is used to distinguish. The dataset is suitable for legislative analysis, policy research, text classification, time series analysis, and other tasks.

创建时间:
2026-08-31
原始信息汇总

数据集概述

Legislative Issue Tracker 是一个追踪美国联邦法规相关立法活动的数据集,当前聚焦于《文书削减法案》(Paperwork Reduction Act, PRA,44 U.S.C. ch. 35, subch. I)。数据集记录了与该法案相关的法案、立法行动、国会演讲、听证会和委员会报告,并将每次提及分类为 修正(amends)豁免(exempts)引用(references)相关(related)。数据集的核心理念在于区分这些分类:国会很少修订 PRA(254 项法案),但经常豁免具体项目(845 项法案)。

数据来源与构建

  • 所有数据均来自公开的政府 API(Congress.gov、GovInfo、EveryCRSReport.com)。
  • 仅存储每次法规引用周围的短段落,不包含完整文档文本。
  • 数据集由 abigail-64/legislative-issue-tracker 项目构建。

文件结构与内容

数据集包含 data/*.parquet 文件(流水线状态)和 site/*.json 文件(面向 Web UI 的相同数据)。主要文件及每行对应的内容如下:

文件 每行对应
bills 一项法案(Congress.gov 元数据:提案人、日期、最新行动、法律)
actions 一次记录的立法行动
bill_issues 法案 × 议题关联:分类、段落、版本列表
candidates 通过搜索或批量数据扫描发现的法案文本版本
text_matches 分析缓存(议题、包):分类 + 段落
text_diffs 连续文本版本对:变更统计 + 议题相关块
speeches 国会记录章节:演讲者、演讲 vs 插入的法案文本
documents 提及议题的听证会或委员会报告
cosponsors 法案 × 共同提案人
crs 按标题匹配的 CRS 报告
scan_state 批量数据扫描水位线

数据使用示例

数据集提供了基于 DuckDB 的快速使用示例,可查询 bill_issues.parquet 中不同提及类型的法案数量:

python import duckdb

duckdb.sql(""" SELECT match_type, count(*) AS bills FROM read_parquet(hf://datasets/abigailhaddad/legislative-issue-tracker/data/bill_issues.parquet) GROUP BY 1 ORDER BY 2 DESC """).show()

注意事项

  • 分类方法:分类基于规则(对包含每个引用的从句进行正则匹配),未经人工审核。confirmed = true 标记少量手工标注的行。
  • 覆盖范围:通过 GovInfo 全文搜索覆盖 1993 年至今,并对第 113 届国会及之后的批量数据扫描。更早的法案仅手工标注。
  • 法规范围:44 U.S.C. ch. 35 还包含 FISMA(第 II 子章)和 CIPSEA(第 III 子章),这些被分类为 related,而非 PRA。
  • 国会记录中的提及:大多数提及是法案或修正案文本重印到记录中,而非议员发言;speeches.mention_kind 字段可区分这些情况。

许可与语言

  • 数据集采用 CC0-1.0 许可。
  • 数据语言为英文(en)。
  • 数据集标记涵盖主题:国会(congress)、立法(legislation)、政府(government)、政策(policy)。
搜集汇总
数据集介绍
legislative-issue-tracker 数据集图片
构建方式
该数据集聚焦于美国联邦法规《文书削减法案》(44 U.S.C. ch. 35, subch. I),通过系统化采集国会立法全链条信息构建而成。数据源自公开的政府API,包括Congress.gov、GovInfo及EveryCRSReport.com,涵盖法案文本、立法行动、议员演讲、听证会及委员会报告等多元语料。构建流程采用规则驱动的分类算法,对每项法定引文所在条款进行正则匹配,将其归类为'修订'、'豁免'、'引用'或'关联'四类。数据存储采用Parquet格式分表管理,每个表对应立法流程中的特定实体或关系,且仅保留引文附近的短段落,避免存储全文以控制数据规模。此外,数据构造还整合了113届国会以来的批量扫描与1993年至今的全文检索,辅以少量人工标记行以增强分类准确性。
特点
该数据集的核心特色在于其精细的语义区分维度,能清晰辨识国会针对特定法令的罕见修订行为(仅254项法案)与频繁的逐案豁免做法(845项法案),这一差异揭示了立法实践中的策略性选择。数据覆盖时间跨度自1993年至今,依托政府权威API构建,溯源清晰、权威性高。分类体系采用透明度高的规则基础方法,并通过'confirmed'字段标注人工校验结果,便于用户筛选高置信度数据。同时,数据集特别区分了国会议事录中议员本人发言与重新印制的法案文本,为分析言论与立法行动的关联提供了精细粒度。多维度关联结构(如法案与议题、法案与共同提案人)则支撑了复杂立法网络研究。
使用方法
数据集以Parquet及JSON双格式存储,兼容主流数据分析工具。推荐使用DuckDB进行SQL式查询,例如通过读取bill_issues.parquet文件,可按match_type字段统计各类分类的法案数量,快速洞察立法议题分布格局。对于需要追踪法案版本演化的用户,可关联text_diffs表获取连续文本版本间的差异统计及议题相关的hunk片段。研究立法关系网络的学者可联合bills、cosponsors及actions表构建动态图谱。考虑到分类基于规则且未经人工全面审核,使用时建议关注confirmed字段以区分人工标记行,确保分析结果的可靠性。数据的时间覆盖差异(1993年至今全文检索,113届起批量扫描)亦需结合研究时段酌情考量。
背景与挑战
背景概述
立法议题追踪数据集由abigail-64于近年创建,聚焦美国联邦成文法《文书削减法》在立法进程中的提及与分类,其研究问题在于揭示国会如何通过修正、豁免、引用或关联等不同方式介入特定 statute。该数据集整合了国会法案、立法行动、议事录演讲、听证及委员会报告等多元异构数据源,覆盖自1993年以来的立法记录,并辅以113届国会后的批量扫描及少量人工标注,为政治学与公共政策研究提供了量化分析国会与行政程序互动的宝贵资源,尤其揭示了对PRA频繁豁免而罕见修正的结构性现象。
当前挑战
该数据集面临的核心挑战包括领域层面与构建层面两大类。领域上,需精准区分国会对法律的不同修改语义,尤其是豁免与修正的细微界定,及PRA所涵盖的FISMA与CIPSEA子章节相关条款的归类歧义,以避免误读立法意图。构建层面,分类依赖基于规则的正则表达式对引用条款周遭文本的解析,缺乏人工审核导致大量机器标注噪声;早期(1993年前)数据仅能依靠人工标注,覆盖不完全;此外,国会记录中多数提及源于重印文本而非议员发言,需设计算法以区分真实发言与插入性内容,增加了语料处理的复杂性和准确性挑战。
常用场景
经典使用场景
该数据集为研究美国国会立法过程中特定法规(如《文书削减法》)的提及与修改动态提供了一套结构化资源。研究者可借此追踪每一条法案、立法行动、会议发言或委员会报告中对某一法规的引用,并依据‘修正’、‘豁免’、‘引用’或‘相关’等类别进行分类分析。其设计精巧,尤其适合用于探究国会如何频繁豁免特定项目免受法规约束,而直接修订却较为罕见,从而揭示立法行为的微妙差异。
解决学术问题
此数据集解决了政治学与公共政策领域中一个关键难题:难以量化地测量立法活动对单一法规的长期关注度及其性质变化。传统方法依赖人工阅读或小样本案例,效率低且覆盖有限。本数据集通过系统化的全文扫描与规则分类,构建了自1993年以来的全面时间线,使研究者能够检验关于立法注意力分配、法规僵化与豁免政治等理论假设,为理解国会与行政法规互动提供了坚实的数据基础。
衍生相关工作
基于此数据集,可衍生出一系列有影响力的研究工作。例如,构建立法效率的预测模型,评估不同国会会期对法规修订或豁免的倾向;开发可视化仪表盘,呈现法规受到的立法压力随时间演变图谱;或进行因果推断,分析豁免行为是否导致特定项目在监管合规上的差异。另外,方法上的改进——如利用语言模型提升分类精度——也将成为自然语言处理在政治学交叉应用中的范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务