遇见数据集

federal-ai-enforcement

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

US Federal AI Enforcement Tracker(美国联邦人工智能执法追踪器)是一个来源可查的数据集,专门收录美国联邦层面涉及人工智能或自动化系统的执法行动及相关官方材料。该数据集旨在为人工智能监管、法律执行和公共政策研究提供结构化的实证数据。数据以结构化表格(CSV)和JSON格式提供,包含核心字段如唯一标识、执法机构、目标对象、日期信息、法律依据、案件状态、AI议题标签等,以及支持性字段如案卷号、来源引用等,确保数据的可追溯性和可验证性。数据集适用于人工智能治理、法律合规分析、监管政策研究等场景,遵循CC BY 4.0许可协议,但需注意其描述性研究性质,并非法律建议。

The US Federal AI Enforcement Tracker is a verifiable dataset that specifically collects enforcement actions and related official materials at the U.S. federal level involving artificial intelligence or automated systems. It aims to provide structured empirical data for AI regulation, law enforcement, and public policy research. The data is provided in structured formats (CSV and JSON), including core fields such as unique identifiers, enforcement agencies, targets, dates, legal authorities, case statuses, AI issue tags, and supporting fields like docket numbers and source citations to ensure traceability and verifiability. The dataset is suitable for applications in AI governance, legal and compliance analysis, regulatory policy research, and more, under the CC BY 4.0 license, with the note that it is descriptive research and not legal advice.

创建时间:
2026-07-20
原始信息汇总

数据集概要

数据集名称为 US Federal AI Enforcement Tracker,由 Vorp Labs 维护,是一个基于原始来源的美国联邦执法行动及相关官方材料的数据集,涉及人工智能或自动化系统。

版本与规模

  • 当前版本:2026.07.19
  • 覆盖范围:截至 2026-07-18,追踪 42项联邦执法行动。
  • 数据集规模:类别为 n<1K(记录数少于1000条)。

许可与语言

  • 许可证:CC BY 4.0(署名 4.0 国际)
  • 语言:英语

数据文件与格式

主要数据文件为 federal-ai-enforcement.csv,存放于 releases/2026.07.19/ 目录下。完整发布包包含以下文件:

  • federal-ai-enforcement.csv:平面行动表,适用于电子表格和分析。
  • federal-ai-enforcement.json:结构化发布对象,包含行动记录、相关材料、变更日志和监控来源。
  • release-manifest.json:版本、来源URL、记录计数、字节计数及SHA-256校验和。
  • CITATION.cff:机器可读的引用元数据。
  • README.md:版本特定的文档。
  • SHA256SUMS:文件完整性校验文件。
  • LICENSE.txt:CC BY 4.0 许可条款。

主要字段

数据集中每条行动记录包含以下关键字段:

  • anchoragencytargetshortName:行动标识与参与者。
  • filedDateorderDate 及其精度字段:日期信息及不确定性标记。
  • legalAuthoritystatusoutcomesummaryaiIssueTags:法律依据、状态、结果、摘要及AI相关标签。
  • docketOrFileNumberseventspenaltiesrelatedAnchors:案卷号、事件、处罚及关联行动。
  • factChecksopenItemssourcesurl:事实核查、未决事项、来源链接及记录级溯源。

用途与限制

  • 该数据集为描述性研究,不构成法律建议
  • 不保证涵盖所有涉及软件或算法的执法事项。
  • 使用前请核对原始来源链接及数据截止日期。

永久标识符与规范来源

  • 规范研究页面:https://vorplabs.com/ai-regulatory-updates/federal-enforcement
  • 规范发布清单:https://vorplabs.com/datasets/federal-ai-enforcement/manifest.json
  • 不可变GitHub发布:https://github.com/vorplabs/research-datasets/tree/73c7586aa4df7640000760520fdbcf96d371303c/datasets/federal-ai-enforcement/2026.07.19
  • 版本DOI:https://doi.org/10.5281/zenodo.21456232
  • 概念DOI:https://doi.org/10.5281/zenodo.21456231

完整性验证

可在发布目录中运行以下命令进行SHA-256校验:

shasum -a 256 -c SHA256SUMS

搜集汇总
数据集介绍
federal-ai-enforcement 数据集图片
构建方式
该数据集名为“US Federal AI Enforcement Tracker”,由Vorp Labs维护,旨在系统追踪美国联邦层面涉及人工智能或自动化系统的执法行动及相关官方材料。数据集以2026年7月19日为版本节点,收录了截至2026年7月18日的42项联邦执法行动。构建方式上,数据集依托权威研究页面和GitHub发布渠道,确保来源可追溯。数据以CSV和JSON两种格式呈现,包含行动记录、相关材料、变更日志及监测来源,并辅以SHA-256校验和文件确保完整性。每条记录均关联永久标识符与版本DOI,支持跨平台验证。
特点
该数据集的核心特点在于其精细化的字段设计与高度结构化的信息组织。行动记录中包含了锚点、机构、目标、简称等标识信息,同时通过提交日期、命令日期及其精度字段保留时间不确定性。法律依据、状态、结果、摘要及AI问题标签等字段详细描述了事件性质。此外,数据集支持交叉验证,提供了案卷号、事件序列、处罚措施及相关锚点。每个记录均附有事实核查、未决事项、来源链接和URL,确保证据链完整,体现了极高的透明度和可追溯性。
使用方法
该数据集的使用方法灵活便捷,用户可直接从Hugging Face仓库下载包含CSV和JSON格式的完整发布包。CSV文件适用于电子表格和基础统计分析,而JSON格式则便于程序化处理与集成。用户可通过官方研究页面获取最新版本与方法论说明,或利用GitHub发布链接访问不可变存档。为确保数据完整性,建议在下载后运行SHA-256校验和验证。数据遵循CC BY 4.0许可协议,允许在署名条件下自由使用与分发,但需注意该数据集仅为描述性研究,不构成法律建议,使用时应核对原始来源链接与截止日期。
背景与挑战
背景概述
随着人工智能技术在各领域的深度渗透,美国联邦机构针对AI系统的执法行动日益增多,但相关案例的分散性与非标准化记录严重制约了政策研究、合规分析与学术评估的开展。在此背景下,Vorp Labs于2026年创建了美国联邦AI执法追踪数据集,系统收录截至2026年7月18日的42项联邦执法行动及相关官方材料。该数据集以开源形式发布,涵盖机构、法律依据、处罚措施等结构化字段,并附带版本控制与哈希校验机制,成为连接AI治理理论与实践的关键实证资源,为监管一致性研究、执法趋势分析及跨国比较提供了亟需的数据基础。
当前挑战
数据集所面临的挑战首先源于领域问题的复杂性:AI执法跨多个联邦机构与法律框架,涉及FTC、SEC、DOJ等主体的不同管辖权与执法标准,统一归类与标注难度极高。其次,对于数据集构建本身,原始信息来源分散于法院记录、新闻公告及行政命令,需人工筛选与交叉验证,加之部分行动存在非公开或延迟披露现象,导致记录完整性与时效性难以保证。此外,技术术语的快速演化使分类体系面临过时风险,而数据集的描述性研究定位也限制了其法律效力,用户必须依赖原始链接核实信息,这在一定程度上削弱了其作为权威参考的适用性。
常用场景
经典使用场景
在人工智能治理与行政法交叉研究的浪潮中,该数据集作为首个系统梳理美国联邦层面AI执法行动的结构化资源,为学者和政策制定者提供了精准的实证基础。其经典使用场景集中于对执法案例的定性与定量分析,研究者可依据action、agency、target等核心字段,按时间序列或法律授权类型对执法行动进行编目与统计。结合aiIssueTags等标签体系,能够深入剖析不同AI技术形态(如算法歧视、深度伪造、自动化决策)所引发的监管响应差异,从而勾勒出联邦机构在AI监管领域的行为模式与政策倾向。
实际应用
在实际应用中,该数据集主要服务于AI政策制定与合规风控领域。法律实务工作者可借助penalties与outcome字段快速检索同类案例的裁量基准,为企业AI产品的部署提供法律风险预警。监管机构能基于事件时间线(filedDate、orderDate)追踪执法动态演变,优化资源配置。同时,科技公司的伦理与合规团队可依据sortedBy的legalAuthority标签构建内部合规检查清单,将数据集中归纳的执法逻辑转化为可落地的业务规则,助力组织在创新与合规之间寻求动态平衡。
衍生相关工作
围绕该数据集的开放性,已衍生出多项具有影响力的研究工作。典型工作包括基于自然语言处理的执法文本分类模型,用于从summary字段中自动识别AI风险类型;利用网络分析方法对relatedAnchors字段进行关联挖掘,构建AI执法行动的知识图谱;以及采用时间序列预测算法,结合filedDate与events字段推测下一阶段监管热点。此外,部分研究进一步将该数据集与FTC、CFPB的公开执法数据库进行对齐,形成跨机构监管追踪的联合分析框架,持续拓展AI治理实证研究的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务