遇见数据集

us-federal-awards-usaspending-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

US Federal Awards & Spending (USAspending) 数据集基于美国官方USAspending.gov档案(2008财年至今),提供联邦合同、拨款和援助奖励数据,以分析就绪的表格形式呈现,包含接收方、机构、金额和奖励元数据。数据集分为三个层级(S、M、L),分别对应精简版、研究版和完整版,每个层级包含多个配置表,如按机构-财年、合同奖励、NAICS代码、接收方概况等。数据格式为Snappy压缩的Parquet文件,总规模在1000万到1亿行之间,语言为英文,适用于表格分类任务。该数据集可用于政府市场规模评估、投标情报、接收方和供应商分析、资助格局研究等场景。许可证为CC BY-NC 4.0(学术/个人使用),商业使用需获取商业许可。

The US Federal Awards & Spending (USAspending) dataset provides federal contract, grant, and assistance award data from the official USAspending.gov archive (FY2008-present), presented in analysis-ready tabular format including recipient, agency, amount, and award metadata. It is organized into three tiers (S, M, L) corresponding to lite, research, and full versions, each containing multiple configuration tables such as by agency-fiscal year, contract awards, NAICS code, recipient profiles, etc. The data is in Snappy-compressed Parquet format, with total rows ranging from 10 million to 100 million, language English, suitable for tabular classification tasks. This dataset can be used for government market size assessment, bid intelligence, recipient and supplier analysis, funding landscape research, etc. License: CC BY-NC 4.0 (academic/personal use), commercial use requires a commercial license.

创建时间:
2026-08-08
原始信息汇总

数据集概述:美国联邦奖励与支出(USAspending)

基本信息

  • 数据集名称:US Federal Awards & Spending (USAspending)
  • 语言:英语
  • 许可协议:CC BY-NC 4.0(知识共享-非商业使用)
  • 任务类型:表格分类(tabular-classification)
  • 数据规模:10M < n < 100M 行
  • 时间范围:2008财年至今(FY2008–present)

数据来源与背景

该数据集基于 USAspending.gov 官方存档构建,涵盖美国联邦合同、拨款及援助奖励数据,由 DataForge 开放数据项目整理并提供。数据经整理为可直接分析的表格式数据,包含受助方、机构、金额及奖励元数据。

数据集分层(Tiers)

数据集分为三个层级,对应不同数据规模与用途:

层级 说明 包大小
S 近期奖励记录入门切片 1.45 GB
M 跨奖励类型和年份的研究包 3.84 GB
L 完整存档:FY2008–至今的奖励与交易表 1.04 GB

数据配置(Configs)

数据集共包含 18 个配置,按层级(S/M/L)与表格类型划分:

表格类型 S层级 M层级 L层级
agency_fy(机构/财年)
contract_awards(合同奖励)
naics_fy(NAICS行业/财年)
recipient_profiles(受助方档案)
assistance_awards(援助奖励)
cfda_fy(CFDA/财年)
recipient_fy(受助方/财年)
state_fy(州/财年)

所有数据以 snappy-parquet 格式存储于 data/<tier>/ 目录下。

数据内容与用途

主要应用场景

  • 政府市场规模分析与投标情报
  • 受助方与供应商分析
  • 拨款资金格局研究
  • 通过UEI/DUNS将奖励关联至注册库

数据包内容

每个原始压缩包内包含:

  • CSV及Parquet格式数据
  • 数据字典(DATA-DICTIONARY)
  • 数据表(DATASHEET,含FCRA禁止使用声明)
  • 质量保证报告(QA report)

使用方式

python from datasets import load_dataset

ds = load_dataset("zalizedata/us-federal-awards-usaspending-dataset", "S-agency_fy", split="train") print(ds[0])

许可说明

  • 学术/个人使用:采用 CC BY-NC 4.0 许可,需注明出处并回链至 https://data.zalize.com
  • 商业使用:需获取 DataForge 商业许可
  • 上游数据:来自美国官方 USAspending.gov 存档,属于公共领域(17 U.S.C. §105)

引用方式

text DataForge (data.zalize.com), built from official USAspending.gov archives — https://data.zalize.com/datasets/us-federal-awards-usaspending-dataset

DOI: 10.5281/zenodo.21837786

搜集汇总
数据集介绍
us-federal-awards-usaspending-dataset 数据集图片
构建方式
该数据集源自USAspending.gov官方联邦合同、拨款与援助奖励档案,覆盖2008财年至今,经DataForge进行清洗、整合与结构化处理,形成分析就绪的表格。构建过程按数据规模分为S、M、L三个层级:S级提供近期奖励记录样本,M级涵盖多奖励类型与年份的研究包,L级为完整历史档案。所有表格以Snappy Parquet格式存储,附带数据字典、数据表与质量保证报告,并通过SHA-256校验确保数据完整性。
特点
数据集以多配置表格形式组织,涵盖机构、合同、NAICS、受赠方、援助、CFDA、州级等多维主题,支持按财年与层级灵活检索。数据规模介于千万至亿行之间,分区存储于data/<tier>/目录下。数据集遵循CC BY-NC 4.0许可,仅限学术与个人使用,商业用途需获得DataForge商业授权。配套文档详尽,包含字段级数据字典、数据表及FCRA禁用通知,确保使用合规与透明。
使用方法
使用者可通过Hugging Face datasets库加载数据集,指定配置名称如“S-agency_fy”并选择train分割即可获取数据。例如调用load_dataset函数并传入数据集标识与配置参数,返回的Dataset对象支持索引访问。完整生产包亦可从DataForge开放数据CDN下载,内含CSV、Parquet、数据字典、数据表及许可文件。该数据集适用于政府市场规模分析、投标情报、受赠方与供应商研究、拨款资助格局探索,以及通过UEI/DUNS与注册系统进行数据关联。
背景与挑战
背景概述
政府财政支出的透明化与可追溯性是现代公共治理的核心议题。美国联邦政府依据《联邦资金问责与透明法案》建立USAspending.gov平台,系统披露2008财年以来的合同、拨款与援助奖励数据。DataForge开放数据计划在此基础上构建了us-federal-awards-usaspending-dataset,将原始档案整理为涵盖机构、行业分类、受赠方画像及州级汇总的分析就绪型表格,划分S、M、L三个层级以适应不同研究需求。该数据集为政府采购市场分析、受赠方行为追踪及财政资金流向研究提供了标准化、可复现的数据基础。
当前挑战
该数据集所应对的领域问题在于联邦支出数据的异构性与碎片化:合同、拨款与援助奖励分属不同申报体系,字段定义与报送口径存在差异,跨财年与跨机构的实体对齐尤为困难。构建过程中的挑战同样显著,包括从海量原始档案中抽取并清洗不一致的机构名称与受赠方标识,协调UEI与DUNS等历史编码体系的映射关系,在保持字段语义完整的同时实现十亿行级数据的存储效率优化,以及确保多层级汇总表与明细记录之间的数值一致性。
常用场景
经典使用场景
在公共财政与政府采购研究领域,基于USAspending.gov官方档案构建的us-federal-awards-usaspending-dataset以其覆盖FY2008至今的联邦合同、拨款与援助奖励记录,成为透视美国联邦支出格局的核心数据基础设施。该数据集最经典的使用场景在于政府市场规模测算与投标情报分析,研究者可借助按财政年度聚合的机构表、NAICS行业表及受赠方档案,系统量化各联邦机构在特定行业中的采购强度与拨款流向,进而识别市场机会与竞争密度,为承包商策略制定与政策评估提供实证支撑。
解决学术问题
长期以来,政府采购与拨款研究受制于数据分散、口径不一与跨年度可比性不足等障碍,难以在统一框架下考察联邦支出的结构性特征。该数据集通过提供标准化的分析就绪表、字段级数据字典与质量报告,有效解决了奖励记录与受赠方身份难以关联、援助与合同支出难以横向比较等常见学术难题。其分层设计兼顾近期记录与完整历史档案,使研究者得以在长时段中检验采购集中度、地域分配公平性及受赠方行为变迁,为公共财政透明度与问责研究奠定了可靠的数据基石。
衍生相关工作
作为DataForge开放数据计划的重要组成部分,该数据集与政府招标与合同奖励、全球公共采购公告、美国研究资助及全球发展援助活动等数据集形成互补谱系,共同拓展了公共支出研究的边界。围绕其构建的衍生工作涵盖联邦采购竞争格局的计量分析、基于NAICS与机构维度的行业支出追踪,以及利用受赠方档案开展的实体网络研究。这些工作不仅验证了数据集在跨库联接与纵向比较中的价值,也推动了政府采购数据在学术与政策社群中的标准化使用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务