遇见数据集

us-warn-act-layoffs-daily

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是美国WARN法案裁员通知的标准化汇总,每天自动从39个州劳动部门门户网站重新抓取、归一化、去重并上传。数据集包含2024年1月1日至今的9,440条通知,覆盖39个州(AK, AL, AZ, CA, CO, CT, DC, DE, FL, GA, IA, IL, IN, KS, KY, LA, MD, ME, MI, MS, MT, NC, NE, NJ, NM, NY, OK, OR, PA, RI, SC, SD, TN, TX, UT, VT, WA, WI, WV)。每条记录包含稳定行ID、州代码、雇主名称(原始和规范化形式)、营业名称别名、地点、受影响员工人数、通知日期、生效日期、通知类型以及首次观测日期。数据可用于表格分类(如预测裁员类型)和时间序列预测(如分析裁员趋势)。数据集采用CC BY 4.0许可,每日更新以确保时效性,并提供免费层级和付费完整历史档案。

This dataset is a standardized aggregation of layoff notices under the U.S. WARN Act, automatically re-scraped, normalized, deduplicated, and uploaded daily from 39 state labor department portals. It contains 9,440 notices from January 1, 2024 to present, covering 39 states (AK, AL, AZ, CA, CO, CT, DC, DE, FL, GA, IA, IL, IN, KS, KY, LA, MD, ME, MI, MS, MT, NC, NE, NJ, NM, NY, OK, OR, PA, RI, SC, SD, TN, TX, UT, VT, WA, WI, WV). Each record includes a stable row ID, state code, employer name (original and normalized form), trade name alias, location, number of affected employees, notice date, effective date, notice type, and first observed date. The data can be used for tabular classification (e.g., predicting layoff types) and time series forecasting (e.g., analyzing layoff trends). The dataset is licensed under CC BY 4.0, updated daily to ensure timeliness, and offers a free tier and a paid full historical archive.

创建时间:
2026-09-02
原始信息汇总

数据集概述:US WARN Act Layoff Notices

基本信息

  • 数据集名称:美国WARN法案裁员通知(US WARN Act Layoff Notices)
  • 许可协议:CC BY 4.0(免费层级)
  • 语言:英语
  • 数据规模:1K-10K条记录(免费层级包含9,445条通知)
  • 任务类型:表格分类、时间序列预测
  • 标签:裁员、劳动力市场、美国、公共记录、政府数据、替代数据等

数据内容与覆盖范围

  • 覆盖范围:美国39个州(包括AK、AL、AZ、CA、CO、CT、DC、DE、FL、GA、IA、IL、IN、KS、KY、LA、MD、ME、MI、MS、MT、NC、NE、NJ、NM、NY、OK、OR、PA、RI、SC、SD、TN、TX、UT、VT、WA、WI、WV)
  • 未覆盖的州:AR、HI、ID、MA、MN、MO、ND、NH、NV、OH、VA、WY(共12个州)
  • 通知时间范围:2024年1月1日起的通知(免费层级)
  • 数据特点:每日从39个州劳动部门门户网站自动抓取、标准化、去重,包含雇主名称规范化处理

数据更新机制

  • 更新频率:每日自动重建
  • 最近重建日期:2026-09-05
  • 更新方式:自动化管道每日重新抓取各州门户网站,重新标准化、去重并上传

数据模式(Schema)

列名 含义
id 稳定的行ID
state 州两位字母代码
company 提交时的雇主名称
company_canonical 规范化雇主名称
company_dba 经营别名
location 提交时的工厂地点
employees_affected 通知涉及员工人数
notice_date 通知提交日期
effective_date 计划裁员/关闭日期
notice_type 通知类型(裁员/关闭/修订等)
first_seen 管道首次发现该行记录的日期

使用方式

  • Hugging Face数据集加载:支持通过load_dataset("APProjects/us-warn-act-layoffs-daily")加载
  • 直接读取CSV文件:可通过pd.read_csv读取CSV文件(数据文件路径为data/warn_notices.csv
  • 探索工具:提供实时探索器(live explorer Space),可搜索雇主、查看最新通知和各州数据新鲜度
  • 配套资源:GitHub仓库(github.com/APVentureEngine/warn-act-notices)提供统计站点、各州CSV、周报/月报页面、RSS和API文档

付费层级

  • WARN Watch:按雇主+州匹配每日刷新,提供私人提醒页面和RSS,49美元/年,支持免费30天试用
  • 完整历史档案:1988年至今,共45,777条记录,199美元一次性购买

引用与许可说明

  • 免费层级使用CC BY 4.0许可
  • 引用方式:"WARN Feed, github.com/APVentureEngine/warn-act-notices"
  • 底层爬虫包含Apache-2.0许可的biglocalnews/warn-scraper代码
搜集汇总
数据集介绍
us-warn-act-layoffs-daily 数据集图片
构建方式
该数据集以美国《工人调整和再培训通知法》(WARN Act)为制度依托,针对各州劳工部门分散发布裁员通知、格式互异且变动频繁的痛点,构建了一条每日自动化的数据流水线。系统每日重新抓取46个州级劳工门户网站,将原始文件统一映射为涵盖州代码、雇主名称、受影响人数、通知日期与生效日期等11个字段的标准模式,并对日期进行ISO解析、对雇主名称执行规范化消歧与去重。全量记录可回溯至1988年,当前包含49,403条通知,且通过稳定ID保留逻辑实现对州级数据修订的持续对账。
使用方法
使用时可借助Hugging Face datasets库直接加载训练集,或通过pandas读取远程CSV进行探索。数据集支持以通知日期或生效日期为基准进行月度、年度聚合,也支持按州、按企业筛选。由于文件每日重建,建议在消费端建立定期刷新机制而非一次性快照。对于仅关注特定雇主或州的用户,可接入配套的WARN Watch服务实现增量匹配与提醒,无需重复下载全量文件。
背景与挑战
背景概述
在劳动力市场透明度与宏观经济监测的迫切需求下,US WARN Act Layoff Notices数据集应运而生。该数据集由APProjects团队构建,旨在解决美国各州WARN法案裁员通知数据高度碎片化、格式迥异且时效性差的长期困境。其核心研究问题在于如何将46个州劳工部门门户中异构、非标准的公开记录,持续、稳定地规范化为统一、可跨州比较的数据资源。通过每日自动重建流程,该数据集不仅为研究者提供了覆盖1988年至今近五万条裁员通知的完整档案,更在劳动经济学、企业行为分析与公共政策评估领域产生了显著影响力,成为替代传统政府统计项目缺失的关键基础设施。
当前挑战
该数据集所应对的领域挑战在于,美国各州WARN法案执行标准与信息公开实践存在巨大差异,导致全国性裁员动态的实时监测与量化分析长期受阻。构建过程中,技术挑战尤为突出:需从35种不同的列布局与196个各异的列名中提取并映射至统一模式,其中马里兰州甚至无表头行,须按位置匹配;雇主名称存在9种不同表述,跨州实体消歧与规范化难度极高。此外,各州门户频繁修订、重发或静默删除记录,要求管道具备稳定ID保留与每日对账能力,以对抗数据源的持续漂移,确保历史序列的可复现性与分析可信度。
常用场景
经典使用场景
在劳动经济学与就业市场监测领域,该数据集凭借其覆盖46州、回溯至1988年的49,403条WARN法案裁员通知记录,构成了大规模裁员事件研究的核心数据基础。经典使用场景聚焦于裁员事件的时序分析与跨州比较研究,研究者可借助notice_date与effective_date两个时间维度,量化雇主实际给予工人的提前通知天数,进而考察WARN法案60天通知要求的执行状况,并可按月、按州、按行业聚合裁员人数与事件频次,识别就业市场的周期性波动与结构性变迁。
解决学术问题
该数据集有效解决了裁员研究中长期存在的数据碎片化与口径不一问题。此前各州劳工部门以35种不同列布局和196个不同列名发布通知,雇主名称亦存在多种表述,致使跨州裁员研究难以开展。该数据集通过统一模式映射、日期ISO标准化及雇主名称规范化,使研究者得以追踪同一企业在多州的裁员行为,并首次系统性地计算出通知期天数这一各州均未公布的指标,为劳动法合规性研究、裁员预警机制评估及区域经济韧性分析提供了可复现的量化依据。
实际应用
在实务层面,该数据集为人力资源规划、供应链风险预警及地方经济政策制定提供了即时可用的信息源。企业可据此监测竞争对手或关键供应商的用工调整动向,求职者与职业顾问可识别即将释放大量劳动力的行业与地区,政府劳工部门与智库则可依托每日更新的数据构建裁员预警仪表盘,追踪特定雇主或州的裁员动态。其每日重建机制确保了数据的时效性,使上述应用得以建立在最新且去重后的记录之上。
数据集最近研究
最新研究方向
在劳动力市场实时监测领域,该数据集推动了对《工人调整和再培训通知法》(WARN Act)执行效力的量化评估。最新研究聚焦于利用每日重建的46州通知记录,计算实际通知期与法定60天门槛的偏离,并结合企业跨州裁员模式(如Sodexo、Walmart等多州申报案例)分析裁员决策的集中化与前瞻性。同时,该数据集为填补BLS大规模裁员统计项目终止后的数据空白提供了替代方案,支持构建高频失业预警指标和评估州级劳动保护政策的异质性效果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务