遇见数据集

us-mass-layoff-and-plant-closing-statistics-monthly

收藏
Hugging Face2026-09-11 更新2026-09-12 收录
官方服务:

资源简介:

该数据集提供了美国大规模裁员和工厂关闭的月度统计数据,每日基于各州WARN法案申报数据重新构建。由于美国劳工统计局(BLS)的大规模裁员统计项目(MLS)于2013年终止,本数据集旨在填补这一空缺。数据涵盖1988年11月至2026年9月共455个月,包含35,612个事件,其中最近12个月(2025年8月至2026年7月)记录了2,115个事件,涉及349,782名工人。数据集提供两种配置:全国月度汇总(monthly_national.csv)和按州分组月度汇总(monthly_by_state.csv)。字段包括月份、事件总数、受影响工人数、明确关闭事件数、明确裁员事件数、未分类事件数以及部分月份标记(is_partial)。该数据集可用于时间序列预测、表格回归等任务,适用于劳动力市场分析、宏观经济研究、替代数据应用等领域。使用时需注意:该数据不是BLS系列的延续,最后两个月可能不完整,关闭/裁员分类仅覆盖部分事件,WARN法案仅反映通知的裁员情况,COVID-19冲击显著,以及2000年之前数据较为稀疏。

This dataset provides monthly statistics on mass layoffs and plant closures in the United States, reconstructed daily based on WARN Act filings from each state. It aims to fill the gap left by the termination of the Bureau of Labor Statistics (BLS) Mass Layoff Statistics (MLS) program in 2013. The data covers 455 months from November 1988 to September 2026, containing 35,612 events, of which the most recent 12 months (August 2025 to July 2026) recorded 2,115 events affecting 349,782 workers. The dataset offers two configurations: monthly national summary (monthly_national.csv) and monthly summary by state (monthly_by_state.csv). Fields include month, total events, total affected workers, number of identified closure events, number of identified layoff events, number of unclassified events, and a partial month flag (is_partial). It can be used for tasks such as time series forecasting and tabular regression, and is suitable for labor market analysis, macroeconomic research, and alternative data applications. Usage notes: This is not a continuation of the BLS series; the last two months may be incomplete; closure/layoff classifications cover only a subset of events; WARN Act reflects only notified layoffs; COVID-19 caused a significant shock; and data before 2000 is relatively sparse.

创建时间:
2026-09-09
原始信息汇总

美国大规模裁员与工厂关闭统计(月度)

数据集概述

  • 数据集名称:US Mass Layoff and Plant Closing Statistics — monthly, rebuilt daily
  • 许可协议:CC BY 4.0
  • 语言:英语(en)
  • 任务类别:时间序列预测(time-series-forecasting)、表格回归(tabular-regression)
  • 数据规模:1K < n < 10K

数据背景

  • 美国劳工统计局(BLS)曾运行大规模裁员统计(Mass Layoff Statistics)项目,最终发布于 2013-06-21(覆盖至 2013 年 5 月),该项目于 2013-09-30 被取消。
  • 此后美国再无月度、全国性、机器可读的大规模裁员与工厂关闭事件统计。
  • 本数据集基于各州 WARN Act 备案构建,每天从源门户重建

关键数据指标

指标 数值
事件数(2025-08 → 2026-07) 2,115
受影响工人数(同期 12 个月) 349,782
覆盖月份数(1988-11 → 2026-09) 455
全历史事件数 35,612
最后从实时州门户重建日期 2026-09-11
  • 最近 24 个完整月份(2024-08 → 2026-07)每月事件数范围:最低 106,最高 247。

数据行定义

  • 一个事件指影响50 名及以上工人的单个 WARN Act 通知,对应单一雇主场所。该阈值是 WARN Act 自身的大规模裁员下限。

数据结构

配置(configs)

  • national(默认):data/monthly_national.csv,每月一行
  • by_statedata/monthly_by_state.csv,按州拆分(当前抓取 46 个州)

字段

  • month:月份
  • events:事件数
  • employees_affected:受影响员工数
  • closure_events:工厂关闭事件数
  • layoff_events:裁员事件数
  • unclassified_events:未分类事件数
  • is_partial:是否为不完整月份

月度数据示例(部分)

month events employees_affected closure_events layoff_events
2026-07 142 22,737 40 46
2026-06 155 19,981 45 49
2026-05 167 46,508 51 53
2026-04 214 32,815 69 52
2026-03 178 22,814 67 47
2026-02 204 28,251 69 50
2026-01 212 34,546 86 57
2025-12 106 14,157 39 31
2025-11 136 25,114 38 42
2025-10 247 46,774 71 97
2025-09 191 31,966 57 59
2025-08 163 24,119 52 64
2025-07 175 26,543 59 52

使用前必读注意事项

  1. 非 BLS 序列,不可拼接:BLS MLS 统计的是失业保险申请事件(同一机构 5 周内 50+ 初次申请),本数据集统计的是 50+ 受影响工人的 WARN 通知。两者统计范围、触发条件、滞后均不同。仅在目的上可作为继任者,绝不可作为 BLS 数据的延续。
  2. 最后 2 个月不完整,标记为 is_partial=true。州门户批量发布,近期月份会在事后数周内补全。应丢弃或标注,不可从最后一根柱读取趋势。
  3. 关闭/裁员拆分仅覆盖部分数据。35,612 个事件中,9,730 个明确为工厂关闭,11,040 个明确为裁员,14,842 个因通知类型不明而未分类。上游字段为 46 个独立机构的自由文本,原始值包括 statewarncl2 及空白。仅对无歧义文本分类,其余报告为未分类。eventsemployees_affected 不受此影响,为可信字段。
  4. WARN 并非全部裁员。它约束超过规模阈值的雇主,豁免若干情形,且各州执法不一。本数据集衡量的是已通知的大规模裁员——是下限,而非总量。覆盖 46 个州,而非 50 个。
  5. COVID 冲击将主导任何模型。仅 2020-04 一个月就有 2,795 个事件、519,909 名工人。
  6. 早期年份数据稀疏,属档案缺失而非历史。455 个月每月至少有一个事件,但 35,612 个总事件中仅 1,606 个发生在 2000 年之前——多数州门户不发布那么早的数据,且发布深度不一。应将 2000 年前视为部分档案;序列大致从 2000 年代中期起密集。

快速开始

python from datasets import load_dataset

nat = load_dataset("APProjects/us-mass-layoff-and-plant-closing-statistics-monthly", "national", split="train") st = load_dataset("APProjects/us-mass-layoff-and-plant-closing-statistics-monthly", "by_state", split="train")

python import pandas as pd url = "https://huggingface.co/datasets/APProjects/us-mass-layoff-and-plant-closing-statistics-monthly/resolve/main/data/monthly_national.csv" df = pd.read_csv(url, parse_dates=["month"]) df = df[~df.is_partial] # 丢弃各州仍在申报的月份 df.set_index("month").events.plot()

构建方式

  1. 定时管道每日重新抓取 46 个州劳工部门的 WARN 门户——不是一次,而是每天,因为各州会修改人数、重新发布通知并静默删除行。
  2. 行被标准化为单一模式、去重,雇主名称规范化。该输出免费发布于 APProjects/us-warn-act-layoffs-notices-daily——每条通知,无阈值,无延迟。
  3. 本序列是该文件的确定性聚合:过滤 employees_affected >= 50,以 WARN 备案日期为键,按月分组。

由于第 1 步每天运行,此处的数字会变动。静态副本下载当周即开始过时——这正是将其作为实时数据集而非论文发布的意义所在。

许可与来源

  • 许可:CC BY 4.0
  • 底层数据:美国各州公开记录(WARN 通知)
  • 署名US Mass Layoff & Plant Closing Statistics, WARN Feed, 2026-09-11
  • 修订与提问:可在数据集讨论区提出

相关资源

  • APProjects/us-warn-act-layoffs-notices-daily:通知级源数据,免费,59,134 行,无阈值。
  • Per-employer and per-state alerts:若跟踪特定雇主或州而非聚合数据,WARN Watch 会在每次每日刷新时运行你的列表,并提供私有提醒页面和 RSS 订阅。免费 30 天,无需信用卡。
  • Coverage and methodology:说明抓取哪些门户、何时抓取以及缺失内容。
搜集汇总
数据集介绍
us-mass-layoff-and-plant-closing-statistics-monthly 数据集图片
构建方式
在宏观经济监测体系中,大规模裁员与工厂关闭事件长期依赖官方统计,而美国劳工统计局的相关项目于2013年因预算削减终止,致使月度、全国性、机器可读的裁员事件计数出现空白。该数据集以州级WARN法案申报为原始素材,通过自动化流水线每日重新抓取46个州劳工部门的门户网站,将异构字段归一化为统一模式,经过去重与雇主名称规范化处理,再以受影响员工数不少于50人为阈值、按WARN申报日期为键进行月度聚合。这种确定性聚合方式使数据集能够持续吸收各州事后修订与补报,从而在官方统计缺位的情况下提供可复现的替代性指标。
特点
该数据集的时间跨度自1988年11月至2026年9月,涵盖455个月、逾3.5万起事件,其中近12个月记录2,115起事件、涉及约35万名员工,规模精炼而信息密度较高。其显著特征在于日度重建机制带来的动态性,最新月份标注为不完整以提示用户审慎解读趋势;事件类型区分明确关闭与明确裁员,对语义模糊的原始文本拒绝强行归类并单列未分类字段,体现了对数据诚实性的坚持。同时,数据集覆盖46个州而非全美50州,且2020年4月的疫情冲击构成极端异常值,前2000年数据因州门户存档深度有限而相对稀疏,这些边界条件均在文档中予以明确提示。
使用方法
研究者可通过Hugging Face数据集库加载全国或分州配置,分别获取月度汇总与州级细分数据,亦可直接读取CSV文件并以月份为解析键进行时间序列分析。在建模实践中,建议先剔除标记为不完整的近期月份,或将其单独标注,以避免将补报过程误读为趋势变化;对于裁员与关闭的类型划分,应以事件总数和受影响员工数为主要信任字段,未分类事件不宜强行纳入分类模型。鉴于该序列与劳工统计局原有口径不可拼接,使用时应将其定位为WARN法案申报范围内的大规模裁员下限指标,并留意疫情期异常值与早期存档偏差对模型拟合的潜在影响。
背景与挑战
背景概述
美国大规模裁员与工厂关闭的月度统计,其官方源头可追溯至劳工统计局主持的Mass Layoff Statistics项目,该项目因2013年自动减支机制而终止,自此全国层面再无月度、机器可读的裁员事件计数。为填补这一统计空白,相关研究团队依托各州WARN法案申报门户,构建了覆盖1988年11月至2026年9月共455个月、逾3.5万起事件的月度序列,并于每日从州级门户重新抓取更新。该数据集以失业预警通知为观测单元,为劳动力市场动态监测、宏观经济周期识别及衰退预警提供了高频替代性数据基础,在官方统计缺位背景下具有显著的学术与政策价值。
当前挑战
该数据集所应对的核心领域问题,是在官方大规模裁员统计中断后重建可比的月度裁员与工厂关闭事件序列,以支撑时间序列预测与经济周期分析。其构建过程面临多重挑战:各州WARN门户发布批次不一,近两个月数据常不完整,需以部分标记提示使用者审慎解读;上游通知类型字段为46个机构自由文本,歧义值众多,导致工厂关闭与裁员的精确划分仅覆盖部分记录,研究团队拒绝臆测归类;WARN法案本身设有雇佣规模门槛、豁免情形且各州执法力度悬殊,故该序列仅衡量已通知的裁员下限而非全部裁员;新冠疫情冲击使2020年4月数据极端突出,易主导模型拟合;2000年以前记录稀疏,属档案缺失而非真实历史趋势。
常用场景
经典使用场景
在宏观经济监测与劳动市场分析领域,该数据集最为经典的使用场景在于构建美国大规模裁员与工厂关闭的高频月度指标体系,服务于经济周期识别与衰退预警研究。研究者可依托其1988年至今逾455个月的连续序列,将月度裁员事件数与受影响雇员人数作为劳动力市场压力的代理变量,并与失业率、初请失业金人数、职位空缺等传统指标进行交叉验证。该数据的每日重构建机制使其天然适用于即时监测与实时预测任务,从而为政策制定者、金融机构与学术团队提供一份独立于官方统计的高频替代性数据源。
解决学术问题
该数据集直面一个长期困扰学术界的统计空白:美国劳工统计局的大规模裁员统计项目于2013年因财政紧缩终止,此后全国层面再无统一的、机器可读的月度大规模裁员事件计数。该数据集通过整合46个州的《工人调整与再培训通知法》申报记录,重构出可追溯至1988年的长时序面板,从而缓解了研究者在裁员动态、工厂关闭冲击、区域劳动力市场韧性等议题上的数据可得性约束。其明确区分已分类与未分类事件的做法,亦为测量误差与方法论透明性研究提供了范例。
衍生相关工作
围绕该数据集,已衍生出一系列相互衔接的数据产品与研究基础设施。其上游通知级数据集us-warn-act-layoffs-notices-daily提供了完整、无阈值限制的原始申报记录,构成聚合序列的透明化基础。在应用端,WARN Watch等工具将每日刷新数据对接至特定雇主与州的定制化预警服务,生成私有警报页面与RSS订阅,拓展了从学术分析到商业监测的转化路径。同时,其方法论文档公开了采集门户、抓取时点与缺失范围,为后续可复现研究与其他国家类似立法的数据构建提供了参照模板。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务