遇见数据集

electricsheepeurope/europe-ilo-emp-temp-sex-ind-dsb-nb-employment-by-ilo-sector-and-sex-and-disability-st

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的就业数据,具体指标为“按ILO部门、性别和残疾状况划分的就业(千)”。数据覆盖欧洲国家(示例中为英国),时间跨度为2009年至2025年,包含3,189个观察值。数据按性别(总计、男性、女性)、行业分类(如ILO部门总计)和残疾状况等维度进行细分,并包含数据来源、观察状态和注释等信息。数据集适用于表格分类、回归和时间序列预测等任务,旨在提供机器学习就绪的欧洲劳动力市场数据。

This dataset contains employment data from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Employment by ILO sector and sex and disability status (thousands). It covers European countries (e.g., the United Kingdom) from 2009 to 2025, with 3,189 observations. The data is disaggregated by dimensions such as sex (total, male, female), industry classification (e.g., ILO sector total), and disability status, and includes information on data sources, observation status, and notes. It is suitable for tabular classification, regression, and time-series forecasting tasks, providing machine learning-ready labor market data for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-temp-sex-ind-dsb-nb-employment-by-ilo-sector-and-sex-and-disability-st 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接抽取指标代码为EMP_TEMP_SEX_IND_DSB_NB的就业数据,并依据ISO 3166-1 alpha-3国家代码筛选出欧洲地区的观测记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、家庭收入调查等原始微观数据进行统一协调与处理,确保数据口径的一致性,同时通过source.label字段标记数据来源以保证可追溯性。数据集共包含3189条观测值,时间跨度从2009年至2025年,覆盖英国一个国家。
特点
该数据集的核心特点在于其多维度的分类粒度与标准化架构。数据不仅按性别(男、女、总计)进行分解,还引入了ILO部门分类与残疾状况分类两个额外的分层维度,使其能够支持细致的交叉分析。每个观测值均附带详细的元数据字段,包括观测状态标记(如临时或不可靠值)和数据来源说明,为数据质量评估提供了明确依据。数据集已由Electric Sheep Europe重新封装为Parquet格式,具备机器学习就绪的特性,可直接通过HuggingFace Datasets库加载,便于研究与开发使用。
使用方法
研究人员可通过HuggingFace的datasets库以一行代码加载该数据集,并利用to_pandas方法将其转换为熟悉的Pandas DataFrame格式进行后续操作。数据使用方式灵活多样,既支持按国家代码筛选特定区域的子集,也可针对单一指标按时间排序进行时间序列分析,或通过数据透视表构建国家与年份的矩阵结构。由于数据已按标准化Schema组织,用户可直接调取obs_value字段进行回归或分类建模,亦可利用sex、classif1、classif2等分层维度构建更复杂的统计分析任务,如时间序列预测或面板数据回归。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年创建,经Electric Sheep Europe重新打包后发布于HuggingFace平台,旨在提供欧洲地区按ILO部门、性别及残疾状况划分的就业人数数据(单位:千)。核心研究问题聚焦于劳动力市场中的结构性差异,特别是残疾人群体的就业参与度与行业分布,填补了传统就业统计中交叉维度分析的空白。作为ILOSTAT数据库的子集,该数据集整合了2009至2025年间英国(GBR)的3,189条观测记录,得益于ILO对各国劳动力调查数据的标准化处理,其在劳动经济学、社会政策评估及可持续发展目标(SDG)监测领域具有重要影响力,为探索残疾包容性就业政策提供了可靠的时间序列基础。
当前挑战
该数据集面临的领域挑战在于:现有的就业统计多聚焦于性别或行业单一维度,而交叉分析性别、行业与残疾状况三重因素的研究相对匮乏,限制了政策制定者评估就业歧视与包容性措施的效果。构建过程中,数据来源存在异质性——各国劳动力调查的定义与采集方法差异显著,ILO需借助国际劳工统计学家会议(ICLS)标准进行协调,但部分观测值仍被标记为‘不可靠’(obs_status)。此外,数据覆盖范围仅含英国单一国家,且为年度频率,无法捕捉月度或季度波动,这削弱了其在区域间比较与高时间粒度研究中的适用性。
常用场景
经典使用场景
该数据集汇集了国际劳工组织(ILO)ILOSTAT数据库中关于欧洲地区按ILO经济行业、性别及残疾状况分组的就业人数数据,涵盖2009年至2025年间英国3,189条年度观测记录。在经典使用场景中,研究者常将其作为面板数据源,用于构建时间序列回归模型或分类模型,以探究不同行业(如农业、制造业、服务业)及性别维度下残疾与非残疾人群的就业变迁趋势。数据集的标准化架构允许用户便捷调用HuggingFace的`load_dataset`接口进行数据筛选、透视与可视化,从而支持劳动经济学中关于社会包容性与劳动力市场动态关系的实证分析。
解决学术问题
该数据集的核心价值在于破解两个长期困扰劳动经济学与残障研究的学术难题:其一,提供了跨时间维度且细分至行业与性别的残疾就业微观统计,弥补了宏观汇总数据掩盖群体差异的缺陷,使得学者能够精确评估2008年金融危机后及新冠肺炎疫情冲击下残疾劳动者的就业恢复弹性;其二,通过统一的ILO定义与调查标准,解决了跨国比较时因各国统计口径不一导致的异质性问题,为检验‘残疾人就业配额制度’与‘反就业歧视立法’的政策有效性提供了可靠的数据基座,从而推动基于证据的就业包容性理论发展。
衍生相关工作
基于该ILOSTAT数据集,学术与政策研究领域已衍生出多项标志性工作。经济合作与发展组织(OECD)曾利用类似分组数据发布《残疾与就业》专题报告,系统探讨了就业支持政策与劳动力市场成果之间的关联机制。在机器学习领域,研究人员基于此数据集的时序特性开发了残疾就业率的概率预测模型,并引入贝叶斯结构时间序列方法(BSTS)以量化单一国家突发政策(如英国2015年《残疾融合战略》)的处理效应。此外,HuggingFace社区围绕该数据构建的基准分类器(如按行业预测就业趋势的LSTM网络)已在多个欧洲数据论坛中被复现和讨论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务