遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-cbr-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和出生地划分的雇员实际平均每周工作小时数指标数据,覆盖34个欧洲国家,时间跨度为1987年至2025年,共8,446个观测值。数据包括国家代码、数据来源、指标代码、性别分类(总计、男性、女性)、出生地分类(总计等)、观测年份、观测值、数据状态标志和注释等信息。数据集经过重新打包,以方便机器学习使用,适用于表格分类、回归或时间序列预测任务。

This dataset contains indicator data on the actual average weekly working hours of employees, disaggregated by gender and place of birth, sourced from the ILOSTAT database of the International Labour Organization (ILO). It covers 34 European countries, spans the period from 1987 to 2025, and includes a total of 8,446 observations. The dataset contains information such as country code, data source, indicator code, gender classification (total, male, female), place of birth classification (total, etc.), observation year, observed value, data status flag, and notes. The dataset has been repackaged to facilitate machine learning applications, and is suitable for tasks including tabular classification, regression, or time series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-cbr-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,聚焦于欧洲地区雇员周实际工作小时数,并依据性别与出生地维度进行细分。数据通过ILOSTAT REST API直接抽取,经由Electric Sheep Europe团队进行加工与标准化封装,整合为适用于机器学习的表格格式。原始数据来自各国劳动力调查、家庭收入调查及行政记录等多元来源,ILO依据国际劳动统计学家会议定义对其进行统一协调,确保跨国数据的可比性与规范性。
特点
数据集涵盖1987年至2025年间的34个欧洲国家,共包含8,446条观测记录,聚焦于单一核心指标——按性别和出生地划分的雇员平均每周实际工作小时数。其独特之处在于提供了细粒度的性别分类(总、男、女)与出生地分类,为分析劳动市场中的外来人口融入及性别差异提供了珍贵资料。此外,数据还附加了来源标签与质量标记,如“不可靠”或“序列中断”等,使研究者能够审慎评估数据可靠性。
使用方法
数据集可通过HuggingFace Datasets库便捷加载,用户仅需一行命令`load_dataset`即可获取数据并转换为Pandas DataFrame进行深入分析。支持按国家代码筛选特定地区的序列,也可针对单一指标生成时间序列可视化。此外,数据集预设了透视表构建方式,便于将原始长格式数据重组为国家×年份的矩阵形式,适合后续的回归分析、时间序列预测及面板数据建模等任务,极大降低了劳动经济研究的数据清洗门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT创建,并由Electric Sheep Europe重新打包发布,聚焦于1987至2025年间34个欧洲国家雇员实际周工作小时数的性别与出生地差异。作为全球劳动统计的权威来源,ILOSTAT整合了各国劳动力调查、行政记录等多源数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集的核心研究问题在于揭示欧洲劳动力市场中性别与移民背景对工作时间的结构性影响,为劳动经济学、移民研究及社会政策评估提供了跨时空的可比微观证据。因其覆盖长达近40年的面板数据与精细的分类维度,该数据集对于理解欧洲一体化进程中劳动力市场的异质性和包容性具有重要价值,已被广泛应用于跨国比较分析及时序建模研究。
当前挑战
该数据集面临的首要挑战在于解决劳动经济学中多重异质性带来的识别难题,即如何从混杂的性别、国籍与出生地效应中分离出真正的结构性差异,以支持因果关系推断。在构建过程中,挑战体现为数据源的非统一性问题:不同国家采用各异的国家劳动力调查,导致序列中断(如方法论修订标志'I11:264'所示)和观测状态标记(如不可靠标志'U')频现。此外,部分指标仅以年度频率发布,缺失月度或季度更细粒度数据,限制了高分辨率时间序列分析。数据质量层面,同一国家-年份组合存在多源冲突时依赖ILO选择的'最佳来源',这一主观筛选机制可能引入选择偏差。最后,分类变量(如出生地类别)的稀疏填充在不同性别间分布不均,进一步挑战了多维度交叉分析的稳健性。
常用场景
经典使用场景
该数据集收录了1987年至2025年间34个欧洲国家按性别和出生地划分的雇员实际周平均工时数据,共计8446条观测记录。在劳动经济学与人口统计学领域,研究者常将其作为核心数据源,用于构建面板数据模型,分析移民身份与劳动供给强度之间的动态关系。通过纳入性别与出生地两个关键维度,该数据集能够支持差异化的回归分析,揭示不同群体在工时投入上的结构性差异,为理解欧洲劳动力市场的异质性提供了宝贵的时间序列基础。
解决学术问题
在学术研究中,该数据集有效解决了劳动时长跨国比较中因数据口径不统一而导致的统计偏差难题。ILOSTAT依据国际劳工统计学家会议定义对原始调查数据进行标准化处理,使研究者得以规避微观调查数据难以直接对比的局限。借助这一标准化架构,学者能够系统性地探究移民身份、性别差异与工时变化之间的因果链条,检验劳动力市场融合理论,以及评估政策干预对不同出生地人群的实际影响,从而推动劳动经济学与移民研究的实证化进程。
衍生相关工作
该数据集的衍生工作广泛涵盖劳动统计与机器学习交叉领域的一系列经典成果。基于ILOSTAT标准化指标,研究者已开发出多种时间序列预测模型,用以预测欧洲各国未来数年的平均工时趋势,服务于宏观劳动力规划。此外,围绕该数据集的分类与回归任务,催生了诸多跨国家的面板数据回归分析工作,推动了劳动弹性、性别工资差距以及移民劳动力同化等议题的量化研究方法创新。其在HuggingFace上的便捷封装更促进了可重现研究与公开基准数据集的构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务