遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-eco-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含106,648个观测值,覆盖40个欧洲国家,时间跨度为1969年至2025年,专注于按性别和经济活动划分的雇员实际平均周工作时间指标。数据来源于国际劳工组织(ILO)的统计数据库(ILOSTAT),通过API获取并过滤为欧洲国家。数据集采用表格格式,包含国家代码、来源、指标、性别、时间、观测值等列,适用于表格分类、回归和时间序列预测等机器学习任务。数据经过ILO标准化处理,涵盖不同性别(总计、男性、女性)和经济活动部门的细分维度,并包含数据质量注释和来源信息。

This dataset contains 106,648 observations across 40 Europe countries from 1969 to 2025, focusing on the indicator Mean weekly hours actually worked per employee by sex and economic activity. Sourced from the International Labour Organization (ILO) ILOSTAT database via API and filtered for European countries, it is presented in tabular format with columns for country codes, source, indicator, sex, time, observed values, etc., suitable for tabular classification, regression, and time-series forecasting tasks. The data is harmonized by ILO, includes disaggregation by sex (total, male, female) and economic activity, and comes with data quality flags and source metadata.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-eco-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接抽取指标代码为HOW_XEES_SEX_ECO_NB的原始数据,并依据欧洲ISO3国家代码进行地域过滤。ILOSTAT利用国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、家庭收入调查及行政记录等来源的微观数据进行整合与协调,确保跨国可比性。数据集最终由Electric Sheep Europe重新封装,以Parquet格式存储,便于直接调用。
特点
数据集囊括了1969年至2025年间40个欧洲国家的106,648条观测记录,围绕“每周实际工作小时数”这一核心指标,按性别(总、男、女)和经济活动类别进行细致分解。每条记录均包含原始数据来源标签,便于追根溯源。数据质量方面,针对同一国家与年份存在多个来源的情形,优先采用ILO选定的“最佳来源”,同时标注了因方法修订或数据异常引发的序列断裂等注释信息。
使用方法
用户可通过HuggingFace的datasets库以一行代码加载数据集:load_dataset('electricsheepeurope/europe-ilo-how-xees-sex-eco-nb-mean-weekly-hours-actually-worked-per-employee-by'),并将其转为Pandas DataFrame进行后续分析。典型操作包括按国家代码(如ref_area='DEU')筛选特定国家的时间序列数据,或按指标分组后以时间与国别为轴透视形成面板矩阵,便于开展跨国比较与时间趋势分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经由Electric Sheep Europe于2025年重新封装并发布在HuggingFace平台上,核心研究问题聚焦于欧洲40个国家1969至2025年间按性别和经济活动分类的雇员实际周均工作小时数。作为ILOSTAT数据库中劳动统计指标的重要组成部分,该数据集为劳动经济学中的工时趋势分析、性别差异研究以及跨国比较提供了标准化、可复用的数据基础。其影响力体现在填补了欧洲区域高粒度、长时序工时数据的空白,特别适用于劳动力市场政策评估与时间序列建模等研究场景。
当前挑战
该数据集所解决的领域问题在于工时统计数据的碎片化与异质性——不同国家的调查方法、分类标准与更新频率各异,导致跨地区比较与集成分析困难。在构建过程中,主要挑战包括:从ILOSTAT REST API抽取庞杂的原始调查微观数据并进行基于ICLS定义的国际统一化处理;处理因方法论修订导致的序列断裂(如指标注释中的'Break in series'标记);标记不同数据源(劳动力调查、行政记录等)以保障溯源透明度;以及处理观测值状态标记为不可靠或临时的数据条目,确保分析结果的可信度。
常用场景
经典使用场景
在欧洲劳动经济学与公共政策研究中,该数据集被广泛用于分析不同性别与经济活动类别下雇员的平均每周实际工作时间。凭借其覆盖40个欧洲国家、跨越1969至2025年间的超十万条观测,研究者得以构建面板数据进行跨国比较与长期趋势分析。经典的用法包括:利用ILOSTAT统一的方法论框架,探索工作时间在不同性别群体间的分布差异,以及评估经济结构调整、技术进步或劳动法规变迁对工作强度的动态影响。数据集提供的多维度分类(如性别、经济活动门类)使其成为计量经济学模型中不可或缺的基石,尤其适合进行固定效应回归、差分中差分以及时间序列分解等分析。
实际应用
在实际应用层面,该数据集已成为欧洲各国劳动政策制定与评估的重要参考依据。政府部门与智库机构利用其构建实时监测仪表盘,追踪疫情前后、能源危机或经济转型期间不同行业与性别的工时波动情况。国际组织如欧盟委员会与欧洲工会联合会将其纳入社会指标框架,用以评估《欧洲就业战略》的实施成效。企业的人力资源部门亦从中获益,通过比对行业基准值来优化排班制度与弹性工作安排。此外,该数据集还服务于职场健康与安全研究,辅助识别高强度的劳动群体,从而为劳动监察资源的精准投放提供方向。
衍生相关工作
基于该数据集已衍生出一系列具有学术影响力的经典工作。在方法论层面,研究者开发了针对跨国不均衡面板数据的插补算法与季节调整模型,以提升长时序分析的稳健性。在实证研究方面,经典文献如《欧元区劳动供给的性别化差异》与《欧洲工作时间的收敛性:1960年以来的证据》均直接或间接引用了该数据。此外,它也被作为核心训练数据用于构建欧洲劳动市场预测的机器学习模型,如基于LSTM的周工时预测框架,以及应用于因果推断领域的双重稳健估计器。该数据集还为国际比较项目如卢森堡收入研究(LIS)提供了工时维度的补充数据源,促进了跨领域研究的融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务