遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-ocu-mts-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲38个国家1991年至2025年间的191,570个观测值,核心指标为按性别、职业和婚姻状况划分的雇员实际平均每周工作时间。数据涵盖表格分类、回归和时间序列预测任务,涉及性别、职业和婚姻状况等分类维度,适用于劳动力市场分析。数据通过ILOSTAT REST API获取,并经过欧洲ISO3国家代码过滤,原始数据基于国际劳工统计学家会议(ICLS)定义进行标准化。

This dataset contains 191,570 observations collected between 1991 and 2025 across 38 European countries, sourced from the ILOSTAT database of the International Labour Organization (ILO). The core metric is the actual average weekly working hours of employees, categorized by gender, occupation, and marital status. The data supports tabular classification, regression, and time series forecasting tasks, with categorical dimensions including gender, occupation, and marital status, making it applicable for labor market analysis. It was retrieved via the ILOSTAT REST API, filtered using ISO 3 country codes for European countries, and the raw data was standardized in line with the definitions established by the International Conference of Labour Statisticians (ICLS).

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-ocu-mts-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT权威统计数据库,聚焦于欧洲地区雇员按性别、职业及婚姻状况划分的周均实际工作小时数。数据通过ILOSTAT REST API直接从官方接口拉取,依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调处理,并仅筛选出欧洲38个国家的ISO3国家代码对应条目。数据集涵盖1991年至2025年的年度观测,总计191,570条记录,每条观测包含国家代码、来源标签、指标代码、性别分类、职业与婚姻状况细分、观测值及状态标志等结构化字段。原始数据中为同一国家与年份提供的多个来源,已采用ILO甄选的“最佳来源”以确保一致性。
特点
该数据集以高维度细粒度著称,通过性别(总人口、男性、女性)、职业技能水平及婚姻状况三组分类变量对工作小时进行多维交叉分析,为研究劳动力市场中的结构差异提供了宝贵素材。数据覆盖欧洲38国,时间跨度长达35年,兼具广袤地理与时间纵深的双重特性。所有观测值均附带来源追踪标识与观测状态标记(如临时性或不可靠性),便于用户评估数据质量。此外,数据集采用规范的Parquet格式存储,并统一了字段命名与标签,确保了跨数据集的可互操作性与机器学习任务的即用性。
使用方法
用户可通过HuggingFace Datasets库以一行代码加载该数据集:`load_dataset('electricsheepeurope/europe-ilo-how-xees-sex-ocu-mts-nb-mean-weekly-hours-actually-worked-per-employee-by')`,其训练子集可直接转换为Pandas DataFrame用于分析。典型应用包括按国家筛选(如德国`ref_area == 'DEU'`)以开展国别研究,或按单一指标进行时间序列可视化(`sort_values('time')`后绘制`time`与`obs_value`关系图)。更进一步,可借助透视表操作构建国家×年份矩阵(`pivot_table(index='time', columns='ref_area', values='obs_value')`),便于进行跨国的面板数据分析或作为时间序列预测模型的输入特征。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于其核心数据库ILOSTAT构建,并由Electric Sheep Europe于2025年重新整理发布,聚焦于欧洲38个国家1991至2025年间雇员每周实际工作平均时长的性别、职业与婚姻状况细分。ILOSTAT作为全球劳动统计的权威来源,通过整合劳动力调查、行政记录等多源数据,为分析劳动力市场结构、工作强度与就业质量提供了标准化基础。该数据集以191,570条观测覆盖了时间跨度逾三十年的面板数据,其精细的人口统计学与职业分类维度,使其成为研究欧洲地区工作模式演变、性别职业隔离及家庭结构对劳动供给影响的关键资源,在劳动经济学、公共政策评估与社会学领域具有显著应用价值。
当前挑战
该数据集面临的多重挑战首先源于其核心研究问题:精准刻画并解释不同性别、职业与婚姻状况群体间工作时间的差异及其演变趋势。领域内挑战包括如何区分经济周期、制度变迁与个体选择对工作时间的复合效应,以及如何通过离散的年度观测捕捉高频就业模式的动态特征。构建过程中则需应对ILOSTAT原始数据源于多国独立调查体系所带来的方法异质性,各国劳动力调查的设计、问卷措辞与抽样框架差异要求统一的数据清洗与规范化处理。此外,缺失值与可靠性标记(如部分观测被标注为不可靠)的处理、分类体系随时间调整导致的序列不连续性(如方法论修订标记),以及跨国家间职业分类标准的对齐,均对数据质量和稳健分析构成实质障碍。
常用场景
经典使用场景
欧洲劳动力市场中,不同性别、职业和婚姻状态下的员工平均每周实际工作时长是劳动经济学研究的关键指标。该数据集汇聚了来自38个欧洲国家、横跨1991年至2025年的近20万条观测记录,为学者提供了一个标准化、兼容性强的跨时空面板数据。经典用途涵盖构建多维度时间序列模型,以追踪欧洲各国劳动者工作时间的长期演变趋势,并支持通过诸如sex、classif1等分组变量进行细粒度的群体差异分析,为理解宏观经济政策对劳动供给的影响提供数据基石。
解决学术问题
该数据集有效回应了劳动经济学中关于工作时间差异成因的经典学术议题。研究者可借助丰富的分层标签(如性别与婚姻状况)检验性别收入与工作时间差距的演变,评估职业隔离效应,并实证分析制度变革(如强制性带薪休假或弹性工作制)对特定人群工时行为的影响。此外,其跨越三十多年的长时序数据使得构建面板回归模型以识别国家与时间维度上的固定效应成为可能,从而揭示生活水平变化、社会保障体系与家庭决策之间的复杂互动关系。
衍生相关工作
基于此数据集,一系列跨学科的研究工作得以衍生和深化。实证经济学家可将其与收入、通胀或技术进步指标关联,构建结构方程模型以量化工作时间变化的福利效应。社会学家则能够借助occupation和marital status标签,探讨家庭分工模式对劳动力市场表现的塑造作用。在机器学习领域,该数据的高质量、多类目特征适用于回归任务以预测未来工时,或用于时序分解方法以提取周期性模式与长波趋势,进而引发生成对抗网络与注意力机制等先进技术在微观劳动数据建模上的创新应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务