遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-ocu-ins-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲13个国家从1993年至2025年的38,465个观测值,主要指标为按性别、职业和公共/私营部门划分的每位就业人员平均每周实际工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家,涵盖表格分类、回归和时间序列预测任务。数据集包括国家代码、性别、职业分类、年份、观测值等列,并提供了数据质量说明和使用示例。

This dataset contains 38,465 observations from 13 European countries spanning 1993 to 2025, with the primary indicator being Mean weekly hours actually worked per employed person by sex, occupation and public/private sector. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for European countries, and is suitable for tabular classification, regression, and time-series forecasting tasks. It includes columns such as country code, sex, occupation classification, year, observed value, and provides data quality notes and usage examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-ocu-ins-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于欧洲13个国家1993年至2025年间就业人员周均实际工作小时数的观测值。数据通过ILOSTAT REST API接口直接抽取,并依据欧洲ISO3国家代码进行地理范围过滤,最终整合为包含38,465条记录的结构化表格。ILO基于国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行协调,并在数据集中以`source.label`字段标注数据来源,确保每一条观测值的可追溯性和统计口径的一致性。
特点
数据集的核心特点在于其多维度的精细分类结构。除了基本的国家(`ref_area`)和时间(`time`)维度外,数据按性别(`sex`)、职业(`classif1`)以及公共/私营部门(`classif2`)进行拆解,允许用户对劳动力市场进行极为细致的交叉分析。每一观测值均附有观察状态标志(`obs_status`)及来源注释字段,用以标识数据质量,例如标记为`Unreliable`的估计值。这些元数据字段为研究人员在使用时评估数据的可靠性和适用性提供了关键依据。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集,核心代码为`load_dataset()`。加载后的数据可直接转换为Pandas DataFrame进行灵活操作。推荐的使用流程包括:通过`ref_area`字段筛选特定国家的数据以进行国别分析;利用`time`和`obs_value`字段绘制单一指标的时间序列图以观察长期趋势;或使用`pivot_table`方法将数据透视,构建以时间为行、国家为列的矩阵,便于进行面板数据分析或横向比较。数据集的设计初衷是即插即用,大幅降低劳动统计领域的研究门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,通过其核心数据库ILOSTAT进行发布,并由Electric Sheep Europe团队于2025年重新整理并托管于HuggingFace平台。它聚焦于欧洲13个国家在1993年至2025年间,按性别、职业和公共/私营部门分类的就业人员实际周平均工作小时数,共包含38,465条观测记录。作为劳动经济学与时间利用研究领域的重要资源,该数据集为分析欧洲劳动力市场结构变迁、性别差异以及行业间工作时间分布模式提供了标准化、可复用的时间序列数据,尤其支撑了关于工作强度、就业质量及体面劳动指标(SDG目标8)的跨国实证研究。
当前挑战
在领域问题层面,该数据集旨在解决劳动力市场研究中因各国统计口径、调查周期与分类标准差异导致的跨国可比性挑战,提供经ILO统一协调的标准化指标。然而,构建过程中面临多重挑战:原始数据源自多元渠道(如劳动力调查、行政记录),不同来源的数据质量与采集频率不一致;部分国家的观测值因样本稀疏或数据可靠性不足而被标注为不可靠(obs_status为U),增加了分析时的噪声;此外,数据以年度频率呈现,缺失月度或季度的高频变动态,限制了短期波动与政策即时效应的探测能力。这些因素共同要求研究者在建模时审慎处理数据质量标识与时间戳对齐问题。
常用场景
经典使用场景
在劳动经济学与时间利用研究的交汇点上,该数据集凭借对欧洲13个国家长达三十余年(1993-2025年)周均实际工作小时的精细刻画,成为探索劳动力市场动态的珍贵资源。研究者可借助其按性别、职业技能等级及公共/私营部门划分的多维分层结构,构建面板数据模型,系统分析不同人口亚群的工作时长演变趋势及其与宏观经济周期、制度变革的关联。例如,通过比较不同职业类别中男女周工作时长的差异及其随时间的变化,能够清晰揭示性别就业鸿沟在时间维度上的演变路径。
解决学术问题
该数据集有效填补了劳动统计领域跨国、长时序且带有细致分类的工作时长数据空白,使学者能够突破单一国家或短期研究的局限,深入探讨全球化背景下工作时间模式的趋同与异质性。借助这一数据,研究者可检验结构性因素,如产业结构变迁、劳动力市场规制强度及社会保障制度对工作时长的差异化影响,为解释北欧与南欧国家间持续存在的劳动时间差异提供了可靠的经验证据。这些发现对于优化劳动力资源配置、促进工作与生活平衡以及实现体面劳动目标具有重要的政策启示。
衍生相关工作
依托该数据集的粒度与权威性,已催生了一系列围绕欧洲劳动市场时间利用模式的创新性研究。学者们基于其分层结构,发展了融合时间序列预测与因果推断的计量模型,用于估计最低工资政策或就业保护立法对实际工作小时数的边际效应。另有一些工作将其与宏观经济指标(如GDP增速、失业率)进行关联分析,揭示了工作时长与经济韧性之间的非线性传导机制。此外,该数据集也为机器学习领域的回归与分类任务(如预测不同职业群体的工作时长分布)提供了标准化的基准测试平台,推动了统计学习方法在劳动经济研究中的前沿应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务