遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含445,528条观测数据,涉及38个欧洲国家从1991年至2025年的工作时间数据,涵盖1个具体指标:按性别、职业和教育程度划分的员工实际每周平均工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过处理和标准化,包含国家、年份、性别、职业分类、教育分类、观测值及数据质量注释等字段。

This dataset contains 445,528 observational records, covering working hour data from 38 European countries spanning the period from 1991 to 2025. It focuses on one specific indicator: the actual average weekly working hours of employees, categorized by gender, occupation and educational attainment. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), and has been processed and standardized. It includes fields such as country, year, gender, occupation category, educational category, observed value, and data quality annotation.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-ocu-edu-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲地区雇员按性别、职业与教育程度划分的每周实际工作小时数均值。数据通过调用ILOSTAT REST API直接获取,并依据欧洲ISO3国家代码进行筛选,最终整合了来自38个欧洲国家的445,528条观测记录,时间跨度覆盖1991年至2025年。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理,确保了跨国数据的可比性,并在数据集中保留了原始数据来源标签以便追溯。
特点
数据集的核心指标为'HOW_XEES_SEX_OCU_EDU_NB',即每周实际工作小时数均值,同时提供了性别(男性、女性、总计)、职业技能等级与教育水平等维度的细分标记。数据以年度频率呈现,每条记录均包含观察值、观察状态标志及详尽的注释列(如方法论修订的断点说明),为研究劳动力市场的时间序列变化提供了丰富的元数据。此外,数据来源覆盖劳动力量调查、家庭收入调查等多种渠道,增强了数据的多样性与可靠性。
使用方法
该数据集可通过HuggingFace的`datasets`库便捷加载与使用。用户只需调用`load_dataset()`函数即可获取数据,并将其转换为Pandas DataFrame进行后续分析。典型的应用场景包括:按国家筛选数据以进行区域比较,或按时间排序以绘制特定指标的趋势曲线。数据集还支持透视操作,可轻松构建以年份为行、国家为列的观察值矩阵,便于进行面板数据分析或时间序列预测建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门依托其核心数据库ILOSTAT创建,由Electric Sheep Europe于2025年重新打包并发布至HuggingFace平台。ILOSTAT作为全球劳动统计的权威来源,整合了来自200多个经济体的劳动力调查与行政记录数据。本数据集聚焦欧洲38国,收录了1991年至2025年间共计445,528条观测记录,核心研究问题是揭示欧洲雇员实际周均工作时长在性别、职业技能水平与教育层次维度上的分布特征与演变趋势。该数据集的发布填补了跨国、长时序、多维度劳动投入精细化比较的空白,为劳动经济学、社会政策评估及国际对比研究提供了坚实的数据基础,对推动体面劳动指标监测与可持续发展目标(SDGs)中有关就业质量的量化分析具有重要影响力。
当前挑战
数据集所解决的领域问题核心在于如何从宏观层面系统捕捉劳动力市场中工作时长的结构性差异,并跨越国界与时间尺度实现可比性。ILOSTAT采用国际劳工统计学家会议(ICLS)标准对不同国家来源的微观调查数据进行协调,然而各国调查问卷设计、抽样框架及数据收集方法存在固有异质性,协调过程中易引入测量误差与统计口径偏差。构建过程中面临的主要挑战包括:多国多源数据的时间序列拼接与断点处理,例如方法论修订导致的序列中断需通过注释字段标记;分类变量(如职业与教育等级)定义在不同年份与不同国家间的一致性问题;低频年度数据无法满足对季度或月度季节性波动的分析需求;以及部分观测值因数据质量欠佳被标记为“不可靠”,需在建模时审慎滤除或进行不确定性校正。
常用场景
经典使用场景
该数据集收录了1991年至2025年间覆盖38个欧洲国家的44万余条观测记录,核心指标为按性别、职业与教育程度分层的雇员周均实际工作小时数。其经典使用场景集中于劳动经济学领域的多维度实证分析,例如利用性別、职业技能等级与教育背景三重交叉维度,剖析欧洲各国工作时间的结构性差异与演变规律。研究者可借助该数据构建面板回归模型,量化教育水平提升或职业结构调整对工作时长的边际影响,亦可应用于跨国横向比较与时间序列分解,揭示制度变迁、劳动力市场政策或经济周期对不同人群工作强度的异质性冲击。数据的高频年度粒度与离散化分组的精细程度,使其成为劳动力供给行为建模与政策模拟的理想基础素材。
实际应用
在实际应用层面,该数据集为欧盟各国劳动部门、国际劳工组织与世界银行等机构提供了基准化的工作强度监测工具。政策制定者可利用其中的性别与教育维度,识别特定行业或国家中加班超时的高风险群体,从而设计更有靶向性的劳动工时标准与职业健康干预措施。跨国企业的人力资源部门能够参考不同教育与职业组合下的平均工时水平,优化跨国派遣人员的薪酬结构与国际业务的人力配置方案。此外,数据还可支撑劳动力市场预测模型与个人工作-生活平衡评估系统,为灵活工时制度推广、育儿假政策调整等社会决策提供量化依据。
衍生相关工作
该数据集衍生了丰富的学术衍生工作,涵盖劳动经济学、教育经济学与公共政策等多个交叉领域。基于其三维分层结构,研究者已构建了欧洲各国性别工作时间差距的教育修正模型,揭示了高等教育普及如何逐步收敛或重塑男女工作时长分化的形态。此外,职业技能水平与工作时长的非线性关系得到了系统建模,衍生出关于技能偏向性技术进步对劳动强度影响的跨国产出。在方法论层面,该数据推动了缺失数据多重插补技术在劳动统计中的应用,以及面板数据中异质性处理效应的估计方法创新。这些工作不仅深化了对欧洲劳动力市场微观运作机制的理解,也为国际比较劳动统计的规范化分析树立了新标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务