遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-oc2-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了欧洲37个国家从1992年至2025年期间,按性别和职业(ISCO 2级分类)统计的员工实际平均每周工作小时数的观测数据。数据集共有102,201个观测值,涵盖1个核心指标:HOW_XEES_SEX_OC2_NB,即按性别和职业 - ISCO 2级分类统计的员工实际平均每周工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、职业分类、观测年份、观测值、观测状态标志以及相关注释。数据按年度频率提供,并经过ILO的 harmonisation 处理,以确保数据的一致性和可比性。数据集主要用于表格分类、表格回归和时间序列预测等任务,适用于劳动力市场分析、工作时间研究以及相关社会经济研究。

This dataset contains observations of mean weekly hours actually worked per employee, disaggregated by sex and occupation (ISCO level 2), across 37 European countries from 1992 to 2025. It comprises 102,201 observations and covers one core indicator: HOW_XEES_SEX_OC2_NB, which stands for Mean weekly hours actually worked per employee by sex and occupation - ISCO level 2. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), a leading global source for labour statistics. The dataset includes detailed columns such as country code, country name, data source, indicator code, sex classification (total, male, female), occupation classification, observation year, observed value, observation status flags, and related notes. The data is provided at annual frequency and has been harmonized by the ILO to ensure consistency and comparability. It is suitable for tasks such as tabular classification, tabular regression, and time-series forecasting, and can be used for labor market analysis, working time studies, and related socio-economic research.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-oc2-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
本数据集基于国际劳工组织(ILO)的ILOSTAT数据库构建,通过其REST API直接获取指标代码为“HOW_XEES_SEX_OC2_NB”的原始数据,并依据ISO 3166-1 alpha-3国家代码筛选出欧洲37个国家的观测记录。数据来源涵盖劳动力调查、家庭收入调查、机构调查及行政记录等多元渠道,ILO统计部门依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调统一,并在“source.label”字段中标注具体来源以保障可追溯性。最终整合为包含102,201条观测的结构化表格,覆盖1992年至2025年的时间跨度。
特点
该数据集聚焦于欧洲地区按性别与职业(ISCO-08二级分类)划分的雇员平均每周实际工作时长,具有精细的维度拆解能力。其核心指标唯一,但通过“sex”字段提供总、男、女三种性别细分,并依托“classif1”等分类变量实现职业层次的聚合。数据结构完整,包含观测值标志、数据质量注释(如方法论修订、不可靠标记)及来源备注,便于用户评估数据可信度。时间跨度为年度频率,覆盖长达34年的历史序列,能够有效支撑纵向趋势分析与跨国家比较研究。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载,使用“load_dataset”函数即可获取训练集并转为Pandas DataFrame进行后续分析。用户可依据“ref_area”字段筛选特定国家的时间序列,或按“indicator”与“sex”等维度过滤后,以“time”为轴绘制观测值变化曲线。借助透视表功能,还能快速将数据重塑为以年份为行、国家代码为列的矩阵形式,便于进行面板数据建模或可视化比较。数据采用CC-BY 4.0许可,使用时应同时标注ILO原始来源与Electric Sheep Europe的再封装版本。
背景与挑战
背景概述
在劳动经济学与劳动力市场研究中,工作时间是衡量就业质量、劳动生产率及工作与生活平衡的核心指标。由国际劳工组织(ILO)统计部门维护的ILOSTAT数据库,作为全球劳动力统计的权威来源,为跨国家、跨年代的比较分析提供了数据基础。该数据集由Electric Sheep Europe于2025年重新整理并发布,聚焦于欧洲37个国家1992年至2025年间,按性别和职业(ISCO-08二级分类)划分的雇员每周平均实际工作小时数,共包含102,201条观测值。其核心研究问题在于揭示欧洲劳动力市场中工作时间模式的性别差异与职业分层,为劳动政策制定、国际比较研究以及时间序列预测模型提供实证支撑。该数据集对相关领域的影响力体现在其高时空分辨率与结构化元数据,能够支撑从宏观劳动力经济学分析到微观机器学习建模的多元应用。
当前挑战
该数据集所解决的领域问题主要涉及劳动力市场中工作时间分布的量化描述与比较分析,以往研究常受限于不同国家统计口径不一、调查方法各异以及时间跨度不统一等障碍。构建过程中的挑战则包括:来自多个国家劳动力调查、家庭收入调查及行政记录等异构数据源的本体对齐与标准化,需遵循国际劳工统计学家会议(ICLS)定义的统一概念;数据质量标注的复杂性,如观测值状态字段中出现的“不可靠”标记(obs_status=U)需谨慎处理;序列断裂(break in series)的存在,部分国家因方法论修订导致年份间数据不可直接比较,须依赖note_indicator字段进行追踪与修正。此外,数据集虽经ILO挑选“最佳来源”合并,但多源并存时仍面临权重分配与一致性验证的难题,对后续建模与分析提出了数据清洗与稳健性检验的进一步要求。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集为分析欧洲各国不同性别与职业类别(ISCO二级分类)雇员的实际周均工作时间提供了高颗粒度的结构化数据。研究者可基于1992至2025年间37个欧洲国家的时序观测值,构建面板数据模型,系统考察工作时间在性别维度与职业层级间的分布特征与演变趋势。数据集亦可作为多变量预测模型的训练基础,用于估计宏观劳动力市场波动对特定群体工作强度的影响。
实际应用
在实际应用中,该数据集可被整合至国际组织与各国劳工部门的政策评估平台,用于监测职业健康风险、评估加班文化对员工福祉的影响。企业人力资源部门可借此基准数据进行行业间工作强度对标,优化排班与薪酬设计。此外,数据集可作为宏观经济预警系统的输入特征,通过追踪工作时间异常波动,为就业市场景气度预测与劳动力短缺区域的识别提供量化支撑。
衍生相关工作
围绕该数据集的基础结构,学界已衍生出多项值得关注的拓展研究。例如,基于其时序特征与分类维度,研究者构建了混合效应模型以分离国家层面制度效应与个体职业特征对工作时间的贡献。亦有工作将其与欧盟收入调查数据结合,构建面板工具变量模型以估计工作时间与小时工资的联合决定机制。在方法论层面,该数据集推动了针对劳动统计中缺失值插补技术与异常值稳健估计策略的改进工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务