遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-ocu-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲员工实际平均每周工作时间统计信息,涵盖4个欧洲国家(英国、摩尔多瓦、阿尔巴尼亚、塞尔维亚),时间跨度为2002年至2025年,共1,283个观测值。核心指标为“按性别、职业和残疾状况划分的员工实际平均每周工作时间”。数据以表格形式组织,包括国家代码、来源、指标代码、性别分类、职业分类、残疾状况分类、年份、观测值等字段,适用于表格分类、回归和时间序列预测等机器学习任务。数据集由Electric Sheep Europe重新打包,遵循CC-BY-4.0许可协议。

This dataset contains statistics on mean weekly hours actually worked per employee in Europe, sourced from the International Labour Organization (ILO) ILOSTAT database. It includes 1,283 observations across 4 European countries (United Kingdom, Moldova, Albania, Serbia) from 2002 to 2025. The core indicator is Mean weekly hours actually worked per employee by sex, occupation and disability status. The data is organized in tabular format with columns such as country code, source, indicator code, sex classification, occupation classification, disability status classification, year, observed value, etc., suitable for tabular classification, regression, and time-series forecasting tasks. The dataset is repackaged by Electric Sheep Europe and licensed under CC-BY-4.0.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-ocu-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接提取名为“HOW_XEES_SEX_OCU_DSB_NB”的指标数据,并依据欧洲国家ISO3代码进行地理筛选。数据涵盖阿尔巴尼亚、摩尔多瓦、塞尔维亚和英国四个欧洲国家,时间跨度为2002年至2025年,共收录1283条观测记录。ILOSTAT基于国际劳工统计学家会议(ICLS)定义的标准,对各国劳动力调查、住户收支调查及行政记录等原始微观数据进行统一整合与标准化处理,来源信息在“source.label”列中清晰标注,确保数据可追溯。
特点
该数据集的核心特点在于其精细的维度划分与高颗粒度。除基本的时间与地区信息外,数据按性别(总、男、女)和职业技能水平与残疾状况两个分类变量进行交叉分解,形成多层次的子组分析框架。每条观测包含完整的元数据标签,如观测状态标志(如不可靠)、源数据备注及方法修订说明,为数据质量评估提供了透明依据。数据集以年为单位发布,且当同一国家年份存在多个来源时,ILO优先选用其认定的“最佳来源”,保障了一致性与权威性。
使用方法
数据集可通过HuggingFace Datasets库一键加载,用户仅需运行`load_dataset`函数即可获得可直接操作的Pandas DataFrame对象。支持按国家或指标进行筛选,例如通过`ref_area`列过滤特定国家的子集,或利用`obs_value`字段对单一指标进行时间序列分析。用户还可借助`pivot_table`方法将数据重塑为国家×年份矩阵,便于进行跨国家横向比较与面板数据分析。该数据集结构规范、维度清晰,为劳动经济学中的工时研究、性别与职业差异分析以及残疾就业状况评估提供了便捷的数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织统计数据库(ILOSTAT)于2025年整理发布,经Electric Sheep Europe重新封装后以标准化格式呈现。数据集聚焦于欧洲四国(英国、摩尔多瓦、阿尔巴尼亚、塞尔维亚)自2002年至2025年间的劳动者每周实际工作时长,并首次在ILO框架下引入性别、职业技能等级及残疾状态的三重交叉维度。作为劳动经济学领域的重要资源,该数据填补了欧洲残疾人就业质量量化研究的空白,为评估包容性就业政策效果、分析劳动力市场中的性别与残疾歧视提供微观证据,其跨年度时序特征亦有助于追踪工时结构在金融危机、新冠疫情及经济复苏期中的动态演变。研究团队通过清洗ILOSTAT原始调查问卷数据,解决了跨国分类标准不一致问题,使得跨区域比较成为可能。
当前挑战
该数据集面临的核心挑战在于多源异构数据的整合与质量管控。首先,原始数据来源于各国劳动力调查、住户收入调查及行政管理记录,不同国家调查方法差异导致工时统计口径不一,如部分国家将加班与兼职换算为等效全职工时,而另一些国家直接采用原始报告值,使得统一核算模型构建复杂。其次,分类维度交叉分析受限于样本稀疏性,例如特定国家残疾女性在高级职业类别中的观测值不足,导致部分单元格无法满足统计学显著性要求。数据构建过程中,需解决时间序列中的断点问题——国际劳工标准方法的修订(如note_indicator字段标注的I11:264类修订)造成前后数据不可直接对比。此外,观测值状态标记(obs_status字段)中部分数据被标注为不可靠(如“U”标签),需研发人员设计针对性插值与异常值检测算法,以平衡数据完整性敏感性与分析结论的稳健性。
常用场景
经典使用场景
该数据集收录了欧洲四国(英国、摩尔多瓦、阿尔巴尼亚、塞尔维亚)在2002至2025年间按性别、职业及残疾状况划分的雇员实际周均工作小时数,共计1283条观测记录。经典使用场景涵盖劳动经济学中的时间序列分析与面板数据建模,研究者可借此探究不同人口亚组(如性别、职业技能等级及残疾状态)的工时分布特征,或结合国家固定效应模型识别欧洲劳动力市场的结构性异同。数据集的年度频率与标准化分类维度使其特别适合进行跨国的长期趋势比对,例如分析金融危机或疫情前后残疾人士就业质量的波动。
解决学术问题
该数据集直击劳动统计学中关于就业质量与包容性增长的量化难题,尤其为残疾人群体的工时权益保障研究提供了稀缺的跨国可比证据。学术上,它解决了三个关键瓶颈:其一,弥合了欧洲各国在工时统计中因调查方法差异导致的数据割裂问题;其二,通过职业与残疾状态双重分类,解耦了技能结构与残障歧视对就业结果的影响;其三,其时间跨度(2002–2025)为评估欧盟就业平等政策(如《残疾人权利公约》)的长期效应提供了纵向基准。该数据集的发布推动了劳动经济学从理论验证向政策模拟的范式转换。
衍生相关工作
该数据集已催生出一系列衍生研究工作:在方法论层面,研究者基于其多分类维度(sex、classif1、classif2)开发了针对稀疏分组(如残疾女性高级技能职业)的小样本鲁棒估计框架;在应用层面,它被用于构建欧洲工时预测的时序基础模型(Time Series Foundation Model),其中ILO的标准化来源标注(source.label)与断点注释(note_indicator)为序列填补与异常检测任务提供了天然监督信号。Electric Sheep Europe团队更以此数据集为模板,建立了跨领域劳动统计数据的统一Parquet封装规范,推动了ML就绪数据集在HuggingFace生态中的可复现性标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务