遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-ocu-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲4个国家(英国、摩尔多瓦、阿尔巴尼亚、塞尔维亚)从2002年到2025年的1,287个观察值,核心指标为按性别、职业和残疾状况划分的就业人员实际平均每周工作时间。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过欧洲国家代码过滤,涵盖了就业、工作时间等劳动统计信息,并提供了按性别、职业分类和残疾状况的细分维度。数据集以表格形式组织,包括国家代码、年份、指标值、数据来源和质量标志等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 1,287 observations across 4 European countries (United Kingdom, Moldova, Albania, Serbia) from 2002 to 2025, focusing on the indicator Mean weekly hours actually worked per employed person by sex, occupation and disability status. Sourced from the International Labour Organizations ILOSTAT database via API and filtered for European country codes, it covers labor statistics such as employment and working hours, with disaggregation by sex, occupation classification, and disability status. Organized in tabular format, it includes columns for country codes, years, indicator values, data sources, and quality flags, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-ocu-dsb-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接提取指标代码为HOW_TEMP_SEX_OCU_DSB_NB的原始数据,并依据欧洲ISO3国家代码进行地理筛选。数据经过ILO基于国际劳工统计学家会议定义的统一标准进行微数据调和,同时保留源标签以支持追溯验证,最终由Electric Sheep Europe重新封装为机器学习就绪的格式。
特点
数据集涵盖2002年至2025年间4个欧洲国家的1287条观测记录,聚焦于按性别、职业与残疾状态划分的受雇人员实际周平均工作时长。其特点在于多维度细粒度分解:包含性别(男性、女性、合计)及职业与残疾状态分类变量,并携带观测数据质量标记(如不可靠、初步值),为劳动经济学中的工作强度与包容性研究提供标准化时序数据。
使用方法
用户可通过Hugging Face Datasets库的load_dataset函数直接加载该数据集至pandas DataFrame,再利用ref_area列对特定国家(如英国GBR)进行筛选,或基于indicator列聚焦单一指标。支持按时间序列排序后绘制折线图以观察变化趋势,亦可通过pivot_table将数据重塑为国家×年份的矩阵,便于面板数据分析与回归建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司编制,经由Electric Sheep Europe于2025年重新打包并发布在HuggingFace平台上,旨在提供欧洲国家按性别、职业和残疾状况划分的就业者平均每周实际工作小时数。数据集源自ILOSTAT——全球劳动统计领域最具权威性的数据库,其核心研究问题在于揭示不同人口统计学特征下劳动力参与模式的异质性,为劳动经济学、社会政策评估以及可持续发展目标(SDG)中体面工作指标的监测提供可量化的微观证据。通过对2002至2025年间阿尔巴尼亚、摩尔多瓦、塞尔维亚和英国四个欧洲国家共1,287条观测记录的系统整合,该数据集弥补了跨国可比性劳动时间数据的稀缺性,尤其为残疾包容性就业政策分析提供了宝贵的第一手资料,对推动包容性劳动市场研究具有显著影响力。
当前挑战
该数据集所应对的领域挑战在于劳动时间统计中普遍存在的多维度交叉分析难题,即在同时考虑性别、职业技能等级与残疾状况三重分类时,数据稀疏性问题极为突出,导致许多子群体(如特定国家的残疾女性高技能劳动者)的样本量极小,统计推断的可靠性面临严峻考验。构建过程中遇到的挑战包括:不同来源的调查数据在职业分类标准(如ICLS定义)与残疾识别方式上存在差异,需通过ILO的协调机制进行归并;部分国家的数据仅覆盖个别年份(如塞尔维亚仅2007年),形成严重的时间序列断裂;原始API返回的观测状态标志(如’U’表示不可靠)揭示了机构数据收集质量的不均衡,迫使使用者必须对异常值进行审慎甄别与处理。
常用场景
经典使用场景
在劳动经济学与统计学领域,该数据集的核心用途在于分析欧洲四国(英国、摩尔多瓦、阿尔巴尼亚、塞尔维亚)2002至2025年间,按性别、职业与残疾状况交叉分类的受雇人员平均实际周工作小时数。研究者能够利用这一面板数据,构建回归模型或时间序列分析,精准捕捉不同社会群体在劳动力供给行为上的结构性差异。数据集的年度观测节奏与细粒度分类变量,使其成为考察工时趋势演变、评估劳动力市场政策效果、以及探索性别或残疾状况导致的工时差距的理想素材。借助公开的API接口与标准化表格格式,学者可高效地将其整合进更大规模的跨国比较研究中。
解决学术问题
该数据集填补了欧洲特定国家层面,按多维人口特征分层的高质量工时记录空白。它所解决的学术问题包括:如何量化性别与残疾状态对每周工作投入时间的联合影响?哪些职业类型的工时模式更易受到外部经济波动冲击?传统研究方法常因数据缺失或分类粗糙而难以得到稳健结论,而该数据集以ILO统一统计框架为基础,提供了足够长的时间序列与跨国的可比性。通过对这些问题的实证研究,学界得以更深入地理解劳动力市场结构中的不平等机制,并为制定包容性就业政策(如弹性工时安排、特殊职业保障措施)提供数据支撑,从而推动社会公平与可持续发展目标的学术论证。
衍生相关工作
围绕该数据集,学术界与工业界已衍生出多项代表性工作。国际劳工组织(ILO)以其为基础,每年发布全球工时趋势报告,并推动了“体面劳动”评估框架的完善。部分研究者利用该数据集的分类维度,开发了面向劳动力市场不平等的小区域估计模型,将英国或摩尔多瓦的宏观工时指标与地方性调查微数据相结合。自然语言处理与统计学习领域也有工作引入该数据,验证了时序预测模型(如Prophet、LSTM)在劳动力时间序列上的表现。此外,数据集的标准化发布模式鼓舞了多个欧洲开源项目,推动了劳动力统计数据的可重复性研究文化与ML-Ready数据生态建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务