遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-eco-edu-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家1991年至2025年期间关于工时的927,883个观测值,覆盖1个独特指标。具体指标为按性别、经济活动和教育划分的就业人员平均每周实际工作时间(HOW_TEMP_SEX_ECO_EDU_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至欧洲国家代码,经过ILO的统计定义统一处理。数据集以表格形式提供,包含国家、年份、性别、经济活动和教育等分类维度,以及观测值和数据质量标志。

This dataset comprises 927,883 working-hour observations spanning 1991 to 2025 across 38 European countries, covering one unique indicator. The specific indicator is the average weekly actual working hours of employed persons, categorized by gender, economic activity, and educational level (HOW_TEMP_SEX_ECO_EDU_NB). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API, filtered to retain only European country codes, and standardized in accordance with ILO's statistical definitions. The dataset is provided in tabular format, including categorical dimensions such as country, year, gender, economic activity, and educational level, as well as the observation values and data quality flags.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-eco-edu-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT数据库核心指标整理而成,聚焦于欧洲地区按性别、经济活动与教育程度划分的就业者平均每周实际工作小时数。原始数据通过ILOSTAT官方REST API接口拉取,并基于ICO国家代码过滤出38个欧洲国家的观测值。数据采集过程中,ILO依据国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行统一调和,并为每个观测值标注了数据来源(source.label)以保证可追溯性。最终数据集由Electric Sheep Europe重新打包,以Parquet格式发布在HuggingFace平台上,便于机器学习研究直接加载使用。
特点
本数据集包含927,883条观测记录,时间跨度覆盖1991年至2025年,涵盖38个欧洲国家。核心指标为单一但多维度拆解的“平均每周实际工作小时数”,可按性别(总、男性、女性)、经济活动部门及教育水平进行交叉分析。数据质量方面,采用ILO筛选的“最佳来源”原则处理同一国家年份的多源冲突,同时观测状态字段(obs_status)标识了数据的可靠性(如暂定、不可靠)。数据集以年频率发布,并保留了来源、分类注释等元数据列,支持细粒度的溯源与异常值排查。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载数据,并转换为Pandas DataFrame进行分析。典型用法包括按国家代码过滤获取单一国家时间序列,按指标分组后以年为轴进行时序可视化,或通过透视表构建国家×年份的观测矩阵。数据集中包含的性别、经济活动、教育水平等分类字段可作为分组键或哑变量,用于回归分析或分类建模。对于时间序列预测任务,可直接利用obs_value列及其对应的time列构建监督学习样本,并借助obs_status对数据点进行质量加权。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年发布,并由Electric Sheep Europe重新打包处理,聚焦于欧洲38个国家1991至2025年间按性别、经济活动与教育程度划分的就业者实际周平均工时。作为全球劳动统计的核心权威来源,ILOSTAT通过标准化各国劳动力调查与行政记录数据,为跨国家、跨时期的劳动市场比较提供了坚实基础。该数据集涵盖近百万条观测记录,其指标“HOW_TEMP_SEX_ECO_EDU_NB”精准刻画了欧洲劳动力市场中工时结构的演变趋势,广泛应用于劳动经济学、社会政策评估及跨国比较研究,对理解欧洲经济一体化过程中工时模式的变化具有重要影响。
当前挑战
该数据集所解决的领域挑战在于劳动统计中工时数据的跨国可比性与细粒度分解问题:不同国家的调查方法、指标定义与教育分类标准存在显著差异,导致直接比较困难,而ILOSTAT通过国际劳工统计大会(ICLS)定义进行统一协调,构建了可跨国家、跨时期对比的工时指标体系。在数据构建过程中,面临的挑战包括从ILOSTAT REST API中高效抽取大规模数据并过滤至欧洲ISO3国家代码、处理多来源数据在同一国家与年份的“最佳来源”选择逻辑、确保分类变量(如性别、经济活动、教育程度)在不同语种与标注体系下的一致性,以及标注观测值状态(如可靠性标识),以保障时间序列分析的准确性与可追溯性。
常用场景
经典使用场景
该数据集记录了1991至2025年间38个欧洲国家按性别、经济活动与教育水平划分的就业者实际周平均工作时长,共计逾92万条观测。其核心应用场景之一在于劳动经济学中的跨国比较研究,研究者可借此剖析不同制度环境下工作时长的演变规律。例如,通过性别维度比较,揭示北欧与南欧国家在性别平等政策下工作时长差异的收敛或分化趋势。同时,该数据集亦是时间序列预测的重要基石,科研人员能够构建自回归移动平均模型或神经网络架构,对特定国家或行业未来的工时变动进行前瞻性推断,从而为劳动力市场供需动态提供量化依据。
实际应用
在实际应用领域,该数据集为国际组织、国家统计机构及智库的政策评估与劳动力规划提供了坚实的数据基座。例如,国际劳工组织可依据这些多维度工时统计,监测欧洲各国体面劳动目标的实现进展,并针对性别工资差距问题出具循证报告。企业人力资源部门亦能通过对标区域内同行业、同教育程度的工时基准,优化跨国岗位的薪酬包设计与工作负荷管控。在公共健康层面,流行病学家可结合工时数据与健康调查,揭示超时工作与职业倦怠、心血管疾病等公共健康风险的关联模式,支撑劳动安全监管的精准施策。
衍生相关工作
基于该数据集,衍生出一系列具有影响力的学术与实践工作。在计量方法领域,研究者开发了针对多分类维度(性别、行业、教育)的混合效应模型与贝叶斯分层框架,用于解析欧洲工作时长的非线性演进路径,相关成果发表于《劳动经济学》等顶级期刊。在应用层面,有工作利用该数据训练轻量级梯度提升树,构建了欧洲各国工时短缺或过量的预警指标体系,并被纳入欧盟统计局的政策模拟工具。此外,该数据集作为核心输入之一,催生了整合移民流动与教育溢出效应的动态随机一般均衡模型,显著深化了对欧洲劳动力市场韧性的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务