遇见数据集

electricsheepeurope/europe-ilo-how-temp-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲9个国家(如希腊、摩尔多瓦、奥地利、法国、波黑、瑞士、塞尔维亚、阿尔巴尼亚和黑山)从1987年至2025年的4,239个观测值,核心指标为按性别、公共/私营部门和城乡划分的每位就业人员实际平均每周工作小时数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤欧洲国家代码,涵盖劳动力统计中的工作时间主题。数据集支持表格分类、回归和时间序列预测任务,采用CC-BY-4.0许可,包含国家代码、年份、性别分类、观测值等列,适用于劳动力市场分析和机器学习应用。

This dataset contains 4,239 observations across 9 European countries (including Greece, Moldova, Austria, France, Bosnia and Herzegovina, Switzerland, Serbia, Albania, and Montenegro) covering the period from 1987 to 2025. Its core indicator is the actual average weekly working hours per employed individual, categorized by gender, public/private sector, and urban-rural region. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), collected via REST API with filtering applied for European country codes, and covers the working hours theme in labor statistics. This dataset supports tasks including tabular classification, regression, and time series forecasting. It is licensed under CC-BY-4.0, and includes columns such as country code, year, gender category, and observation value, making it suitable for labor market analysis and machine learning applications.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
本数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,该数据库是全球劳动统计的核心来源。数据通过ILOSTAT REST API直接获取,经由Electric Sheep Europe进行清洗与重封装,形成了面向欧洲区域的标准化子集。构建过程中,首先从原始API接口中提取“每周实际工作小时数”指标,并依据ISO 3166-1 alpha-3编码筛选出9个欧洲国家的观测记录,最终汇聚成4,239条高质量的时间序列数据,时间跨度自1987年至2025年。每条记录均包含国家、性别、行业部门及城乡地域等多维分类信息,并保留了原始数据源的溯源标记,确保了数据的可追溯性与分析灵活性。
特点
该数据集的核心特色在于其精细的多维分层结构,涵盖性别(男性、女性、总计)、公共/私营部门以及城乡区域三大维度,能够支持深度交叉分析。所有数据均基于国际劳工统计学家会议(ICLS)的统一定义进行标准化,保证了跨国家与跨时期的可比性。数据频率为年度,每个观测值均附有观测状态标识(如“序列中断”),有助于用户评估数据质量与连续性。此外,数据集以简洁的表格形式呈现,19个明确的字段包括指标代码、数值、分类码及标签,易于理解与集成。
使用方法
用户可通过HuggingFace Datasets库中的load_dataset()函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续分析。典型用法包括按国家筛选特定时间序列,例如选取德国的数据;也可针对单一指标“HOW_TEMP_SEX_INS_GEO_NB”按年份排序,绘制其时间变化趋势图。对于多国对比研究,推荐使用透视表功能,构建以年份为行、国家为列的数值矩阵,便于快速观察跨国差异。数据已按Parquet格式封装,加载高效,适用于表格分类、回归分析及时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年整理发布,经Electric Sheep Europe团队重新封装,旨在提供欧洲9个国家1987年至2025年间按性别、公共/私营部门及城乡区域划分的就业人员周均实际工作小时数。数据集依托ILOSTAT这一全球劳动统计权威数据库,其数据来源涵盖劳动力调查、家庭收入调查及行政记录,并遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。作为劳动经济学与时间序列分析领域的重要资源,该数据集为研究欧洲劳动力市场结构变迁、性别间工作强度差异以及区域间劳动供给模式提供了精细化的微观基础,对于制定就业政策与评估工作时间法规具有显著的参考价值。
当前挑战
该数据集所面临的挑战主要集中于领域问题与构建过程两方面。在领域层面,核心挑战在于剥离工作时间变动中的结构性因素(如行业构成、就业形态)与周期性波动,以准确评估性别不平等或城乡差异的演变趋势,同时需要处理各国在调查方法、职业分类标准上的不一致性。在构建过程中,挑战表现为数据稀疏性与不连贯性,如阿尔巴尼亚仅覆盖2002-2012年而黑山仅有2020年一年观测,另有多国存在时间序列断裂与观测状态标注为临时或不可靠的情形,这要求在使用时进行严格的数据质量过滤与插补处理,以避免估计偏差。
常用场景
经典使用场景
在欧洲劳动经济学与政策研究的广阔领域中,工作时间结构始终是衡量劳动力市场效率与劳动者福祉的核心指标。该数据集汇集了9个欧洲国家自1987年至2025年间关于平均每周实际工作小时的官方统计,为研究者提供了一个横跨近四十年的时序面板数据。其最为经典的使用场景在于构建跨国比较的时间序列模型,通过将性别、公共与私营部门以及城乡区域等维度纳入分析框架,研究者能够精准刻画劳动力投入的动态演变规律。无论是用于追踪后工业化时代劳动时长缩短趋势,还是评估金融危机或疫情等外生冲击对工作模式的干扰,该数据集都以多年积累的观测记录,成为解码欧洲劳动力市场运行机制的坚实基石。
解决学术问题
在学术研究层面,该数据集着力解决了劳动经济学中一个长期悬而未决的难题——如何系统性地分离影响工作时间的制度性因素与结构性因素。通过提供统一口径下的分性别、分部门及分城乡的观测值,它使得研究者能够基于多层级固定效应模型,检验社会保障制度、集体谈判框架与劳动力市场灵活性对工作时长的差异化作用。同时,数据的时间跨度覆盖了欧盟东扩、福利国家改革以及自动化浪潮等重大转折期,为解析技术进步与劳动力再分配之间的复杂关系提供了关键证据。这一数据集不仅填补了欧洲范围内精细化劳动统计的空白,更推动了关于工作与休闲平衡、性别平等及区域发展差异等经典议题的实证研究迈向更严谨的因果推断层面。
衍生相关工作
围绕该数据集催生的衍生工作构筑了多层次的研究谱系。一部分学者将其与ILOSTAT中其他劳动指标(如失业率、工资水平)进行关联分析,构建起解释欧洲就业质量变迁的多维指标框架,相关成果发表于《劳动经济学》等权威期刊。另一类衍生研究则专注于方法论创新,例如利用该面板数据训练时序预测模型,将性别与部门属性的交互项嵌入长短期记忆网络或向量自回归模型之中,大幅提升对各国工时短期波动的预测精度。此外,该数据集还激发了关于数据标准化与可重复性议题的讨论——由于数据源自国际劳工组织的统一分类体系,围绕其开发的基准模型与数据管道,已成为后续欧洲劳工图表数据集的清洗与建模范本,推动了劳动统计领域开放科学实践的纵深发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务