遇见数据集

electricsheepeurope/europe-ilo-how-temp-age-ec2-nb-mean-weekly-hours-actually-worked-per-employed-per

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲14个国家(如希腊、葡萄牙、瑞士、捷克、英国、奥地利、法国、斯洛伐克、北马其顿、波黑、意大利、阿尔巴尼亚、塞尔维亚、白俄罗斯)从1993年至2025年间的60,781个观测值,聚焦于“工作时间”主题。具体指标为“每个就业人员实际平均每周工作时间,按年龄和经济活动(ISIC 2位代码)分类”(指标代码HOW_TEMP_AGE_EC2_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API获取,并经过标准化处理,使用ICLS(国际劳工统计学家会议)定义进行协调。数据集为表格形式,包含年度频率数据,列包括国家代码、国家名称、数据来源、指标代码、指标标签、分类变量(如年龄、经济活动)、观测年份、观测值、观测状态等。数据质量方面,ILO选择“最佳来源”处理同一国家年份的多个来源,且分类列仅在指标发布细分数据时非空。该数据集由Electric Sheep Europe重新打包,旨在为欧洲提供统一的、机器学习就绪的数据层,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 60,781 observations across 14 European countries (e.g., Greece, Portugal, Switzerland, Czechia, United Kingdom, Austria, France, Slovakia, North Macedonia, Bosnia and Herzegovina, Italy, Albania, Serbia, Belarus) spanning 1993 to 2025, focusing on the Hours of work topic. The specific indicator is Mean weekly hours actually worked per employed person by age and economic activity - ISIC level 2 (indicator code HOW_TEMP_AGE_EC2_NB). Data is sourced from the International Labour Organization (ILO) ILOSTAT statistics database, retrieved via the REST API and harmonized using ICLS (International Conference of Labour Statisticians) definitions. The dataset is in tabular format with annual frequency, including columns such as country code, country name, data source, indicator code, indicator label, classification variables (e.g., age, economic activity), observation year, observed value, and observation status. Data quality notes indicate that ILO selects the best source for multiple sources per country-year, and disaggregation columns are non-null only when the indicator publishes that breakdown. Repackaged by Electric Sheep Europe, it aims to provide a unified, ML-ready data layer for Europe, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-temp-age-ec2-nb-mean-weekly-hours-actually-worked-per-employed-per 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接拉取指标`HOW_TEMP_AGE_EC2_NB`的原始数据,并依据欧洲ISO3国家代码进行地域筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化处理,确保跨国可比性。数据集经Electric Sheep Europe重新封装为Parquet格式,并引入一致的列名与元数据,共收录60781条观测,覆盖14个欧洲国家,时间跨度从1993年至2025年。
特点
本数据集的核心特点在于其聚焦于欧洲地区按年龄和经济活动划分的就业者周均实际工作小时数,是劳动时间领域的重要细分指标。数据包含丰富的分类变量,如年龄组(青年/成人)、经济活动分类(ISIC Rev.4两位数级别),以及详细的来源与注释字段,便于追溯数据质量与调整情况。此外,每年仅采用ILO筛选的'最佳来源',有效减少了多源冲突,提升了数据的一致性。数据集同时支持表格分类、回归与时间序列预测任务,具有高度的分析灵活性。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集,使用`load_dataset`函数即可获取训练集并转换为Pandas DataFrame,操作极为便捷。针对特定国家的分析,可通过`ref_area`列进行过滤。对于时间序列分析,可按`indicator`筛选并依时间排序后直接绘图。此外,利用`pivot_table`可轻松将数据重塑为国家×年份的矩阵形式,便于横向比较与建模。数据集的英文列名清晰,文档详实,适合专业研究者与开发者快速上手开展分析工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT整理发布,由Electric Sheep Europe进行重新封装,聚焦于欧洲14个国家在1993至2025年间按年龄和经济活动划分的就业人员实际周平均工时。ILOSTAT作为全球劳动统计的权威来源,整合各国劳动力调查、家庭收支调查及行政记录数据,依据国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集共包含60,781条观测记录,覆盖希腊、葡萄牙、瑞士等14个欧洲国家,旨在为劳动经济学、时间利用研究及社会经济政策评估提供精细化的跨国家、跨年龄组和行业分类的工时数据支撑,对理解欧洲劳动力市场结构性变迁及推动与国际劳工组织可持续发展目标(SDG)相关的体面劳动指标监测具有重要价值。
当前挑战
该数据集面临的核心挑战包括:第一,数据跨国家、跨时间段的异质性问题突出——各国劳动力调查的采样设计、问卷措辞及数据质量控制标准存在差异,即使在ILO的统一框架下,观测值中仍出现因数据可靠性不足而被标记为“不可靠”(unreliable)的记录,影响了跨国比较和时序分析的稳健性。第二,构建过程中面临来自国家统计机构数据报送的碎片化挑战,具体表现为同一国家在不同年份可能采用不同的调查来源,而ILO仅选取其认定的“最佳来源”,对非选择来源中的信息产生系统性的遗漏。第三,数据仅提供年度粒度,缺乏月度和季度高频信息,对于刻画短期劳动力市场波动、政策即时效应及季节性就业模式的语境能力受到约束,限制了在高分辨率时间序列预测和高频经济预警模型中的应用潜力。
常用场景
经典使用场景
该数据集记录着14个欧洲国家1993年至2025年间,不同年龄与经济活动类别下就业者每周实际工作小时数的均值,共包含60,781条观测。其经典使用场景在于作为面板数据,支撑劳动经济学领域对欧洲各国工时趋势的纵向分析,以及构建跨国家、跨年龄组的比较研究。研究者可通过时间序列模型,探索经济周期、产业结构变迁如何影响不同年龄层就业者的劳动供给行为,亦可将其作为特征变量,纳入工资决定方程或劳动生产率模型,以揭示工时变动背后的结构性驱动因素。
衍生相关工作
该数据集的衍生相关工作主要集中在两个方向:一是基于其精细化分类特征,促成了多项关于欧洲特定行业(如制造业、建筑业)工时异质性的实证研究;二是推动了将ILO工时数据与宏观就业、教育水平、技术替换指数等面板数据融合的计量分析,如使用固定效应模型检验“工作时间悖论”在欧洲的存在性。此外,该数据已被纳入若干开源时间序列预测基准,验证了Transformer与Prophet模型在劳动统计低频数据上的外推性能,间接助力了结构化时序预测方法的发展。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲14国1993至2025年间按年龄和经济活动划分的周平均实际工时观测值,为劳动经济学与时间序列预测领域提供了高颗粒度、跨国的面板数据。当前前沿研究多围绕后疫情时代工作模式的变迁展开,尤其关注远程办公普及与零工经济对传统工时结构的冲击,以及人口老龄化对劳动力供给的异质性影响。该数据集以其ILOSTAT官方来源的权威性、覆盖三十余年的长时序特点,为构建精细化劳动市场预测模型、验证超时工作与生产率之间的倒U型关系假说,以及评估欧盟《关于改善工作条件的指令》等政策干预效果提供了坚实的计量基础。其结构化的分类标签(如青年与成人组别、ISIC第二级经济活动编码)更支持多维分解分析,推动着从宏观总量到微观结构的劳动力研究转向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务