遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自9个欧洲国家(阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、瑞士、法国、希腊、摩尔多瓦、黑山、塞尔维亚)在1987年至2025年期间的4,239个观测值,核心指标为按性别、公共/私营部门和城乡地区划分的雇员实际平均每周工作时数(ILOSTAT代码:HOW_XEES_SEX_INS_GEO_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是劳动力统计的全球权威来源。数据集提供了详细的列结构,包括国家代码、指标、性别细分(总计、男性、女性)、机构部门分类、地区类型、观测年份、实际观测值以及数据状态标记等。数据经过ILO协调,使用国际劳工统计学家会议的定义,并标注了原始数据来源(如劳动力调查、家庭收入调查等)以确保可追溯性。数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究欧洲劳动力市场、工作时长趋势提供机器学习就绪的数据层。

This dataset contains 4,239 observations across 9 European countries (Albania, Austria, Bosnia and Herzegovina, Switzerland, France, Greece, Moldova, Montenegro, Serbia) spanning 1987 to 2025, with the core indicator being Mean weekly hours actually worked per employee by sex, public/private sector and rural/urban areas (ILOSTAT code: HOW_XEES_SEX_INS_GEO_NB). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, a leading global source for labour statistics. The dataset provides a detailed schema including country codes, indicators, sex disaggregation (total, male, female), institutional sector classification, area type, observation year, actual observed values, and data status flags. The data is harmonized by ILO using International Conference of Labour Statisticians definitions, with source information flagged for traceability (e.g., from labour force surveys, household income surveys). It is suitable for tasks such as tabular classification, regression, and time-series forecasting, and is designed as an ML-ready data layer for researching European labour market and working hours trends.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-ins-geo-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
在劳动统计学领域,工时数据是衡量劳动力市场运行状态的关键指标。该数据集由Electric Sheep Europe从ILOSTAT REST API直接抽取,原始指标代码为HOW_XEES_SEX_INS_GEO_NB,聚焦于按性别、公共/私营部门和城乡区域划分的雇员平均每周实际工作时长。抽取结果进一步根据欧洲ISO3国家代码进行过滤,仅保留9个欧洲国家的观测记录,从而构建出一个聚焦欧洲区域的子集。ILO统计部门在原始数据生成过程中,依据国际劳工统计学家会议(ICLS)定义统一协调各国家庭调查、劳动力调查和行政记录等原始微观数据,并通过source.label字段确保每个观测值的来源可追溯,最终形成包含4,239条观测的清洁表格数据集。
特点
该数据集的核心特点在于其精细的多维度分层结构。以性别(SEX_T/SEX_M/SEX_F)、制度部门(如机构部门总计)以及地理覆盖范围(如国家层面)为分类变量,研究者能够深入剖析不同社会群体间的工时差异。时间跨度覆盖1987年至2025年,为长时序比较分析提供了扎实的数据基础。数据质量方面,当同一国家与年份存在多个来源时,采用ILO选定的‘最佳来源’,且观测状态标志(如中断标志B)和注释字段(如方法修订说明)的完整保留,使得使用者可以审慎评估每个数据点的可靠性。这些特性使其尤其适用于跨国面板回归和劳动力市场政策的回顾性研究。
使用方法
使用者可通过HuggingFace datasets库直接加载数据集,仅需一行Python代码即可获得Pandas DataFrame格式的数据,便于快速整合到现有分析流程中。具体而言,可通过ref_area列过滤特定国家(如德国),也可基于indicator列选取目标指标(如HOW_XEES_SEX_INS_GEO_NB)进行时间序列绘图。对于需要构建跨国面板数据的研究,推荐利用pivot_table方法将数据重塑为以年份为行、国家代码为列的矩阵形式,便于进行后续的固定效应或随机效应回归分析。所有操作均在标准的数据科学工具栈内完成,无需额外配置数据库或API,大幅降低了劳动经济研究者的数据获取与预处理门槛。
背景与挑战
背景概述
该数据集源于国际劳工组织(ILO)下属ILOSTAT数据库,由Electric Sheep Europe于2025年重新打包并发布在HuggingFace平台。数据集聚焦欧洲9个国家(1987–2025年间)的“按性别、公共/私营部门及城乡划分的雇员实际周均工时”指标,包含4239条观测记录。ILOSTAT作为全球劳动统计的核心枢纽,通过整合劳动力调查、家庭收支调查等多源行政记录,对跨越200多个经济体的数据进行标准化处理,其方法论遵循国际劳工统计学家会议(ICLS)定义。该数据集通过ILOSTAT REST API直接抽取并过滤至欧洲ISO3编码国家,为研究欧洲劳动力市场中工时的时间演变、性别差异及区域异质性提供了高颗粒度的结构化数据,对劳动经济学、公共政策评估及可持续发展目标(SDG)中体面工作的量化监测具有重要支撑价值。
当前挑战
数据集面临的挑战首先体现在领域问题层面:工时数据受国家间统计标准差异、抽样调查方法更迭及经济周期波动影响,导致跨国家、跨时段的直接比较需谨慎处理数据一致性。例如,数据集中标注了“Break in series”状态(如B标志),反映因方法论修订或调查工具变更造成的序列断裂,这对时间序列分析的连贯性构成显著障碍。在构建过程中,挑战主要源于ILOSTAT的多源数据融合:同一国家同一年份可能对应多个数据源(如劳动力调查与行政记录),ILO虽采用“最佳来源”筛选策略,但该选择标准及其对估算结果的潜在偏差并未完全透明,且缺失月度或季度高频数据,限制了更精细的周期性波动研究。此外,部分国家(如阿尔巴尼亚、黑山)样本量极小(仅54条或27条),导致统计代表性不足,增加了推断分析的误差风险。
常用场景
经典使用场景
该数据集聚焦于欧洲九国1987年至2025年间雇员每周实际工作小时数的均值,并按性别、公共/私营部门以及城乡区域进行细致拆解。经典的使用场景集中于劳动经济学中的时间配置分析,研究者可借此探究不同国家劳动力市场中工作强度的演变趋势,尤其适合构建面板数据模型,以揭示性别间工作时间的差异、公共与私营部门的工作负荷对比,以及城乡劳动力参与模式的异同。同时,该数据为时间序列预测与分类回归任务提供了结构化基础,是检验宏观经济波动对劳动供给影响的理想资源。
解决学术问题
这一数据集有效回应了若干关键学术议题,例如劳动力市场中性别不平等在工作时间上的具体表现、经济转型期公共与私营部门工作制度的变迁,以及城市化进程中农村与城市雇员劳动负担的分化。它使学者能够跨越国别与时间维度,量化分析制度环境、社会政策与产业结构对每周工作时长的塑造作用,从而为国际劳工组织倡导的体面劳动目标提供实证支撑。其多分类维度的设计,更推动了关于就业质量与工作生活平衡的交叉研究,显著丰富了劳动统计学的分析框架。
衍生相关工作
以该数据集为蓝本,衍生出多项具有影响力的经典工作。其中,基于该数据的比较研究被用于构建欧洲劳动力市场时长的统计模型,预测经济政策调整对工作强度的影响。相关学者还利用其细颗粒度的分类标签,发展了针对性别工资差异与职业隔离的回归分析,并将结果与国际劳工组织的全球数据整合,形成跨区域的工作条件评估报告。此外,该数据经重采样后应用于机器学习领域,助力开发更为稳健的时序预测算法,推动劳动统计的自动化与智能化演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务