遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲国家雇员实际平均每周工作时间的表格数据集,数据来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集包含99,328个观测值,涵盖38个欧洲国家,时间跨度为1992年至2025年。核心指标为按性别、经济活动和城乡划分的雇员实际平均每周工作时间,数据按性别(总计、男性、女性)、经济活动和城乡区域进行细分,以年度频率提供。数据集经过Electric Sheep Europe重新打包,采用一致的架构,便于机器学习使用。

This is a tabular dataset on mean weekly hours actually worked per employee in European countries, sourced from the International Labour Organization (ILO) ILOSTAT database. It contains 99,328 observations across 38 European countries, spanning from 1992 to 2025. The core indicator is Mean weekly hours actually worked per employee by sex, economic activity and rural/urban areas, with data disaggregated by sex (total, male, female), economic activity, and rural/urban areas, provided at annual frequency. The dataset is repackaged by Electric Sheep Europe with a consistent schema for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-eco-geo-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接抽取指标代码为HOW_XEES_SEX_ECO_GEO_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤。数据经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调,原始调查微观数据来源通过source.label字段加以标注,确保了数据的可追溯性与标准化程度。最终整合为包含99,328条观测值、覆盖38个欧洲国家、时间跨度从1992年至2025年的结构化表格数据集。
特点
数据集聚焦于雇员按性别、经济活动与城乡地域划分的周平均实际工作小时数,是劳动统计领域内高度细分的指标型数据。其特色在于多维度的分类变量设计,涵盖性别(总、男、女)、经济活动大类及地域覆盖类型,支持灵活的下钻分析。数据为年度频率,并采用ILO选定的“最佳来源”策略处理同一国家与年份多源数据的情形,观测值附有状态标识(如不可靠、暂定),便于用户进行数据质量评估。
使用方法
用户可通过HuggingFace datasets库中的load_dataset函数一键加载,返回的Dataset对象可直接转换为pandas DataFrame,便于后续分析。针对单一国家的筛选,可利用ref_area字段进行条件过滤,例如提取德国数据。对于时间序列探索,可依据indicator字段定位目标指标,按time排序后绘制obs_value的演变趋势。同时支持pivot_table操作,将数据重塑为国家×年份的矩阵格式,适合进行面板数据分析与跨国的比较研究。
背景与挑战
背景概述
在劳动经济学与社会政策研究领域,工作时长是衡量劳动力利用程度与劳动者福祉的核心指标之一,其跨国、跨时期的动态变化与性别、经济活动部门及城乡分布的交互关系,构成了理解欧洲劳动力市场结构转型的关键切入点。该数据集由国际劳工组织(ILO)统计司于其核心数据库ILOSTAT中编制发布,并经由Electric Sheep Europe于2025年重新打包整合至HuggingFace平台,旨在为研究者提供一个规范化的、可直接用于机器学习的表格与时间序列数据资源。数据集囊括了1992至2025年间38个欧洲国家关于雇员实际周平均工作时间的观测值,共计99,328条记录,按性别、经济活动部门及城乡区域进行细粒度分解,涵盖了从北欧福利国家到南欧与东欧转型经济的广泛地理范畴。其核心研究问题在于揭示欧洲范围内不同社会人口群体在劳动时间投入上的异质性模式,为比较劳动法、性别平等政策、区域发展经济学以及国际劳工标准的实证评估提供了可靠的数据基础。作为ILOSTAT中HOW_XEES_SEX_ECO_GEO_NB指标在欧洲子集的权威镜像,该数据集因其高度的结构化程度、统一的ICLS定义框架以及公开的CC-BY-4.0许可协议,在劳动统计的跨国比较分析和基于机器学习的工时预测建模中具有显著的基准价值。
当前挑战
该数据集所应对的核心领域挑战在于劳动市场研究中跨国可比性困境与新古典工时决定理论之间的张力——传统理论多假设工时由单一市场均衡决定,而现实中工时分布受到制度法规、产业结构、文化规范及家庭决策等多重非市场因素的深刻影响,尤其是性别差异与城乡分化所反映的结构性不平等难以被宏观总量指标捕捉。具体而言,数据构建过程面临多重技术挑战:其一,原始数据源自各国不同类型的劳动力调查(如劳动力调查、生活水平测量调查),调查工具、抽样框架与应答率差异导致跨国产出的一致性问题,ILOSTAT虽经ICLS标准协调,但数据备注字段仍频繁出现方法修订(Break in series)与可靠性存疑标记(obs_status为U),这要求用户在使用前必须审慎处理数据质量的非均衡性;其二,分类维度中性别、经济活动和地域类型的组合粒度极细,导致部分国家-年份-子群体单元格出现观测值稀疏甚至缺失,这给基于完整面板的多变量因果推断与时序建模带来了维数诅咒与插补难度;其三,从数据工程视角看,该数据集为年度频率,而劳动市场中许多短期波动(如季节性就业、临时调控政策效应)在此时间粒度下被隐没,限制了其在高频预测与因果识别中的直接适用性,研究者需结合辅助数据源弥合时间分辨率缺口。
常用场景
经典使用场景
在劳动经济学与劳动力市场研究的广袤领域中,该数据集凭借其跨越1992年至2025年、覆盖38个欧洲国家的宏大时空维度,成为探究欧洲劳动者每周实际工作时间的宝贵素材。其核心用途在于对平均周工时进行多维度剖析,研究者可通过性别、经济活动部门以及城乡区域等分类标准(如sex、classif1、classif2列),揭示不同群体间工时分布的差异性。经典研究通常利用该数据集构建面板数据,通过时间序列分析或横截面比较,探讨欧洲各国工时演变的长期趋势、收敛特征及其与宏观经济周期的关联,为理解欧洲劳动力市场的结构性变迁提供了坚实的量化基础。
实际应用
在公共政策制定与人力资源管理的实际场景中,该数据集展现出显著的应用价值。政策制定者与劳动部门可借助其中按性别、经济活动及城乡细分的工时数据,精准识别当前劳动市场中存在的性别不平等鸿沟与区域发展不均衡现象,从而设计更具靶向性的劳动法规或社会政策,例如调整法定工时上限或推行灵活就业激励。对于跨国企业及人力资源咨询机构而言,这些数据能够辅助其进行跨国薪酬与劳动力成本对标分析,优化用工安排与人力规划。同时,国际组织及学术智库亦可将该数据集作为监测联合国可持续发展目标中体面工作进展的参照依据,借以评估各国劳动条件的改善趋势,为全球劳动治理提供实证支撑。
衍生相关工作
基于该数据的丰富结构,学术界已衍生出一系列具有影响力的经典工作。最典型的工作流之一是利用其时间序列特征构建预测模型,研究者们常使用自回归移动平均(ARIMA)、季节分解或长短期记忆网络(LSTM)等方法,对特定国家或行业的未来工时走势进行推断。另有一些工作侧重于挖掘分类维度之间的交互效应,通过多元回归或非参数分解方法,量化“性别-行业”或“城乡-部门”等组合因素对工时差异的贡献度。此外,为了处理数据中的缺失值和不稳定观测标志(如obs_status),学者们开发了特定的插补算法和可靠性加权方案,这些方法论创新反过来又丰富了复杂面板数据清洗与分析的理论工具集。这些衍生工作不仅深化了对欧洲劳动模式的理解,也为其他地域或主题的劳动力研究树立了方法论典范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务