遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-eco-est-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲10个国家(阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、捷克、希腊、意大利、北马其顿、摩尔多瓦、塞尔维亚、斯洛伐克)从1993年至2025年的115,971条观测数据,核心指标为“员工实际每周平均工作时间”,并按性别(总计、男性、女性)、经济活动和机构规模进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过统一处理,以确保符合国际劳工统计学家会议(ICLS)的定义。数据集以表格形式呈现,包含国家代码、年份、观测值、数据来源、指标代码、分类维度及相关的备注信息。数据主要用于表格分类、回归和时间序列预测等任务,适用于劳动市场分析、经济研究等场景。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于机器学习使用。

This dataset contains 115,971 observations across 10 European countries (Albania, Austria, Bosnia and Herzegovina, Czechia, Greece, Italy, North Macedonia, Moldova, Serbia, Slovakia) spanning from 1993 to 2025. The core indicator is Mean weekly hours actually worked per employee, disaggregated by sex (total, male, female), economic activity, and establishment size. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and harmonized according to International Conference of Labour Statisticians (ICLS) definitions. It is presented in tabular format, including country codes, years, observed values, data sources, indicator codes, classification dimensions, and relevant notes. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, applicable to labor market analysis and economic research. Repackaged by Electric Sheep Europe in Parquet format for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-eco-est-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲10个国家1993年至2025年间雇员周均实际工作时长这一核心劳动指标,涵盖性别、经济活动及企业规模三个维度。Electric Sheep Europe团队通过ILOSTAT REST API直接抽取原始数据,并依据国际劳工统计学家会议(ICLS)的定义进行统一化处理,随后过滤出欧洲ISO3国家代码范围内的观测值,最终整合为115,971条记录。数据集的构建兼顾了多源数据(如劳动力调查、行政记录)的最佳来源选择,同时保留原始来源标签以确保可追溯性,为后续研究提供了坚实的数据基础。
特点
数据集的核心特点在于其精细的多维分组结构。它不仅提供了按性别(总、男、女)分类的观测值,还纳入了经济活动分类(如行业总体)和企业规模分类(如汇总规模),使得研究者能够深入剖析不同群体和部门间的工时差异。数据标注了观测状态(如不可靠值)和序列中断等元数据注释,增强了使用的谨慎性。尽管仅涵盖10个欧洲国家,但时间跨度长达32年,且各国数据年份分布各异,为跨国面板分析和时间序列建模提供了丰富的异质性。
使用方法
使用者可通过HuggingFace的load_dataset函数一键加载数据集,并以Pandas DataFrame格式轻松操作。例如,通过过滤ref_area字段可提取特定国家的子集,针对单一指标按时间排序后,即可绘制工时演变的时间序列图。数据集还支持透视表操作,将数据重塑为国家×年份的矩阵,便于进行跨区域横向比较。建议用户留意obs_status和note_indicator中的注释字段,以识别不可靠观测或方法论变更点,从而在回归或分类任务前进行合理的数据清洗和预处理。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台上,专注于记录欧洲10个国家自1993年至2025年间按性别、经济活动及企业规模分类的雇员每周实际工作小时数均值。核心研究问题在于揭示欧洲劳动力市场中工作时长的结构性差异及其演变趋势,为劳动经济学、国际比较与社会政策制定提供标准化、可复现的微观数据支撑。作为ILOSTAT全球劳动统计数据库的子集,该数据集在推动欧洲范围内工作时间模式的可比性分析方面具有重要价值,为时序列预测、面板数据回归及分类任务提供了丰富的观测基础,影响力辐射至劳动政策评估与经济学实证研究领域。
当前挑战
该数据集所解决的领域问题主要集中于工作时长数据的跨国可比性与细粒度划分难题,传统劳动统计常因各国调查方法、行业分类或企业规模定义差异而难以直接聚合。在构建过程中面临的挑战包括:从ILOSTAT的REST API中抽取并过滤至欧洲特定ISO代码时,需处理数据源标识不一致与多来源冲突(如同一国家同一年份存在多个调查来源,需选择ILO认定的‘最佳来源’);同时需处理就业状态标志(如‘不可靠’值)与时间序列断裂注释(如方法论修订导致的断点),确保时间连续性分析的可靠性。此外,仅保留年度频率数据而排除月度或季度序列,进一步增加了对离散观测值进行合理插值与建模的复杂性。
常用场景
经典使用场景
在欧洲劳动经济学与公共政策研究中,工时数据是评估劳动力市场健康程度的关键指标。该数据集涵盖了1993至2025年间10个欧洲国家的11.5万余条观测记录,包含按性别、经济活动类型与单位规模划分的员工平均每周实际工作时长。研究者可据此构建面板数据模型,分析不同国家、产业及性别群体的工时演变趋势,并利用其强大的细分维度进行差分内比较,从而洞察欧洲劳动制度的异质性与收敛性。
解决学术问题
该数据集直面劳动经济学领域长期存在的若干核心难题,包括如何精确测量不同人口特征群体的工作负荷差异、如何量化经济转型对工作时长的冲击,以及如何区分制度性因素与周期性波动对劳动供给的影响。通过提供标准化且跨年度的ILOSTAT统计指标,它使得水平与垂直比较在方法上变得可行,为推动工时政策优化、性别平等评估及劳动法效果检验等学术议题提供了扎实的实证基础。
衍生相关工作
该数据集源于ILOSTAT数据库的官方指标体系,其发布本身即是对全球劳动统计标准化工作的重要补充。在此基础上,研究者已衍生出多项代表性工作,涵盖利用机器学习对工时序列进行多步预测、构建欧洲各国劳动力市场效率的排名模型,以及结合经济周期指标设计劳动供需弹性估算框架。依托HuggingFace平台的开源生态,该数据集更促进了模型复现与因果推断方法的改进,推动了劳动经济学从描述性分析向预测性智能决策的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务