遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-est-mts-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的42,196个观测值,覆盖欧洲9个国家(阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、捷克共和国、希腊、北马其顿、摩尔多瓦、塞尔维亚、斯洛伐克),时间跨度为1992年至2025年。数据集专注于工作时间主题,具体指标为按性别、企业规模和婚姻状况划分的雇员实际平均每周工作小时数(指标代码:HOW_XEES_SEX_EST_MTS_NB)。数据通过ILOSTAT REST API获取,并经过欧洲国家筛选,采用国际劳工统计学家会议(ICLS)定义进行标准化。数据集包括分类维度,如性别(总计、男性、女性)、企业规模和婚姻状况,并提供观测值、状态标志和来源注释等信息。数据以年度频率发布,适用于表格分类、回归和时间序列预测任务。

This dataset contains 42,196 observations of Hours of work data from the International Labour Organizations (ILO) ILOSTAT database, covering 9 European countries (Albania, Austria, Bosnia and Herzegovina, Czech Republic, Greece, North Macedonia, Moldova, Serbia, Slovakia) from 1992 to 2025. It focuses on the indicator Mean weekly hours actually worked per employee by sex, establishment size and marital status (code: HOW_XEES_SEX_EST_MTS_NB). Data is sourced via the ILOSTAT REST API, filtered for European countries, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes disaggregation dimensions such as sex (total, male, female), establishment size, and marital status, with columns for observed values, status flags, and source notes. Data is annual frequency and suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-est-mts-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)权威统计数据库ILOSTAT构建而成。其原始数据源自各国劳动力调查、家庭收入调查、企业调查及行政记录等多元渠道,经由ILO统计部门依据国际劳工统计学家会议(ICLS)定义标准进行统一清洗与协调。具体构建过程中,通过ILOSTAT提供的REST API接口(https://rplumber.ilo.org/data/indicator?id=HOW_XEES_SEX_EST_MTS_NB)直接抽取指标数据,并依据欧洲ISO3国家代码进行地理范围过滤,最终形成涵盖9个欧洲国家、时间跨度1992年至2025年的结构化样本。数据集保留了源数据中source.label字段,以标注每一条观测的数据来源,确保了从原始微数据到最终表格的可追溯性与透明性。
特点
该数据集拥有42,196条观测记录,聚焦于“按性别、企业规模与婚姻状况划分的员工每周实际工作平均小时数”这一核心劳工指标。其独特之处在于提供了精细的多维分类视角:性别维度涵盖总计、男性与女性三个层次;企业规模与婚姻状况作为附加分类变量,进一步丰富了劳动行为的解析层次。数据集同时包含观测状态标记(如“不可靠”)以及指标与来源的注释信息(如“方法论修订导致序列中断”),帮助用户识别数据质量与潜在偏差。此外,该数据以年度频率发布,且对同一国家年份存在多来源时优先采用ILO选定的“最佳来源”,在保持统计一致性的同时兼顾了国别间数据质量的差异。
使用方法
该数据集以HuggingFace Datasets格式发布,用户可借助`load_dataset`函数一行代码完成加载,随后通过`to_pandas()`方法即刻转换为Pandas DataFrame进行探索。针对时间序列分析场景,可按国家代码(如`ref_area=='DEU'`)筛选特定国家数据,或对单一指标按时间排序后绘制趋势曲线。用户亦可通过数据透视表操作,构建以年份为索引、国家为列、观测值为内容的国别时间矩阵,便于横向比较不同欧洲国家的劳工工时演变。此外,分类列(如性别、企业规模、婚姻状况)支持进一步的分组聚合,使研究者能够灵活分析欧洲地区特定人群的工作时间特征及其长期变化规律。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于ILOSTAT数据库创建,经Electric Sheep Europe于2025年重新封装,收录了1992年至2025年间欧洲9个国家共42,196条观测记录。核心研究问题聚焦于不同性别、企业规模及婚姻状况下雇员实际每周平均工作时间的差异,旨在为劳动经济学、社会政策评估及劳动力市场研究提供细粒度的时间序列数据。数据集覆盖阿尔巴尼亚、奥地利等国家,其指标来源于各国劳动力调查等多源数据,经ILO采用国际劳工统计学家会议(ICLS)定义进行统一整合,成为分析欧洲工作时间模式与结构变化的权威基础资源。
当前挑战
该数据集所解决的领域挑战在于,传统工作时间统计常因国家间调查方法不统一、分类维度缺失(如性别、企业规模、婚姻状况)而难以进行跨国比较与精细化分析,导致政策制定缺乏数据支撑。构建过程中面临的主要挑战包括:多源数据来源于各国不同调查体系(如劳动力调查、行政记录),需通过ILO协调与最佳源选择确保跨年度与跨国的一致性;分类变量(如‘classif1’中的企业规模聚合)存在大量空值,仅当特定指标发布细分维度时才填充,增加了数据清洗与建模的复杂性;部分观测值标记为‘不可靠’或存在系列中断(如方法论修订),对长期趋势分析的连续性构成干扰。
常用场景
经典使用场景
在劳动经济学与人口统计学的交汇处,该数据集为研究者提供了一个多维度剖析欧洲劳动力市场中“实际周工时”的宝贵窗口。其经典用途在于构建面板数据模型,以探究性别、企业规模与婚姻状况如何共同塑造雇员的实际劳动时间投入。通过整合时间跨度达1992至2025年的跨国观测,学者能够利用时间序列或回归分析方法,精准评估制度变迁、经济周期与结构性政策对工时分布的异质性影响,从而勾勒出欧洲不同国家劳动力市场的动态演进图景。
解决学术问题
该数据集的核心学术贡献在于弥合了宏观劳动统计与微观个体特征之间的鸿沟,解决了长期以来因缺乏细粒度分类数据而导致的研究局限性。它使学者能够量化分析性别工时的固化差异、企业规模对工作效率的调节作用,以及婚姻状况如何作为社会分层的代理变量影响劳动供给。这些问题的深入探讨不仅验证了劳动力市场的理性选择理论,还揭示了制度性歧视与非正式经济的存在证据,为理解欧洲内部劳动力市场的不平等结构提供了坚实的数据基石,具有显著的学术里程碑意义。
衍生相关工作
该数据集作为ILOSTAT体系的精华子集,已催生了一系列卓有影响力的衍生研究。围绕其核心指标,学者们构建了预测欧洲各国工时趋势的宏观时间序列模型,并以此检验OECD国家中劳动时间与生产率之间的非线性关系。同时,基于该数据集对性别与婚姻状况的交叉分类,诞生了多篇聚焦于“性别工时缺口”与“婚姻溢价”的前沿文献,丰富了家庭经济学与劳动供给理论。更为精妙的是,部分研究者将其与欧洲社会调查等微观数据匹配,开创了多层次分析范式,使得从个体行为到国家制度的完整阐释链条得以贯通,彰显了该数据在深度解析劳动市场矛盾中的关键作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务