遇见数据集

electricsheepeurope/europe-ilo-how-xees-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲国家员工实际平均每周工作小时数数据,具体指标为按性别、企业规模和残疾状况划分的员工实际平均每周工作小时数。数据集涵盖2个欧洲国家(摩尔多瓦和塞尔维亚),时间跨度为2007年至2025年,共369个观测值。数据以年度频率提供,包括国家代码、年份、指标值、以及按性别、企业规模和残疾状况的分类维度。数据集适用于表格分类、回归和时间序列预测等机器学习任务,并遵循CC-BY-4.0许可协议。

This dataset contains data on mean weekly hours actually worked per employee in European countries, disaggregated by sex, establishment size, and disability status, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 2 European countries (Moldova and Serbia) from 2007 to 2025, with 369 observations. The data is provided at an annual frequency and includes country codes, years, indicator values, and classification dimensions such as sex, establishment size, and disability status. The dataset is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-how-xees-sex-est-dsb-nb-mean-weekly-hours-actually-worked-per-employee-by 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,基于其REST API接口,以指示符代码“HOW_XEES_SEX_EST_DSB_NB”为索引,精准抓取了欧洲地区两个国家(摩尔多瓦与塞尔维亚)的劳动力统计数据。原始数据来源于各国劳动力调查、家庭收入调查等官方统计资料,并经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一标准化处理。Electric Sheep Europe团队进一步对原始数据进行清洗、筛选与格式规范化,仅保留ISO 3166-1 alpha-3编码为欧洲国家代码的观测值,最终构建为一个包含369条记录、覆盖2007至2025年时间跨度的表格型数据集,并以Parquet格式封装,确保机器学习场景下的高效加载与兼容性。数据集中每条记录均保留了来源标识,以保障数据的可追溯性。
特点
该数据集的核心特点在于其精细化的多维度分解能力。其核心指标为“按性别、企业规模与残疾状况划分的雇员实际周平均工作时间”,这允许研究人员同时从性别(分为男性、女性与总计)、企业规模(如总计或特定规模分类)以及残疾状况(如总计或具体分类)三个维度对工时数据进行交叉分析。数据集的结构化设计清晰,包含国家代码、数据来源、指示符标签、时间戳与观测值等18个字段,且通过`sex`、`classif1`与`classif2`等分类列实现维度存储。数据质量受到严格标注,通过`obs_status`字段清晰标记观测值的可靠性(如不稳定或临时性)。由于数据以年度频率呈现,且仅包含ILO选定的“最佳来源”数据,因此它既保证了统计口径的一致性,也规避了多源数据混杂的复杂性。
使用方法
该数据集的使用极为便捷,完全契合现代数据科学工作流。用户可通过HuggingFace Datasets库的`load_dataset()`函数一步完成加载,所得数据集可直接转换为Pandas DataFrame进行后续分析。针对特定国家(如德国)的筛选,开发者可以使用简单的布尔索引结合国家代码实现。进行时间序列分析时,可依据指示符过滤数据并按时序进行排序与可视化。此外,通过Pivot Table操作,用户可以轻松将数据重塑为国家×年份的矩阵格式,便于进行跨国的横向对比或面板数据分析。对于计量经济学与劳动经济学研究而言,这种结构化的面板数据直接支持回归模型的建立,无需繁琐的预处理步骤。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于ILOSTAT数据库整理,并经Electric Sheep Europe于2025年重新封装发布,聚焦欧洲地区员工实际每周平均工时这一劳动经济学核心指标。研究背景植根于对劳动力市场性别平等、企业规模差异及残疾就业状况的深入探讨,通过涵盖2007至2025年间来自摩尔多瓦和塞尔维亚两国的369条观测记录,为跨国比较及时间序列分析提供了微观数据支撑。该数据集凭借ILO在劳动统计领域的权威地位,在推动劳动经济学、社会政策评估及可持续发展目标监测方面具有显著影响力,尤其为量化不同群体间工时差异及就业质量提供了标准化基准。
当前挑战
数据集面临的挑战首先体现在领域问题上:工时数据易受季节性波动、经济周期及抽样误差影响,且跨国定义差异始终是劳动统计难以回避的痛点,尽管ILO采用ICLS标准进行协调,但各国调查实践中的细微偏差仍可能扭曲比较结果。在构建层面,数据来源主要依赖劳动力调查与企业登记记录,存在覆盖不均衡问题——摩尔多瓦拥有333条记录而塞尔维亚仅36条,这种地理分布的不对称限制了泛化推断能力;此外,部分观测值被标记为“不可靠”,且分类变量存在缺失,使得多维度交叉分析(如按性别与企业规模联合分组)面临样本稀疏与质量波动等技术瓶颈。
常用场景
经典使用场景
在劳动经济学与政策评估领域,该数据集常用于研究欧洲国家雇员实际周工作时间的结构性特征。通过按性别、企业规模及残疾状态进行交叉维度分解,研究者能够系统性地审视不同社会群体在劳动时长上的差异格局。作为一个跨越2007至2025年的时间序列数据,它尤其适合开展纵向比较分析,揭示雇佣形态随经济周期波动的演变轨迹。数据集中明确标注的数据来源与观测状态字段,为进行元分析或稳健性检验提供了基础支撑。
解决学术问题
该数据集着力解决了劳动力市场中多维异质性工作时间的测量与归因问题。传统研究常受限于加总数据而难以区分性别、企业规模及残疾状态对工作时长的交互影响。借助ILOSTAT官方统一定义的指标与方法论,该数据为辨识不同群体面临的工时困境提供了标准化分析框架,进而促进了对劳务市场中非正规雇佣现象、性别工资差距深层成因以及残疾人就业包容性政策的实证探索,对推进体面劳动目标具有重要的学术映射意义。
衍生相关工作
该数据集衍生了诸多具有代表性的后续研究成果,涵盖领域包括但不限于基于时间序列的经济不确定性冲击研究、性别差异的劳动力供给弹性建模,以及残疾状态与劳动市场参与率之间的因果推断。部分学者依据该数据的分类变量结构,扩展构建了跨国比较的固定效应模型与面板回归分析,推动了ILOSTAT体系下欧洲劳动数据的再整合与二次开发工作。这些研究不仅丰富了劳动经济学的方法论工具箱,也进一步巩固了该数据作为欧洲劳动力指标高时效性来源的核心地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务