遇见数据集

electricsheepeurope/europe-ilo-emp-xtru-sex-rt-time-related-underemployment-rate-by-sex

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲37个国家1991年至2025年的时间相关就业不足率数据,按性别百分比统计。数据集共有2,472个观测值,涵盖1个核心指标(EMP_XTRU_SEX_RT),数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为欧洲国家。数据按性别维度分解为总计、男性和女性三类,每年更新,并包含国家代码、观测值、数据来源和质量标志等详细列结构。数据集适用于表格分类、回归和时间序列预测任务,采用CC-BY-4.0许可证发布,由Electric Sheep Europe重新打包以提供机器学习就绪格式。

This dataset contains 2,472 observations of time-related underemployment rates by sex (percentage) across 37 European countries from 1991 to 2025. It covers one distinct indicator (EMP_XTRU_SEX_RT), sourced from the International Labour Organizations ILOSTAT database via API and filtered to European ISO3 country codes. Data is disaggregated by sex (total, male, female), with annual frequency, and includes columns for country codes, indicator values, source metadata, and quality flags. It is designed for tabular classification, regression, and time-series forecasting tasks, released under the CC-BY-4.0 license and repackaged by Electric Sheep Europe for ML-ready use.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-xtru-sex-rt-time-related-underemployment-rate-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦欧洲地区时间相关就业不足率(按性别分列)的年度观测值。数据通过ILOSTAT REST API提取指标代码为EMP_XTRU_SEX_RT的原始数据,并依据ISO 3166-1 alpha-3标准筛选出37个欧洲国家,覆盖1991至2025年间的观测记录。ILO依据国际劳工统计学家会议定义对调查微观数据进行协调统一,同时保留来源标识以保障可追溯性。数据经Electric Sheep Europe重新封装为Parquet格式,并统一了各字段的命名与类型定义,形成包含2,472条观测、1个核心指标的结构化表格。
特点
该数据集以精细的维度划分和严谨的数据治理为特色,涵盖性别(总、男、女)这一核心分类维度,便于进行性别差异的深度剖析。其时间跨度横跨35年,覆盖37个欧洲国家,且每个观测条目均附有详尽的数据来源、观测状态及断点说明,如方法论修订或数据中断等元数据信息,使研究者能够准确评估数据质量。此外,数据集的规范组织为时间序列分析、面板数据回归等复杂统计建模提供了理想的输入基础。
使用方法
研究者可通过HuggingFace datasets库直接调用,使用load_dataset函数便捷加载数据并转化为Pandas数据框,便于进行初步探索。数据集支持按国家筛选,例如过滤ref_area字段获取特定国家的时序数据;亦支持按指标(如EMP_XTRU_SEX_RT)排序绘制趋势图,以观察变化规律。更可运用透视表功能,重塑数据为以时间为行、国家为列的矩阵形式,以适应后续的计量分析或机器学习任务。该数据集已兼容Python环境,无缝对接主流数据科学工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门编制,经Electric Sheep Europe重新打包,收录了1991年至2025年间欧洲37个国家的时间相关不充分就业率数据,按性别进行分列,共计2472条观测。其核心研究问题在于揭示欧洲劳动力市场中因工时不足而寻求额外工作的群体特征,为劳动经济学、社会政策及可持续发展目标(SDG)中的体面工作指标提供量化基础。ILO作为全球劳动统计的权威来源,其数据标准化流程依据国际劳工统计学家会议(ICLS)定义,确保了跨国比较的严谨性。该数据集的发布,特别是通过HuggingFace平台以表格与时间序列格式呈现,极大便利了机器学习研究者在劳动市场分析、预测建模及性别差异研究中的直接应用,成为连接官方统计与数据科学的关键桥梁。
当前挑战
该数据集面临的核心挑战包括:其一,领域问题层面,时间相关不充分就业率作为劳动市场疲软的重要指标,其跨国统计口径的差异(如各国对'寻求额外工作'的界定不一)导致比较分析的复杂性;其二,数据构建过程中,ILO需整合各国不同的劳动力调查来源,面临数据稀疏性(如部分国家年份缺失)、序列中断(标记为'Break in series')以及来源多样化的协调难题。此外,数据以年度频率发布,牺牲了月度或季度波动信息,可能掩盖短期就业动态。对于机器学习应用而言,非平衡的面板数据结构与分类变量(如性别)的有限粒度,增加了模型泛化与不确定性量化的难度,要求研究者采用先进的时间序列与异常值处理技术,以充分挖掘其潜力并保障分析结论的稳健性。
常用场景
经典使用场景
该数据集收录了1991年至2025年间37个欧洲国家的工时相关就业不足率(按性别分列)的年度观测值,总计2472条记录。此类数据是劳动经济学、社会政策研究及跨国比较分析中的基础性资源。研究者常将其用于评估劳动力市场的闲置产能,探究性别差异对就业质量的影响,以及追踪经济周期中劳动力调整的动态变化。其时间跨度之长、覆盖国家之广,为构建面板数据模型提供了坚实的数据支撑。
衍生相关工作
基于此数据集,研究人员已开展多项衍生工作。例如,构建欧洲劳动力市场闲置率指标的综合指数,或利用机器学习方法预测各国就业不足率的短期趋势。此外,该数据常与ILOSTAT的其他指标(如失业率、非正规就业比例)结合,用于构建多维度的劳动力市场健康度评估框架。这些工作进一步拓展了数据在劳动力政策模拟与跨国比较分析中的应用价值。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲37国1991至2025年间按性别划分的时间相关就业不足率,基于ILOSTAT权威劳动统计,为理解欧洲劳动力市场的性别差异与时间利用模式提供了珍贵面板数据。当前研究前沿在于利用此类长时间序列数据进行动态劳动力市场监测,结合机器学习方法预测就业不足率的演变趋势,并评估经济政策与结构性变革(如远程办公普及、非标准就业形式增长)对时间相关就业不足的影响。其意义在于支撑可持续发展目标(SDG)中体面工作目标的量化追踪,促进跨国比较分析,为制定精准的劳动力市场干预措施提供实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务