遇见数据集

electricsheepeurope/europe-ilo-emp-2tru-sex-age-rt-time-related-underemployment-rate-by-sex-and-age-i

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含由国际劳工组织(ILO)建模估计的欧洲39个国家按性别和年龄划分的时间相关就业不足率统计数据。数据集涵盖2005年至2027年的年度观测数据,共计8,019条观测记录,核心指标为EMP_2TRU_SEX_AGE_RT(时间相关就业不足率,按性别和年龄划分)。数据通过ILOSTAT REST API获取,并经过标准化处理,使用国际劳工统计学家会议(ICLS)定义进行协调。数据集包含国家代码、国家名称、数据来源、指标代码、指标名称、性别分类(总计、男性、女性)、年龄分类、观测年份、观测值及数据状态等字段。数据来源于ILO的权威统计数据库,涵盖劳动力调查、家庭收入调查等多种数据源,由Electric Sheep Europe重新打包为机器学习就绪格式发布。

This dataset contains time-related underemployment rate statistics modeled and estimated by the International Labour Organization (ILO) for 39 European countries, disaggregated by sex and age. It includes annual observations from 2005 to 2027, totaling 8,019 data points, with the core indicator being EMP_2TRU_SEX_AGE_RT (time-related underemployment rate by sex and age). Data is sourced via the ILOSTAT REST API, harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes fields such as country codes, country names, data sources, indicator codes, indicator names, sex disaggregation (total, male, female), age classification, observation year, observed values, and data status flags. The data originates from ILOs authoritative statistical database, incorporating sources like labor force surveys and household income surveys, and is repackaged by Electric Sheep Europe in a machine-learning-ready format.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-2tru-sex-age-rt-time-related-underemployment-rate-by-sex-and-age-i 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接抽取原始指标数据,并基于欧洲39个国家的ISO3代码进行地理过滤。数据涵盖了2005年至2027年的年度观测值,ILO依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查微观数据进行统一协调与标准化处理,确保跨国可比性。最终由Electric Sheep Europe团队完成数据重构、模式归一化并封装为Parquet格式,以支持高效加载与后续分析。
特点
数据集包含8,019条观测记录,覆盖39个欧洲国家,横跨2005至2027年的长时间跨度,聚焦于与时间相关的就业不足率这一核心指标。数据按性别(男性、女性、总计)和年龄维度进行细分,提供了丰富的分层分析可能性。每条记录均附有详细的数据来源标注和观测状态标识(如实际值、临时值),增强了数据的可追溯性与质量透明度,适合开展跨国比较与时序分析。
使用方法
用户可通过HuggingFace的`datasets`库直接调用`load_dataset()`加载数据,并转换为Pandas DataFrame进行后续处理。典型应用包括按国家筛选特定子集、按时间序列绘制单个指标的变动趋势,或通过透视表构造国家×年份的矩阵,以支持面板数据分析。该方法简化了从数据获取到建模的流程,便于快速集成至机器学习、回归分析或时间序列预测任务中。
背景与挑战
背景概述
在国际劳工组织(ILO)的统计体系中,时间相关不充分就业率是衡量劳动力市场资源错配与劳动时间利用效率的关键指标,尤其在欧洲多元化的经济结构中具有重要政策意义。该数据集由ILO统计司于2025年11月发布,经Electric Sheep Europe团队重新封装,涵盖了39个欧洲国家2005年至2027年的8,019条观测记录,聚焦于按性别与年龄分层的就业不足率。其核心研究问题在于通过标准化建模估算,揭示欧洲不同人口亚群在劳动时间利用上的结构性差异,为评估区域就业质量、设计针对性劳动力政策及追踪可持续发展目标中的体面劳动进展提供了高可比性的时序基准,成为劳动经济学与公共政策研究领域的重要数据资产。
当前挑战
该数据集所应对的领域挑战在于,时间相关不充分就业率作为劳动力利用不足的隐性指标,其跨国可比性常受制于各国调查方法、定义标准与时间口径的差异,ILO需通过复杂的建模估算实现数据的统一归约。在构建过程中,挑战体现为多源异构调查数据的清洗与协调,包括从各国劳动力调查、行政记录中提取原始微数据,依据国际劳工统计学家会议定义进行映射,并处理性别与年龄维度上因小样本导致的统计噪点;同时,估算模型需平衡时间序列的平滑性与突发经济事件(如疫情)所致的结构性断点,而2005至2027年的长期跨度又对数据插补与预测精度提出了严苛要求,最终依赖ILO专家对其来源标志的逐条追溯机制来保障透明度与可复现性。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,时序不足就业率是衡量劳动力市场闲置产能的关键指标。该数据集提供了2005至2027年间39个欧洲国家的性别与年龄分层的时序不足就业率数据,覆盖8,019条观测记录。研究者可借助ILO标准化模型估算值,进行跨国面板数据分析,如利用固定效应或随机效应模型探析不同性别与年龄群体在劳动力市场中的结构性差异,或结合经济周期变量评估经济波动对弱势就业群体的异质性冲击。该数据的时序跨度长达二十余年,尤其适合开展时间序列预测研究,如采用ARIMA或Prophet模型对短期就业趋势进行推断,为政策制定者提供前瞻性参考。
实际应用
在实际应用层面,该数据集是欧洲各国劳工部门、国际组织及社会智库进行就业政策评估与人力资源规划的重要依据。例如,国家就业服务机构可依据分性别与年龄的时序不足就业率,识别出就业质量持续低迷的高风险群体,从而设计精准的职业培训与再就业援助方案。欧盟委员会亦可利用该数据进行区域劳动力市场监测,评估不同成员国在实现体面劳动与可持续发展目标上的进展程度。此外,金融机构与信用评级机构可将时序不足就业率纳入劳动力市场的压力测试模型,作为判断经济体消费潜力与社会稳定性的参考指标。
衍生相关工作
围绕该数据集已拓展出一系列高质量的应用与研究范式。首先,数据仓库的设计遵循Electric Sheep Europe所倡导的ML-Ready框架,通过Parquet格式与标准化Schema封装,极大降低了机器学习模型开发的接入成本。研究者以此为基础构建了若干预测基准,如利用XGBoost对时序不足就业率进行多步滚动预测,或将性别与年龄作为类别特征嵌入深度学习时序模型。同时,ILOSTAT建模方法的中文与多语言解读工作也随之涌现,部分团队还将其与Eurostat的劳动力调查数据进行融合,形成了一个包含多边统计口径的欧洲就业质量联合数据集,助力了跨数据库的迁移学习实验与稳健性检验。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务