electricsheepeurope/europe-ilo-emp-2tru-sex-age-nb-time-related-underemployment-by-sex-and-age-ilo-mo
收藏数据链接:
官方服务:
资源简介:
该数据集包含8,019条关于时间相关就业不足的观测数据,涵盖39个欧洲国家,时间跨度为2005年至2027年,包含1个独立指标。数据源自国际劳工组织(ILO)的ILOSTAT统计数据库,为按性别和年龄划分的时间相关就业不足的模型估计值(单位为千),数据经过ILO的统计部门根据国际劳工统计学家会议(ICLS)定义进行统一处理,并通过Electric Sheep Europe重新打包为适合机器学习使用的格式。
This dataset contains 8,019 observations of Time-related underemployment data across 39 Europe countries, spanning 2005–2027, covering 1 distinct indicators. It provides ILO modelled estimates for time-related underemployment by sex and age (in thousands), sourced from the ILOSTAT database, harmonized by the ILOs Department of Statistics based on International Conference of Labour Statisticians (ICLS) definitions, and repackaged by Electric Sheep Europe for machine learning readiness.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API提取指示代码为EMP_2TRU_SEX_AGE_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查的微观数据进行统一协调与标准化处理,形成可跨国家与时间序列对比的建模估计值。数据经Electric Sheep Europe重新封装为Parquet格式,集成了8,019条观测记录、涵盖39个欧洲国家及2005至2027年的时间跨度。
特点
本数据集聚焦于时间相关就业不足这一核心劳动指标,提供按性别(总人口、男性、女性)及年龄层(15岁以上青年与成年人)细分的年度估计值(单位:千人)。数据结构清晰,包含国家代码、来源标识、观测值、状态标记等15个标准化字段,便于分类与回归分析。所有数据均采用ILO选定的最优来源,并辅以观测状态标记(如调整值),确保数据质量与可追溯性。数据集遵循CC-BY-4.0许可协议,适用于学术研究与政策分析。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,调用`load_dataset('electricsheepeurope/europe-ilo-emp-2tru-sex-age-nb-time-related-underemployment-by-sex-and-age-ilo-mo')`即可获取训练集,并转换为Pandas DataFrame进行后续操作。支持按国家代码过滤特定国家的时间序列,或针对单一指示器按时间排序绘制趋势图。亦可利用透视表功能构建以年份为行、国家为列的观测值矩阵,便于进行跨国家比较与面板数据分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年11月发布,并经Electric Sheep Europe团队重新整理后托管于HuggingFace平台,旨在提供欧洲39个国家2005至2027年间按性别与年龄分层的时间相关不充分就业(Time-related underemployment)的ILO模型估计值(单位:千人)。作为ILOSTAT核心数据库的子集,该数据集聚焦于劳动力市场中因工作时间不足而寻求额外工作的群体状况,填补了欧洲地区长期、可比较的劳动力利用不足指标的空白。其创建不仅服务于经济学与劳动社会学研究,更为联合国可持续发展目标(SDG)中“体面工作与经济增长”的量化监测提供了关键数据支撑,尤其适用于跨国面板分析、时间序列建模及政策评估。通过标准化元数据架构与精确的国别-年份-性别-年龄四维结构,该数据显著提升了微观劳动力指标的跨地域可比性,成为欧洲劳动经济学领域的高频引用资源。
当前挑战
该数据集面临的首要挑战在于所解决的领域问题错综复杂:时间相关不充分就业的定义依赖各国劳动调查的具体阈值(如每周工作时长标准),而ILO模型估计虽采用国际劳工统计学家会议(ICLS)框架进行调和,但跨国异质性仍可能导致估计偏差,影响面板数据的统计推断效力。构建过程中的挑战则集中于数据质量与完整性:ILOSTAT原始数据整合了多种来源(如劳动力调查、行政记录等),不同来源的观测值状态标记(如“调整值”“临时值”)需审慎处理;同时,数据集仅收录年度频率数据,而部分国家发布月度或季度序列,这导致了时间粒度的信息损失。此外,缺失值处理策略、多源数据中“最佳来源”的选取逻辑以及按性别和年龄划分的细分维度在部分年份覆盖不全,均对模型的训练与预测准确性构成潜在威胁。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集的核心价值在于为时间相关非充分就业的跨国动态分析提供了标准化、可复现的数据基础。研究者可借助其包含的39个欧洲国家自2005年至2027年的年度观测值,按性别与年龄维度精细剖析不充分就业的演变轨迹。典型的分析框架包括利用面板数据模型识别个体特征与宏观因素对非充分就业的影响,或通过时间序列方法预测短期波动。数据集的规范化结构使得从描述性统计到因果推断的转换流畅自然,尤其适合探究周期性经济波动与结构性劳动力错配之间的交互作用。
实际应用
在政策制定与劳动力市场治理实践中,该数据集为欧盟及各成员国的就业监测与干预策略提供了关键决策支撑。劳动部门可依据性别与年龄分层的非充分就业率,识别出易受劳动力市场边缘化的脆弱群体,从而设计更具靶向性的职业培训与工时调整政策。例如,当数据揭示女性或青年群体非充分就业率持续攀升时,政府可定向推出灵活工时补贴或跨行业再就业计划。此外,长期时间序列的可用性使得政策效果的循证评估成为可能,为动态调整最低工时保障与社会福利挂钩机制提供了量化依据。
衍生相关工作
该数据集的发布催生了一系列以欧洲劳动力市场异质性为核心的计量经济学与机器学习研究。典型衍生工作包括构建多国家面板回归模型,将非充分就业与数字技术渗透率、移民流入规模及行业管制强度建立因果关系;另有一些研究采用无监督聚类算法,依据非充分就业的性别-年龄剖面图对欧洲国家进行劳动力市场制度分类。深度学习方法亦被引入以改进短期预测精度,利用长短期记忆网络捕捉时间序列中的非线性依赖。这些工作不仅验证了数据集的跨学科适用性,更推动了劳动经济学分析方法从静态比较向动态系统建模的演进。
以上内容由遇见数据集搜集并总结生成



