遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-geo-dsb-nb-persons-outside-the-labour-force-by-sex-rural-urba

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含14,891个观测值,涵盖30个欧洲国家,时间跨度为2002年至2025年,聚焦于其他劳动力利用不足指标。具体指标为EIP_TEIP_SEX_GEO_DSB_NB,即按性别、城乡地区和残疾状况划分的非劳动力人口(千人)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过重新包装以适用于机器学习。数据集包含国家代码、指标代码、性别分类(总计、男性、女性)、时间(年份)、观测值(单位因指标而异)等字段,并提供了数据来源、质量标志和分类说明。数据按年度频率提供,仅包含欧洲国家数据,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 14,891 observations of Other measures of labour underutilization data across 30 Europe countries, spanning 2002–2025, covering 1 distinct indicator: EIP_TEIP_SEX_GEO_DSB_NB — Persons outside the labour force by sex, rural / urban areas and disability status (thousands). The data is sourced from ILOSTAT (ILOs central statistics database), repackaged for machine learning readiness. It includes fields such as country codes, indicator codes, sex disaggregation (total, male, female), time (year), observed values (unit varies by indicator), along with source information, quality flags, and classification notes. The data is annual frequency, limited to European countries, and suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-geo-dsb-nb-persons-outside-the-labour-force-by-sex-rural-urba 数据集图片
构建方式
在劳动力市场分析领域,精确度量劳动人口闲置状况对于制定社会政策至关重要。本数据集源于国际劳工组织(ILO)下属ILOSTAT数据库的核心指标EIP_TEIP_SEX_GEO_DSB_NB,专指按性别、城乡区域及残疾状态划分的劳动力市场外人口数量(单位:千人)。数据经由Electric Sheep Europe团队通过ILOSTAT官方REST API直接获取,并依据国际劳工统计学家会议(ICLS)定义规范对原始调查微观数据进行统一化处理。在构建过程中,数据集严格筛选了欧洲30个国家的ISO3编码地理范围,确保每一观测值均附有明确的来源标识(source.label字段),以保障数据溯源的可信度与透明度。最终形成了涵盖2002至2025年间总计14,891条观测记录的规范化Tabular数据集。
特点
本数据集的核心价值在于其精细的多维分类架构与权威性来源。其独特之处体现在丰富的分类维度上,包括性别(男性、女性及总计)、地理覆盖范围(国家层面)以及残疾状态总体概览,允许研究者从交叉视角深度剖析劳动力市场边缘群体的结构性特征。数据集合了ILO作为全球劳动力统计最高权威机构的严谨方法,所有指标均遵循统一、可比的国际定义,且通过'最佳来源'策略处理多源冲突,确保了跨国家、跨年份数据的纵向可比性。此外,数据集以Parquet格式打包,具备机器学习的直接可用性,并提供了观测状态标签(如不可靠性标记)与详尽注释(如方法论修订、非标准定义等),为数据质量评估与异常值处理提供了透明依据。
使用方法
本数据集的用户可通过HuggingFace Datasets库无缝集成至现代数据科学生态系统。调用load_dataset函数即可一键加载完整的Parquet格式数据,并直接转换至Pandas DataFrame进行交互式探索。典型的使用流程包括:利用'ref_area'字段进行单一国家筛选以构建国别时间序列,或依据'indicator'代码精准定位特定指标后,通过'obs_value'字段进行时间轴上的趋势可视化分析。高级应用场景可借助pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行横向比较或作为机器学习模型的输入特征。所有操作无需繁琐的手动下载与数据清洗,极大降低了在劳动力经济学、社会政策评估和跨国比较研究中的技术门槛。
背景与挑战
背景概述
劳动力市场的边缘群体研究是劳动经济学与社会政策领域的关键议题,尤其是处于劳动力之外的群体,其规模与构成直接影响就业政策的制定与社会保障体系的设计。由国际劳工组织(ILO)于2002年至2025年间收集并发布的欧洲劳动力外部人口数据集,由Electric Sheep Europe在2025年重新整理并托管于HuggingFace平台。该数据集聚焦于欧洲30个国家、涵盖超过1.4万条观测,核心指标为按性别、城乡区域及残疾状况划分的劳动力外部人口数量(以千计),旨在揭示不同社会群体在经济活动参与中的系统性差异。作为ILOSTAT数据库的子集,它继承了ILO在劳动统计领域的高度权威性,为研究劳动力市场排斥、社会不平等以及政策干预效果提供了基础量化素材,对欧洲区域的社会政策制定与学术研究具有显著推动作用。
当前挑战
该数据集当前面临的核心挑战源自其研究主题的复杂性:首先,劳动力外部群体的定义与测量本身须严格遵循ILO的国际劳动统计学家会议(ICLS)标准,但由于各国调查方法、残疾认定标准及城乡分类存在差异,跨国比较时易产生口径不一致问题,进而影响分析结论的稳健性。其次,数据集构建过程中存在多重数据质量挑战,如部分观测被标记为不可靠(obs_status为U),且存在因方法修订导致的序列中断(note_indicator标注为Break in series),需要用户在时间序列分析中审慎处理。此外,数据以年为单位发布,缺少月度或季度高频观测,难以捕捉季节性波动与短期政策冲击的影响。最后,多源数据聚合时ILO采用的‘最佳来源’选择策略虽有助于统一质量,但可能掩盖不同来源间的系统性偏差,增加了后续建模与推断的难度。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域中,该数据集主要用于量化分析欧洲劳动力市场边缘群体的结构性特征。研究场景聚焦于那些因性别、残障状况及城乡居住地差异而被排除在劳动力大军之外的人群规模及其动态变化。研究者可借助该数据,运用时间序列回归或面板数据模型,揭示2002至2025年间30个欧洲国家内,不同性别与残障状态的个体在城乡分布上的非参与率差异。尤为重要的是,该数据集中附带的分类变量(如地区覆盖类型与残障状态细分)使得多层次分解分析成为可能,从而为理解劳动力市场排斥的多维性提供严谨的实证基础。
解决学术问题
该数据集精准回应了劳动经济学中长期存在的核心学术难题,即如何跨越国别与时间维度,系统测度非经济活跃人群的异质性及其影响因素。传统研究常受限于数据颗粒度不足,无法同时考量性别、地域与残障状况的交互效应。此数据集通过国际劳工组织(ILO)标准化的指标定义,解决了跨国比较中统计口径不一的关键问题。其学术意义在于,不仅支持对劳动参与率下降背后的结构性成因进行深入剖析,还为验证关于劳动力市场歧视、社会保障覆盖缺口以及城乡发展不均衡等理论假说提供了可重复验证的数据支撑。这项研究对于推动包容性就业政策的制定具有不可替代的学术价值。
衍生相关工作
依托此数据集的标准化架构和跨年度跨国家的丰沛观测,学界与业界已衍生出一系列具有影响力的经典研究工作。在模型构建方面,多个研究团队基于该数据开发出了针对劳动力非参与率的动态面板预测模型,并将其作为基准用于检验不同国家社会保障体系调整的模拟效果。在方法创新上,研究者通过整合本数据集中的性别与残障分类维度,提出了全新的劳动市场边缘化指数,从而更精细地捕捉了脆弱群体的就业排斥状况。此外,该数据集的发布催生了一批比较社会学研究,这些工作聚焦于探讨欧洲各国在应对人口老龄化与劳动力缩减时,如何通过对残障人士的包容性政策缩小城乡就业差距,相关结论已被多份国家级劳动力市场评估报告所引用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务