遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-edu-cbr-nb-persons-outside-the-labour-force-by-sex-education

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲36个国家从1987年至2025年的国际移民存量数据,共有42,719条观测记录,涵盖1个具体指标:按性别、教育水平和出生地划分的非劳动力人口(千人)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家。数据集以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、性别分类、教育分类、出生地分类、年份、观测值等列,支持按性别(总计、男性、女性)等多维度分析。数据经过ILO标准化处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 42,719 observations of International migrant stock data across 36 Europe countries, spanning 1987–2025, covering 1 distinct indicator: Persons outside the labour force by sex, education and place of birth (thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to European countries. It is structured in tabular format with columns such as country code, country name, data source, indicator code, sex classification, education classification, place of birth classification, year, observed value, etc., supporting disaggregation by dimensions like sex (total, male, female). The data is harmonized by ILO and suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-edu-cbr-nb-persons-outside-the-labour-force-by-sex-education 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于欧洲36个国家中按性别、教育程度和出生地划分的劳动力市场外人口(千计)。数据通过ILOSTAT REST API直接获取,并依据ICLS定义对原始调查微观数据进行统一协调处理。原始数据来源包括劳动力调查、家庭收入调查及行政记录等多种渠道,所有数据均在HuggingFace平台上由Electric Sheep Europe重新整合打包,形成易于使用的结构化表格数据集。
特点
数据集包含42,719条观测记录,覆盖1987年至2025年的时间跨度,涉及欧洲36个国家。其核心变量为按性别、教育程度和出生地细分的劳动力市场外人口数量,提供了三个分类维度(性别、教育程度、出生地),其中性别包含总、男、女三个唯一值。此外,数据集还包含关于数据来源、观测状态、方法论变更及非标准教育水平等详细注释,确保了数据的可追溯性与透明度。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数轻松加载该数据集,并转换为Pandas DataFrame进行后续分析。典型使用场景包括筛选特定国家的时间序列数据,绘制单一指标的年度变化趋势图,或通过数据透视表构建国家×年份的矩阵。数据以年为单位发布,当同一国家同年份存在多个数据来源时,ILO会选择最佳来源,保证了数据质量。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年整理发布,经Electric Sheep Europe重新封装后呈现在HuggingFace平台。数据集聚焦于欧洲36个国家1987年至2025年间“按性别、教育程度及出生地划分的劳动力市场外人口(千人)”这一核心指标,总计42,719条观测记录。在劳动经济学与社会政策研究领域,劳动力市场外人群(如失志工作者、家庭照料者、退休人员等)的精准刻画是理解就业结构、社会保障覆盖及劳动力供给弹性的关键。ILO通过整合各国劳动力调查、家庭收入调查及行政记录等多元数据源,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理,为跨国比较分析提供了权威统一的数据基础,填补了欧洲区域长期、细粒度非经济活动人口统计的空白。
当前挑战
该数据集所面临的核心挑战之一在于劳动统计领域的国际可比性难题:各国对劳动力市场外人群的定义、调查周期及教育分类标准存在差异,ILO虽通过标准化方法进行调和,但仍面临因方法论修订(如“source.label”和“note_indicator”字段所记录的断点问题)导致的时间序列不连续与指标可比性下降。此外,数据构建过程中遭遇了多源数据整合与质量标记的挑战,如同一国家年份存在多个来源时需依赖ILO的“最佳来源”选择机制,且部分观测值因数据可靠性低被标注为“Unreliable”(obs_status字段),这增加了模型训练与趋势分析的噪声与不确定性。同时,细颗粒度按出生地分类(如本国出生、外国出生)的人口统计也对数据可用性提出了更高要求。
常用场景
经典使用场景
该数据集作为国际劳工组织ILOSTAT数据库的欧洲子集,汇聚了36个国家1987至2025年间按性别、教育程度和出生地划分的劳动力市场外人口数据,共计42719条观测记录。其经典使用场景涵盖劳动力参与率的多维时空建模,支持研究者运用时间序列分析工具追踪各国非劳动力人口的结构性变迁,或借助面板数据模型剖析性别与教育背景对劳动市场边缘群体的交互影响。此外,数据的高颗粒度分层便于开展区域比较研究,例如对比北欧与南欧国家在特定教育水平下女性退出劳动市场的长期趋势,从而揭示社会政策与人口流动之间的深层关联。
解决学术问题
该数据集有效回应了劳动经济学与社会分层研究中的核心难题,即如何精准量化非劳动力人口在性别、教育与出生地交织维度下的异质性分布。传统宏观统计往往掩盖弱势群体的内部差异,而此数据通过精细分类字段,使学者得以检验教育回报率递减是否对移民群体产生更显著的非劳动力挤出效应,或评估性别不平等在不同福利体制国家中的表现形态。其长时间跨度还助力剖析经济危机、移民政策调整等外生冲击对非劳动力人口构成的动态影响,进而修正既有理论模型中关于劳动市场‘边缘群体’的静态假说。
衍生相关工作
围绕该数据集已衍生出一系列具有里程碑意义的研究工作。在方法层面,学者们基于其面板数据结构发展了多水平模型与序列分析技术,以分离国家制度与个体特征对劳动市场外人口的复合效应。在实质性领域,该数据催生了关于东欧移民性别差异的专题研究,揭示了教育本土化缺失如何加剧外来女性在劳动市场中的边缘化。同时,该数据集被广泛用于验证ILO‘体面劳动’框架下非劳动力统计的标准化测量方案,并推动了与Eurostat微观数据的链接整合,从而构建更完整的欧洲劳动市场空间计量模型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务