遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-edu-cct-nb-persons-outside-the-labour-force-by-sex-education

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲38个国家的44,825条“国际移民存量”观测数据,时间跨度为1991年至2025年,涵盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤至欧洲国家。数据集包括按性别、教育和公民身份分类的非劳动力人口数据(以千计),并提供了详细的元数据,如国家代码、数据来源、指标定义、观测值、状态标志和分类维度。数据经过ILO的标准化处理,使用ICLS定义,并标注了来源以便追溯。数据集适用于表格分类、回归和时间序列预测等任务,可用于分析和建模欧洲劳动力市场中的移民相关趋势。

This dataset contains 44,825 observations of International migrant stock data across 38 European countries, spanning from 1991 to 2025, and covering 1 distinct indicator. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to European country codes. It includes data on persons outside the labour force disaggregated by sex, education, and citizenship (in thousands), with detailed metadata such as country codes, data sources, indicator definitions, observed values, status flags, and classification dimensions. The data is harmonized by ILO using ICLS definitions and includes source annotations for traceability. It is suitable for tasks like tabular classification, regression, and time-series forecasting, enabling analysis and modeling of migration-related trends in European labour markets.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-edu-cct-nb-persons-outside-the-labour-force-by-sex-education 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接获取原始指标数据,并依据欧洲ISO3国家代码进行地理范围筛选。ILOSTAT以国际劳工统计学家会议(ICLS)定义为准绳,对各国劳动力调查、家庭收入调查、机构调查及行政记录等原始微观数据进行统一标准化处理,确保跨国家与跨时间序列的可比性。数据集由Electric Sheep Europe团队重新封装,转化为机器学习友好的Parquet格式,并通过HuggingFace Datasets库提供一键式加载接口,极大降低了研究者的数据获取门槛。
特点
数据集包含44,825条观测记录,覆盖1991年至2025年间38个欧洲国家,聚焦于'按性别、教育程度和公民身份划分的劳动力市场外人口(千人)'这一核心指标。数据维度丰富,除基本的国家与时间标识外,还提供性别、教育程度、公民身份等多重分类细化变量,并附有数据来源、观测状态及方法论注释等元信息,便于用户追溯数据质量与潜在断点。其时间跨度长、覆盖国家广且分类粒度细腻,为分析欧洲劳动力市场边缘人群的结构性演变提供了坚实的数据基础。
使用方法
用户可通过HuggingFace Datasets库中的`load_dataset`函数直接加载数据集,并便捷地转换为Pandas DataFrame进行后续分析。典型用法包括按国家代码筛选特定国家的子集、针对单一指标绘制时间序列趋势图,以及利用数据透视表构建以年份为索引、国家为列、观测值为填充内容的矩阵,便于进行跨国的对比研究与面板数据分析。数据集中所有字段均已标准化命名与类型定义,研究者可立即应用于分类、回归或时间序列预测等机器学习任务。
背景与挑战
背景概述
由国际劳工组织(ILO)统计部门创建并维护的ILOSTAT数据库,是全球劳动力统计领域的权威数据源,该数据集于2025年由Electric Sheep Europe重新封装并发布在HuggingFace上。该数据集聚焦于欧洲地区1991年至2025年间,按性别、教育程度和公民身份划分的劳动力外人口(以千计),覆盖38个欧洲国家,包含44,825条观测记录。作为一个基于国家劳动力调查、住户收入调查及行政记录等多元来源整合而成的高质量表格数据,该数据集为劳动经济学、人口迁移研究以及社会政策评估提供了关键基础,尤其适用于时间序列分析、分类与回归等机器学习任务,对理解欧洲劳动力市场结构变迁及移民融入状况具有重要学术与应用价值。
当前挑战
该数据集所解决的领域问题在于,劳动力外人口(即未参与就业或失业搜索的人群)的规模与构成是评估劳动力市场健康度、设计社会保障政策的基石,但传统统计口径常忽视按教育、国籍等维度的细分,导致政策分析缺乏颗粒度。构建过程中面临的核心挑战包括:1)多源数据整合难度高——来自38个国家、不同年份的调查与行政记录需按国际劳工统计学家会议(ICLS)定义进行标准化与脱敏处理;2)数据质量标记复杂——设有专门字段标注观测状态(如临时性、不可靠性)及方法论断裂点,确保研究者能审慎使用;3)时间跨度长且分类维度多——要求跨30余年历史数据中保持分类体系一致,并处理教育水平分类的非标准编码(如含盖‘非标准教育水平’的注释),增加了数据清洗与分析的复杂性。
常用场景
经典使用场景
该数据集的核心经典应用在于劳动力市场结构性分析与跨国比较研究。基于ILOSTAT标准化框架,它提供了欧洲38个国家自1991年至2025年间,按性别、教育程度与公民身份细分的非劳动力人口规模(以千人为单位)。研究者可借此构建面板数据模型,系统剖析欧洲各国非经济活动人口的人口学特征,探究教育水平如何调节性别与公民身份对劳动力退出行为的影响,为理解欧洲劳动力市场的长期演变轨迹提供坚实的数据基石。
解决学术问题
该数据集有效回应了若干关键学术问题。首先,它解决了跨国可比性难题,通过统一指标定义和来源筛选,使研究者能够跨越国界分析非劳动力人群的结构性差异,克服了各国统计口径不一致的顽疾。其次,它赋能了对教育与劳动力参与关系、公民身份效应以及性别差异的动态研究,为探讨人口老龄化、移民融入、社会排斥等宏观议题提供了详实的实证依据。其深远意义在于深化了对欧洲劳动力市场韧性与脆弱性的科学认知,推动了劳动经济学与社会政策研究向更精细化、多维度的方向发展。
衍生相关工作
围绕该数据集已涌现一系列经典衍生工作。研究人员常将其与ILOSTAT中的其他指标,如失业率、就业率及工资数据进行联合分析,构建综合的劳动市场健康评价模型。另有工作利用该时间序列数据训练长短期记忆网络(LSTM)或Transformer模型,用于预测未来数年各国非劳动力趋势,为前瞻性政策模拟提供支持。此外,基于其多维度分类特征,该数据集也常被用作检验公平性学习算法(如反事实公平分析)的基准,考察模型在不同性别与教育群体间的预测偏差,推动了负责任AI在社会科学领域的应用发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务