遇见数据集

electricsheepeurope/europe-ilo-eip-dwap-sex-edu-cct-rt-inactivity-rate-by-sex-education-and-citizenship

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含44,825条观测数据,涉及38个欧洲国家1991年至2025年的国际移民存量相关指标。核心指标为EIP_DWAP_SEX_EDU_CCT_RT,即按性别、教育程度和公民身份划分的不活动率(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API获取,并筛选至欧洲国家范围。数据集提供了多维度的分类变量,包括性别(总计、男性、女性)、教育程度(汇总水平)和公民身份(总计)等,并包含数据来源、观测状态、注释等元数据字段。数据以年度频率发布,经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 44,825 observations of International migrant stock data across 38 European countries, spanning from 1991 to 2025. The primary indicator is EIP_DWAP_SEX_EDU_CCT_RT, which represents the inactivity rate by sex, education and citizenship (%). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and filtered to European ISO3 country codes. It includes multiple disaggregation dimensions such as sex (total, male, female), education (aggregate levels), and citizenship (total), along with metadata fields for source, observation status, and notes. The data is annual frequency, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions, and is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-dwap-sex-edu-cct-rt-inactivity-rate-by-sex-education-and-citizenship 数据集图片
构建方式
在劳动力市场研究中,非活跃率是衡量特定人群脱离劳动参与的关键指标,而该数据集的构建正是为了深入剖析欧洲地区按性别、教育程度及公民身份划分的非活跃率。数据通过调用ILOSTAT REST API获取原始指标,依据国际劳工统计学家会议定义对调查微观数据进行标准化处理,并严格筛选至欧洲38个国家的ISO3代码范围,最终整合为44,825条观测记录。每个观测值均保留了来源标识符,确保数据可追溯性,从而形成了跨1991至2025年时序、兼具多维分类属性(性别、教育层级、公民身份)的标准化面板数据。
特点
该数据集的核心特征在于其精细的多维度分类结构。它通过'sex'、'classif1'和'classif2'三列分别记录性别(包含总、男、女三种分类)、教育水平(如基础教育、高等教育、总和等)以及公民身份状态,使用户能从不同角度剖析非活跃率的构成差异。此外,数据涵盖了广泛的时间跨度与地理范围,年份覆盖三十余年且包含西欧、南欧、北欧及东欧等多类型国家,为跨国家纵向比较提供了基础。同时,每条记录附有观测状态标记和注释字段,揭示了数据质量信息(如修订或不可靠的观测),增强了统计结果的可靠性与透明度。
使用方法
该数据集以HuggingFace Datasets格式打包,可通过load_dataset()函数直接加载为Pandas DataFrame,便于后续分析。用户可利用Python环境,通过筛选'ref_area'列如'DEU'提取单一国家的时间序列数据,亦可聚焦于非活跃率指标并按年排序观察趋势。高级应用支持将数据重塑为国家×年份的交叉表,以进行面板回归或时间序列预测任务。此外,字段中包含的'obs_status'及各类注释列可供用户在预处理时过滤低质量观测值,确保建模输入的数据完整性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Europe在HuggingFace平台上重新封装,聚焦欧洲38个国家在1991至2025年间按性别、教育程度和公民身份划分的劳动力市场非活动率。作为ILOSTAT核心数据库的子集,该数据以国际劳工统计大会(ICLS)定义为标准,通过整合劳动调查、家庭收支调查等多元来源,系统揭示人口结构与劳动参与之间的复杂关联。其发布填补了欧洲区域精细化劳动统计的空白,为劳动经济学、社会不平等研究以及政策评估提供了迄今最详实的时间序列面板数据,有力推动了移民融合与性别平等领域的实证研究。
当前挑战
该数据集面临的核心挑战之一在于跨国家、跨年份的数据可比性难题——各国调查方法、教育分类标准及公民身份定义存在差异,导致观测值中频繁出现方法论修订标记和不可靠数据标注。构建过程中,ILO需统筹来自200多个经济体的异构行政记录和抽样调查原始微观数据,通过数据清洗、最佳来源筛选和缺失值插补实现标准化,但年度频率的限制使得高时效性监测需求难以满足。此外,数据集中多个分类维度(如教育层次、公民身份)的非完整覆盖以及序列中断现象,进一步增加了时间序列分析与跨国比较模型的建模复杂度。
常用场景
经典使用场景
该数据集汇集了来自ILOSTAT的欧洲38个国家1991至2025年间按性别、教育水平和公民身份划分的不活跃率数据,共44,825条观测记录。其最经典的使用场景在于支撑劳动经济学与人口统计学领域的跨国面板数据分析。研究者可以借助这一结构化时间序列数据,纵向追踪各国劳动力市场中不同群体的参与情况,横向比较性别差异、教育程度分层以及公民身份(本国与非本国)对经济活动参与的影响。数据中丰富的分类维度,使得构建多层级回归模型或固定效应面板模型成为可能,从而揭示欧洲区域内不活跃率的动态演变规律及其背后的结构性因素。
衍生相关工作
围绕该数据集衍生出的一系列经典工作横跨计量经济学、迁移研究和教育经济学等交叉领域。许多研究者基于此类ILOSTAT面板数据开展动态随机一般均衡模型的校准,用以模拟移民政策变化对国民劳动参与率的长远冲击。也有工作聚焦于构建预测性机器学习模型,利用历史时间序列及分类特征预测未来各细分人群的不活跃率趋势,为社会保障体系的预算规划提供数据支撑。此外,数据集的标准化格式催生了一批开源分析工具和仪表盘项目,例如将欧盟各国劳动指标可视化的交互式网站或Shiny应用,这些工具进一步降低了非专业人士使用复杂劳动统计数据的门槛,从而扩大了该数据集的学术与社会影响力。
数据集最近研究
最新研究方向
该数据集聚焦欧洲劳动力市场中按性别、教育程度与公民身份分层的不活跃率,为劳动经济学与社会分层研究提供了细粒度的时序面板数据。当前前沿方向之一是利用时间序列预测模型捕捉人口结构变迁与政策干预对就业参与的动态影响,尤其关注移民群体与本土人口在受教育水平分布上的差异如何塑造劳动力退出路径。另一热点是将此数据与移民存量、社会保障支出等外部数据源联动,构建多维度劳动力韧性评估框架,在欧盟绿色与数字双重转型背景下揭示结构性失业风险。该数据集覆盖1991至2025年38国信息,为跨国比较与因果推断奠定了可靠基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务