遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-age-cct-nb-persons-outside-the-labour-force-by-sex-age-and-ci

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家1991年至2025年期间按性别、年龄和公民身份划分的非劳动力人口统计数据(单位:千),共81,607个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖单一指标EIP_TEIP_SEX_AGE_CCT_NB,涉及国家代码、数据来源、性别分类(总计、男性、女性)、年龄组(15岁以上)、公民身份(总计)、年份、观测值和数据状态等字段。数据集经过Electric Sheep Europe重新打包,采用CC-BY-4.0许可,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 81,607 observations of international migrant stock data for 39 Europe countries from 1991 to 2025, focusing on the indicator Persons outside the labour force by sex, age and citizenship (thousands) (EIP_TEIP_SEX_AGE_CCT_NB). Sourced from the ILOSTAT database of the International Labour Organization (ILO), it includes fields such as country codes, data sources, sex disaggregation (total, male, female), age groups (15+), citizenship (total), year, observed values, and data status flags. Repackaged by Electric Sheep Europe under CC-BY-4.0 license, it is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-age-cct-nb-persons-outside-the-labour-force-by-sex-age-and-ci 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接调取指标'EIP_TEIP_SEX_AGE_CCT_NB'的原始数据,并依据ILO对劳动力统计的国际标准进行统一清理与规范化。经Electric Sheep Europe团队重新封装后,数据集聚焦于39个欧洲国家,时间跨度覆盖1991年至2025年,共计81,607条观测记录。构建过程中,ILO对各国劳动力调查、家庭收入调查等多元来源的微观数据进行了整合与协调,确保指标定义与分类体系的一致性,同时保留了原始数据源的溯源信息以便核查。
特点
本数据集的核心特点在于其精细的维度划分与高覆盖性。数据按性别(男性、女性、总计)、年龄组(如青年与成年人)及公民身份(总公民)进行细致拆解,为研究劳动力市场外人口结构提供了多层级透视。观测值涵盖39个欧洲国家,时间序列长达35年,且每条记录均附带观测状态标记(如可靠性标识)与系列中断注释,便于用户识别数据质量与潜在偏差。此外,数据集以Parquet格式存储,兼有列式存储的高效性与HuggingFace Datasets生态的即用性。
使用方法
通过HuggingFace Datasets库,用户可一行代码加载数据:load_dataset('electricsheepeurope/europe-ilo-eip-teip-sex-age-cct-nb-persons-outside-the-labour-force-by-sex-age-and-ci'),并直接转为pandas DataFrame进行后续分析。典型操作包括:按'ref_area'字段筛选特定国家的子集;对'obs_value'按时间排序以绘制单一指标的时间序列图;或利用pivot_table构建国家×年份的数值矩阵,便于面板数据分析。数据集中所有分类变量(如sex、classif1)均已标准化编码,结合详细的模式说明,可无缝接入机器学习流程或统计建模任务。
背景与挑战
背景概述
劳动力市场中的非经济活动人口,即那些既未就业也未失业的群体,是理解社会经济结构不可或缺的维度,其规模与构成深刻反映着国家福利制度、移民政策及人口结构变迁。在此背景下,国际劳工组织(ILO)统计司依托其核心数据库ILOSTAT,构建了名为“europe-ilo-eip-teip-sex-age-cct-nb-persons-outside-the-labour-force-by-sex-age-and-ci”的数据集,由Electric Sheep Europe于2025年重新打包发布。该数据集聚焦欧洲39个国家,涵盖了1991年至2025年间超过81,600条关于按性别、年龄和公民身份划分的非劳动力人口(以千人为单位)观测值。其核心研究问题在于揭示劳动参与的结构性差异,特别是移民身份对经济活动状态的影响,为跨国比较与时间序列分析提供了标准化、可复用的基础数据,对劳工经济学、人口社会学及公共政策研究具有显著的支撑价值。
当前挑战
该数据集所应对的领域挑战主要在于劳动力市场分析的精细化需求:传统宏观就业率往往掩盖了不同性别、年龄及公民身份群体间的参与差异,而该数据通过多维分类(性别、年龄、公民身份)的交叉统计,使得研究者能够深入剖析非经济活动人口的内在异质性,例如移民与非移民群体的劳动参与差异,以及老龄化对劳动力供给的真实影响。在构建过程中,核心挑战源于国际劳工组织(ILO)数据的异构性与标准化难题:原始数据源自各国劳动力调查、行政记录等多种渠道,其定义、采集周期和统计口径不一,ILO虽依据国际劳工统计学家会议(ICLS)标准进行协调,但跨国的隐含偏差与数据质量的差异(如观测状态标记为“不可靠”或存在“序列断裂”)依然存在。此外,数据集在时间维度上需处理年度频率与部分国家缺失年份的间隙,并在空间维度上整合39个欧洲国家的ISO代码与分类标签,这对数据清洗、缺失值处理与元数据附注(如方法论修订导致的断点注释)提出了严苛的管理要求。
常用场景
经典使用场景
该数据集汇集了1991年至2025年间39个欧洲国家劳动力市场以外人口的性别、年龄及公民身份细分数据,共计81,607条观测记录。经典使用场景聚焦于劳动经济学中的非经济活动人口分析,研究者可借助这一高维度面板数据,定量刻画不同性别与年龄群体退出劳动力市场的结构性差异,尤其适合构建多层级分类模型或时间序列回归,以探究公民身份对劳动参与率的调节效应。
实际应用
在实际应用层面,该数据集为欧洲各国劳动部门与跨国组织提供了政策评估的量化支撑。基于性别与年龄维度的动态监测,可用于识别长期失业人群、隐性失业群体及因家庭照料退出劳动力市场的女性人口,进而优化社会保障资源分配。国际劳工组织及欧盟统计机构借助此类数据,能够更精准地设计积极劳动力市场计划,并评估移民就业融合政策的阶段性成效。
衍生相关工作
围绕该数据集衍生了一系列具有影响力的学术探索。基于ILOSTAT框架的时空模型被广泛用于构建欧洲非经济活动人口的预测性基准,如劳动参与率动态面板分析及贝叶斯分层时序模型。此外,数据标准化流程催生了跨数据集联合分析工具,研究者将其与各国微观调查数据融合,拓展出关于移民职业流动性与代际劳动力接续的队列研究,进一步丰富了劳动生态学领域的方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务