遇见数据集

electricsheepasia/asia-ilo-eip-teip-sex-edu-cct-nb-persons-outside-the-labour-force-by-sex-education

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1999年至2024年期间19个亚洲国家按性别、教育水平和公民身份分类的非劳动力人口统计数据(以千为单位),数据来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集涵盖5,150个观测值,包含唯一指标EIP_TEIP_SEX_EDU_CCT_NB,涉及国家代码、年份、观测值、性别分类(总计、男性、女性)、教育水平汇总和公民身份汇总等字段。数据通过ILOSTAT REST API获取,并经过标准化处理,适用于表格分类、回归分析和时间序列预测等机器学习任务。

This dataset contains statistics on the non-labor force population (in thousands) of 19 Asian countries from 1999 to 2024, categorized by gender, educational attainment, and citizenship status. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO). The dataset includes 5,150 observations, with a unique indicator EIP_TEIP_SEX_EDU_CCT_NB, and covers fields such as country code, year, observation value, gender classifications (total, male, female), aggregated education level, and aggregated citizenship status. The data was obtained via the ILOSTAT REST API, standardized, and is suitable for machine learning tasks such as tabular classification, regression analysis, and time series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-teip-sex-edu-cct-nb-persons-outside-the-labour-force-by-sex-education 数据集图片
构建方式
该数据集由Electric Sheep Asia从国际劳工组织(ILO)的ILOSTAT REST API中直接提取,原始数据经由ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一化处理,整合了各国劳动力调查、家庭收入调查及行政记录等多元来源。数据聚焦于亚洲地区,通过筛选ISO 3166-1 alpha-3国家代码,覆盖了19个亚洲国家1999年至2024年间的观测值,共计5,150条记录。数据集中每个观测点均标注了来源标识(source.label),以确保数据可追溯性,并提供了性别、教育水平和公民身份等多维度分类信息。
特点
本数据集的核心特色在于其精细的多维分类结构,涵盖了性别(SEX_T总、SEX_M男、SEX_F女)、教育水平(如EDU_AGGREGATE_TOTAL)和公民身份(如CCT_CIT_TOTAL)等分类变量,使用户能够深入分析劳动力市场以外的特定人群构成。数据指标聚焦于‘按性别、教育和公民身份划分的劳动力市场外人口(千人)’,结合了时间序列属性(1999–2024年),支持年度频率的纵向分析。此外,数据集附带了详尽的数据质量标注,例如观测状态标志(obs_status)可标识数据的可靠性,以及系列中断与方法修订等注释信息。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据集,使用`load_dataset('electricsheepasia/asia-ilo-eip-teip-sex-edu-cct-nb-persons-outside-the-labour-force-by-sex-education')`命令即可访问训练集并将其转换为Pandas DataFrame进行后续操作。典型用法包括按国家代码(如ref_area='IDN')筛选特定国家的子集,或依据指标代码对时间序列数据进行排序和可视化分析。数据集也支持透视表操作,例如将数据重构为国家×年度矩阵,便于进行多维比较和回归分析,适用于分类、回归及时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其核心统计数据库ILOSTAT创建,并由Electric Sheep Asia重新打包发布在HuggingFace平台。数据集聚焦于亚洲19个国家1999至2024年间按性别、教育和公民身份划分的劳动力外人口(以千计),包含5150条观测记录。其核心研究问题在于揭示亚洲地区非经济活动人口的构成特征与演变趋势,为劳动经济学、人口迁移及社会政策研究提供量化基础。该数据集的发布显著提升了ILOSTAT微观数据的可获取性与机器学习适配性,推动区域劳动力市场分析向数据驱动范式转型。
当前挑战
该数据集面临的核心领域挑战在于劳动力外人口的统计口径与跨国内涵一致性。各国对“劳动力外”的定义、教育分类标准及公民身份判定存在差异,直接影响跨国比较的信效度。此外,数据来源多样(如劳动力调查、家庭收支调查),整合时需处理方法论修订(如序列断裂标记)及观测值可靠性标识(如“U”类标记)。构建层面的挑战则包括API数据抽取的过滤逻辑复杂性、分类维度的稀疏性(如性别、教育字段非全量覆盖)以及部分国家数据年份不连续导致的时序分析瓶颈。
常用场景
经典使用场景
在劳动经济学与社会政策研究的交汇领域,该数据集主要被用于分析亚洲地区劳动力市场之外的群体特征。研究者通过整合性别、教育水平与公民身份三个关键维度,可以构建分类或回归模型,深入探究不同人群退出劳动力市场的原因。其时间跨度覆盖1999年至2024年,为纵向比较提供了坚实的数据基础,尤其适合开展跨国的劳动力参与率趋势分析与面板数据回归研究。
实际应用
在实际应用中,该数据集为国际组织、国家统计局及发展机构提供了监测可持续发展目标中体面工作指标的量化工具。政策制定者可以依据不同性别与教育程度的劳动力闲置数据,精准设计职业培训与再就业援助方案。此外,数据分析师可将其用于构建社会脆弱性预警模型,评估经济波动对特定人群(如低教育女性或非公民群体)就业状态的冲击,从而优化社会保障资源配置。
衍生相关工作
该数据集衍生的经典工作多聚焦于劳动力市场边缘群体的比较研究。基于此数据,研究者开发了针对亚洲非正规就业与失业边缘人口的空间计量模型,揭示了东亚与西亚地区性别不平等模式的异同。此外,它催生了结合教育回报率与劳动参与决策的结构方程分析,后续工作还拓展至跨国移民融合指数构建,将公民身份变量纳入劳动力市场绩效的评估框架,形成了系列关于亚洲劳动力韧性的高影响力论文。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务