遇见数据集

electricsheepasia/asia-ilo-eip-3eip-sex-age-stu-nb-youth-outside-the-labour-force-by-sex-age-and-scho

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲36个国家1970年至2025年期间青年非劳动力按性别、年龄和就学状态分类(千)的统计数据,共15,666个观测值,涵盖1个核心指标(EIP_3EIP_SEX_AGE_STU_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,属于劳动力未充分利用的其他衡量指标主题,通过ILOSTAT REST API获取并过滤为亚洲国家,使用国际劳工统计学家会议(ICLS)定义进行标准化。数据集包括国家代码、年份、观测值以及按性别、年龄组和就学状态等维度的分类信息,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 15,666 observations of Youth outside the labour force by sex, age and school attendance status (thousands) data across 36 Asia countries, spanning 1970–2025, covering 1 distinct indicator (EIP_3EIP_SEX_AGE_STU_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database under the topic Other measures of labour underutilization, pulled via the ILOSTAT REST API and filtered to Asia ISO3 country codes, harmonized using ICLS (International Conference of Labour Statisticians) definitions. It includes country codes, years, observed values, and disaggregation dimensions such as sex, age bands, and school attendance status, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-3eip-sex-age-stu-nb-youth-outside-the-labour-force-by-sex-age-and-scho 数据集图片
构建方式
该数据集的构建依托于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接抽取原始指标数据,并依据国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行统一协调处理。在获取全球数据后,进一步依据ISO 3166-1 alpha-3国家代码筛选出36个亚洲国家的观测记录,最终汇聚为包含15,666条观测值的数据集。每一条记录均保留来源标识(source.label)以实现数据溯源,从而确保数据处理的透明性与可复现性。
特点
该数据集聚焦于亚洲地区15至29岁青年群体中未参与劳动力市场的人口统计,按性别、年龄及在校状态进行细致分层,提供了1970年至2025年间跨越近半个世纪的时间序列数据。其显著特点在于丰富的人口学与社会学维度划分,涵盖性别(男女及总体)、青年年龄段以及教育出勤状况等分类变量,使得研究者可以深入剖析不同亚群体在劳动力市场边缘化状态下的差异与演变趋势。同时,数据来源标注清晰,附有观测状态标志与注释信息,便于识别统计口径变化或数据质量瑕疵。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并利用to_pandas()方法将其转换为Pandas DataFrame,以便进行后续分析与可视化。针对特定国家的分析,可通过筛选ref_area列实现区域聚焦;对于时间序列建模,可依据indicator列固定单一指标并按时序排序后绘图。此外,利用pivot_table功能可将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或跨区域比较。数据集的标准化格式与Parquet封装使其能够无缝接入机器学习与统计建模流水线。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门经其ILOSTAT数据库构建,并由Electric Sheep Asia于2025年重新整理发布,聚焦于亚洲36个国家中按性别、年龄及在校状态划分的失学失业青年群体(即劳动力市场以外的青年)的规模测度。数据集涵盖1970至2025年间共计15,666条观测记录,核心研究问题在于量化亚洲区域青年劳动力闲置的分布特征与演变趋势,为劳动力市场分析、政策干预及可持续发展目标(SDGs)的监测提供系统性数据支撑。作为ILOSTAT旗下劳动力利用不足指标的重要组成部分,该数据集对区域劳动经济学、青年就业研究及跨国比较研究具有显著影响力,尤其填补了亚洲发展中国家性别-年龄-教育交叉维度的数据空白。
当前挑战
该数据集所解决的领域问题在于精准刻画青年劳动力市场边缘群体的结构性特征,传统失业率指标难以反映因求学、家庭责任或就业信心缺失而未进入劳动力市场的隐匿性劳动闲置现象。数据构建过程中面临多重挑战:原始调查数据源自36国各异的国家劳动力调查(LFS)及行政记录,需通过ILO的国际劳动统计学家会议(ICLS)标准进行跨时期、跨国的分类口径统一;地理与时间维度的非平衡面板结构(如部分国家仅有1994-2025年间断性记录)要求针对缺失值及序列断点(如方法论修订导致的'Break in series'标记)制定稳健的处理策略;数据质量标记体系(如'provisional'与'unreliable'状态标识)的解读与过滤亦增加了可得性分析的复杂性。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域中,该数据集被广泛用于分析亚洲青年群体脱离劳动力市场的原因与人口学特征。研究人员通常基于性别、年龄组与在校状态三个核心维度,构建面板数据模型,以揭示不同细分群体在时间序列上的变动趋势。经典场景包括利用回归分析评估教育扩张对青年劳动参与率的替代效应,或通过分解方法探究性别差距如何随经济发展阶段演变。该数据集提供的年度观测值(1970–2025年)使长期结构变迁分析成为可能,尤其适合检验人力资本投资与劳动力供给之间的代际权衡假说。
解决学术问题
该数据集关键解决了亚洲区域青年就业研究中长期存在的微观数据碎片化与跨国可比性不足的学术困境。通过纳入36个亚洲国家长达55年的标准化统计指标,研究者得以首次对脱离劳动力市场的青年群体进行系统性跨国比较,进而检验经典劳动供给理论在不同制度环境下的适用性。其核心贡献在于提供了一个控制性别、年龄与教育状态的统一分析框架,使得诸如'失学未就业青年(NEET)'的形成机制、性别不平等对劳动力市场边缘化的放大效应、以及社会保障制度对青年退出行为的缓冲作用等长期悬而未决的问题,能够基于实证证据获得更严谨的解答。这一数据集显著提升了亚洲劳动经济学研究的计量精度与政策可推演性。
衍生相关工作
该数据集衍生出一系列聚焦亚洲青年劳动市场动态的实证研究与方法论创新。典型工作包括利用面板数据构建的'青年劳动退出风险预测模型',通过整合性别、年龄与在校状态特征,识别各国NEET群体的异质性成因。部分研究进一步将其与ILOSTAT的其他指标(如失业率、非正规就业占比)联合分析,揭示了经济发展阶段与青年劳动边缘化之间的非线性关联。在学术产出层面,该数据集支撑了多篇发表于劳动经济学与发展学期刊的跨国比较论文,其中一项经典工作推翻了'教育普及自动降低青年劳动退出率'的简单假设,证明在部分南亚与东南亚国家,女性青年的在校时间延长反而因文化规范而加剧了其劳动力市场的永久性脱离。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务