遇见数据集

electricsheepasia/asia-ilo-eip-3dis-sex-age-geo-nb-youth-discouraged-job-seekers-by-sex-age-and-rural

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲27个国家从2000年至2025年的青年沮丧求职者数据,共6266个观测值,聚焦于劳动利用不足的其他衡量指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤为亚洲国家。数据集以表格形式组织,包含国家代码、年份、性别(总计、男性、女性)、年龄分组(如15-29岁)、城乡地区类型等分类维度,以及观测值和数据质量标志。指标为“青年因性别、年龄和城乡地区划分的沮丧求职者(千人)”,用于分析亚洲青年就业市场中的沮丧求职现象。数据经过ILO标准化处理,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 6,266 observations of youth discouraged job-seekers across 27 Asia countries from 2000 to 2025, focusing on other measures of labour underutilization. Sourced from the International Labour Organization (ILO) ILOSTAT database, it is extracted via API and filtered to Asian countries. The data is organized in tabular format, including dimensions such as country code, year, sex (total, male, female), age groups (e.g., 15-29), rural/urban area types, observed values, and data quality flags. The indicator is Youth discouraged job-seekers by sex, age and rural / urban areas (thousands), aimed at analyzing discouraged job-seeking among youth in Asian labor markets. Data is harmonized by ILO standards and suitable for machine learning tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-3dis-sex-age-geo-nb-youth-discouraged-job-seekers-by-sex-age-and-rural 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接获取指标代码为EIP_3DIS_SEX_AGE_GEO_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、住户收支调查等微观数据进行标准化处理,确保指标口径一致。数据经Electric Sheep Asia团队重新封装为Parquet格式,保留source.label字段以标注数据来源,实现全流程可追溯,最终构建成为一个覆盖27个亚洲国家、跨度2000年至2025年的结构化表格数据集,共包含6,266条观测记录。
特点
本数据集聚焦于亚洲地区青年失意求职者群体,按性别、年龄组及城乡地域划分观测值,并细分为男性、女性及总计三个维度,提供同一指标下多维度的细腻数据。数据来源广泛,涵盖各国劳动力调查及行政记录,经ILO统一整合后具有跨国可比性。数据集还附带了数据质量标识(如obs_status标识数据可靠性)、来源说明及系列中断等注释信息,便于研究人员评估数据的适用性与局限性。此外,数据按年度频率发布,能够有效支持时间序列分析和区域比较研究。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并利用to_pandas方法将其转换为Pandas DataFrame格式,便于后续分析。针对特定国家的研究,可通过ref_area字段进行筛选,例如筛选印度尼西亚的数据。对于时间序列分析,可按指标代码过滤数据后按时间排序,绘制obs_value随时间变化的曲线。同时,支持将数据透视转换为以时间为行、国家为列的矩阵形式,以观察区域间的横向对比。数据加载与处理流程简洁高效,极大降低了劳动统计数据的获取与使用门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT构建,并由Electric Sheep Asia于2025年重新封装发布,聚焦于亚太地区青年丧失信心的求职者分布状况,涵盖2000年至2025年间27个亚洲国家的6,266条观测记录。数据集旨在填补劳动市场弱势群体量化分析的关键空白,特别是那些因长期求职失败而退出劳动力市场的青年人群。依托ILO对各国劳动力调查数据的协调与标准化处理,该数据集为研究亚洲青年劳动参与率、性别与城乡差异以及劳动力市场结构性失衡提供了精细化的时间序列基础,对劳动经济学、社会政策评估及可持续发展目标(SDG)中体面劳动指标的监测具有重要推动作用。
当前挑战
该数据集面临的核心挑战包括:其一,在领域问题层面,青年丧失信心的求职者作为隐性失业的重要维度,其测量本身依赖个体主观判断与问卷设计差异,不同国家或地区的定义偏差导致跨区域可比性受限;其二,在构建过程中,数据源自各国劳动力调查与行政记录,调查频率、方法论修订(如断点标记`Break in series`)及数据质量标注(如`Unreliable`状态)增加了时间序列分析的噪声,需谨慎处理来源变更与估算方法演进带来的结构性断层;其三,性别与城乡交叉分类的稀疏性使得亚组统计推断面临小样本问题,部分国家或年份的细分数据缺失限制了多维不平等分析的深度。
常用场景
经典使用场景
在劳动经济学与发展研究领域,该数据集为探索亚洲青年劳动力市场边缘群体提供了关键量化支撑。其最经典的应用场景是运用分类或回归模型,解析不同性别、年龄层及城乡背景下的青年沮丧求职者规模及其演变规律。研究者可借此构建面板数据模型,剖析各国劳动力市场结构性失衡的深层成因,或通过时间序列预测方法,揭示经济波动对青年就业信心的冲击轨迹。数据集中丰富的分类维度——如性别、年龄组与地理区域——使得多层次差异分析成为可能,为揭示弱势青年群体在就业市场中的脆弱性提供了不可多得的实证基础。
衍生相关工作
基于该数据集及其同源的ILOSTAT系列数据,学术界已然衍生出若干富有影响力的经典工作。其一,围绕劳动市场外延性失业指标的跨国比较研究,利用此类数据构建了包含沮丧求职者在内的复合劳动力利用不足指数,重新评估了传统失业率对真实就业压力的遮蔽程度。其二,部分学者借助分层时间序列模型,将青年沮丧求职者数据与宏观经济增长、青年人口比例及教育扩招等变量耦合,推动了针对‘失落一代’或‘NEET群体’(非就业、非教育、非培训)成因的定量研究。此外,该数据集为机器学习领域探索不平衡回归与区间预测提供了一流的亚洲区域基准,催生了面向稀疏面板数据的稳健建模方法,其范式已被后续其他地区类似数据库的建设所借鉴。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区青年失志求职者的性别、年龄及城乡分布特征,为劳动力市场边缘群体研究提供了精细化的时空面板数据。在当前全球青年失业率攀升与后疫情时代就业结构重塑的背景下,该数据集可支持基于性别差异的劳动力参与率下降机制分析、城乡青年就业意愿的异质性建模,以及ILO劳动力利用不足指标(LU1–LU4)的跨国比较研究。其长达25年覆盖27国的观测序列,有助于揭示亚洲新兴经济体在产业转型与人口红利消退过程中青年就业信心的演变轨迹,为可持续生计政策与包容性劳动力市场设计提供实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务