遇见数据集

electricsheepasia/asia-ilo-pop-3ted-sex-eco-nb-youth-transited-by-sex-and-economic-activity-thous

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲17个国家从1999年至2025年的3332个观测值,核心指标为按性别和经济活动划分的青年过渡数据(千人数)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Asia重新打包为机器学习就绪格式。数据集涵盖了青年从学校到工作过渡的统计信息,按性别(总计、男性、女性)和经济活动部门进行细分,适用于表格分类、回归分析和时间序列预测等任务。数据通过ILOSTAT REST API获取,并经过国际劳工统计学家会议(ICLS)定义进行标准化处理,确保一致性和可追溯性。

This dataset contains 3,332 observations of Youth transited by sex and economic activity (thousands) data across 17 Asia countries, spanning 1999–2025. It is sourced from the International Labour Organization (ILO) ILOSTAT database and repackaged by Electric Sheep Asia for machine learning readiness. The dataset provides statistics on youth school-to-work transition, disaggregated by sex (total, male, female) and economic activity sector, suitable for tabular classification, regression, and time-series forecasting tasks. Data is pulled from the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions for consistency and traceability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-pop-3ted-sex-eco-nb-youth-transited-by-sex-and-economic-activity-thous 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接抽取指标代码为POP_3TED_SEX_ECO_NB的原始数据,并依据ISO 3166-1 alpha-3编码过滤出亚洲17个国家的观测值。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化处理,确保数据口径一致。数据集中每一条记录均附有来源标识(source.label),以保障数据溯源的可追溯性。最终数据集涵盖3,332条观测,时间跨度为1999年至2025年,包含一个国家、年份、性别、经济活动分类及观测值等结构化字段。
特点
该数据集聚焦于亚洲地区青年从学校向工作过渡的议题,以“按性别和经济活动划分的已过渡青年人数(千人)”为核心指标,具有高度专业性与地域针对性。数据集覆盖塞浦路斯、韩国、巴基斯坦等17个亚洲国家,时间跨度长达27年,提供了性别维度的细分(总、男、女)。数据质量方面,采用了ILO选定的“最佳来源”策略处理多源冲突,并标注观测状态(如初步、不可靠)及系列断裂等注释,为研究者提供清晰的可靠性评估依据。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,执行`load_dataset('electricsheepasia/asia-ilo-pop-3ted-sex-eco-nb-youth-transited-by-sex-and-economic-activity-thous')`即可获取训练集,并利用`.to_pandas()`方法转换为Pandas DataFrame进行后续分析。支持按国家代码(ref_area)筛选特定国家数据,或对指标值(obs_value)按时间排序以绘制时间序列图。还可通过pivot_table构建以年份为行、国家为列的矩阵,便于进行跨国的长期趋势比较与面板数据分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属的ILOSTAT统计数据库创建,并由Electric Sheep Asia于2025年重新打包发布,聚焦亚洲17个国家1999至2025年间由性别和经济活动划分的青年就业过渡情况。数据集包含3332条观测记录,核心研究问题在于系统刻画亚洲青年从学校向劳动力市场过渡的进程,以反映性别差异与经济部门分布对其转型的影响。作为ILOSTAT全球劳动统计体系的重要组成部分,该数据集为区域发展研究、劳动力政策评价及可持续发展目标(SDG)中体面工作指标的监测提供了权威依据,推动了亚洲劳动力市场问题的实证分析与数据驱动决策。
当前挑战
该数据集所应对的领域挑战在于,青年从学校向工作过渡的过程在亚洲各国受到性别规范、经济结构差异和数据透明度不一的显著制约,传统统计手段难以实现跨国家与跨时间的一致比较。构建过程中面临多重困难:ILOSTAT需对来自17个国家不同调查体系(如劳动力调查、学校至工作转型调查)的原始微观数据进行协调,依据国际劳工统计学家大会定义实现标准化;同时需处理同一国家不同年份可能存在的指标来源变更与方法论修订,导致时间序列中的断裂与可信度标注(如不可靠状态标记)复杂化。此外,部分国家存在年度数据稀疏或早期年份缺失的问题,进一步增加了区域整合与对比分析的难度。
常用场景
经典使用场景
该数据集聚焦于亚太地区青年向工作过渡的性别与经济活动维度,收录了1999年至2025年间17个亚洲国家的3,332条观测记录,核心指标为不同性别和行业类别下的青年就业转型人数(单位:千人)。在经典使用场景中,研究者常将其作为时间序列数据,分析特定国家或区域青年从学校步入劳动力市场的动态演变趋势,或借助面板数据结构,构建混合效应模型以探究经济发展阶段、性别平等政策与青年就业转型率之间的关联机制。
解决学术问题
该数据集有效解决了亚太劳动经济学领域长期面临的数据碎片化与口径不统一问题,为探究青年就业过渡的性别差异、行业分布特征及跨时期波动提供了标准化、可复用的实证基础。通过对17个国家近三十年的年度观测值进行分析,学者能够深入检验产业结构转型、教育扩张与青年劳动力市场整合之间的相互作用,从而揭示影响青年就业质量与过渡效率的关键社会经济变量,为可持续发展目标(SDG)中体面工作指标的全球监测提供了坚实的数据支撑。
衍生相关工作
基于该数据集,研究者已衍生出多项具有影响力的学术产出,包括利用贝叶斯结构时间序列模型对特定国家青年就业过渡的突变点进行检测,以及构建面板向量自回归(PVAR)模型以量化宏观经济冲击对不同性别青年就业转型率的异质性传导效应。此外,数据集的跨国家面板特性催生了一系列比较政治经济学研究,考察了东亚与南亚国家在青年劳动力市场制度安排上的差异化路径。部分工作还将该数据与ILOSTAT中的工资与教育数据集进行融合,训练集成学习模型以识别青年就业脆弱性高发的亚群体特征。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务