遇见数据集

electricsheepasia/asia-ilo-pop-3wap-sex-age-stu-nb-youth-working-age-population-by-sex-age-and-school

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲36个国家1970年至2025年的青年工作年龄人口数据,共15,872个观测值,覆盖一个主要指标:按性别、年龄和学校出勤状态分类的青年工作年龄人口(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至亚洲国家。数据集以表格形式呈现,包含国家代码、年份、性别分类、年龄组、教育出勤状态、观测值及数据质量标志等字段,适用于表格分类、回归和时间序列预测任务。数据已由Electric Sheep Asia重新打包,便于机器学习使用,并遵循CC-BY-4.0许可。

This dataset contains 15,872 observations of youth working-age population data across 36 Asia countries, spanning 1970–2025, covering one distinct indicator: Youth working-age population by sex, age and school attendance status (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia ISO3 country codes. It is presented in tabular format with columns including country code, year, sex disaggregation, age groups, educational attendance status, observed values, and data quality flags, suitable for tabular classification, regression, and time-series forecasting tasks. The dataset has been repackaged by Electric Sheep Asia for machine learning readiness and is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-pop-3wap-sex-age-stu-nb-youth-working-age-population-by-sex-age-and-school 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT数据库整理而成,经由Electric Sheep Asia团队重新打包发布。研究者通过ILOSTAT REST API直接提取原始数据,筛选出亚洲36个国家的相关指标,并利用ICLS(国际劳工统计学家会议)定义对调查微观数据进行统一协调。数据来源包括各国劳动力调查、家庭收入调查及行政记录,每一条观测都附有来源标签以确保可追溯性。最终,数据集以Parquet格式存储,便于快速加载与分析。
特点
该数据集包含15,872条观测记录,覆盖1970年至2025年间亚洲36个国家的青少年劳动适龄人口数据,按性别、年龄及就学状态进行细致分类。核心指标为‘按性别、年龄和就学状态划分的青少年劳动适龄人口(千)’,数据字段丰富,包括国家代码、调查来源、指标代码、时间及观测值等。此外,数据集还提供了观测状态标识和注释信息,便于研究者评估数据质量与潜在的方法学变更。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据:使用`load_dataset()`函数导入后,数据可直接转为Pandas DataFrame进行分析。典型操作包括按国家过滤子集(如印度尼西亚的数据)、绘制特定指标的时间序列图,或透视生成国家×年份的观测值矩阵。数据以年度频率呈现,研究者需注意不同国家的数据起止年份存在差异,部分观测可能标记为‘不可靠’或存在方法学修订,使用时应结合对应的状态标签做出判断。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年基于其核心统计数据库ILOSTAT构建,经Electric Sheep Asia团队重新包装后发布在HuggingFace平台。其核心研究问题聚焦于亚洲地区青年劳动年龄人口(15-29岁)的性别、年龄结构与在校状态分布,旨在为劳动力市场分析、教育政策评估及可持续发展目标(SDG)监测提供精细化的数据支撑。数据集涵盖36个亚洲国家1970至2025年的15,872条观测记录,整合了ILO通过各国劳动力调查和行政记录统一协调的微观数据。作为ILOSTAT体系的子集,该数据集在劳动经济学、人口学与公共政策研究领域具有重要价值,尤其为跨国家、长时序的青年就业与教育参与关联分析提供了标准化、可复用的基准资源。
当前挑战
该数据集所解决的领域核心挑战在于:亚洲地区青年劳动年龄人口统计长期面临数据碎片化、跨国定义不一致及时间序列不连续等问题,难以支撑区域性劳动力政策比较与动态追踪研究。通过采用ICLS国际统计标准对多源调查数据进行统一归化,数据集有效弥合了各国在年龄分组、在校状态界定和性别维度上的口径差异。构建过程中则面临多重技术难点:需要处理来自各国劳动力调查与行政记录的异构数据源,标记时序中断与方法论修订(如字段note_indicator所反映的断点信息);对缺失数据填充及观测值可靠性标记(如obs_status标注的不可靠值)的透明化处理;以及跨36国、55年间海量分类维度(性别、年龄组、教育状态)的矩阵式解析与范式化存储。
常用场景
经典使用场景
该数据集收录了1970年至2025年间亚洲36个国家15,872条青年劳动适龄人口观测记录,按性别、年龄组及在校状态进行细致分层。在劳动经济学与人口学研究中,它常被用于构建多维度面板数据模型,以剖析亚洲地区青年人口结构变迁及其与劳动力市场参与率之间的动态关联。研究者可借助该数据开展跨国比较分析,探讨教育扩张与青年就业之间的权衡关系,或追踪特定国家青年在校率随经济发展阶段的演变轨迹。其精细的时空覆盖与标准化的ILO统计口径,使其成为量化分析青年人口红利、代际流动以及人力资本积累等核心议题的基石性资料。
衍生相关工作
该数据集的标准化结构直接激发了多项后续研究工具的诞生。基于其面板数据特性,研究者开发了‘亚洲青年劳动力状态转换矩阵’,用以可视化性别与年龄组间在校与就业状态的动态流动。部分团队以其为核心,构建了预测亚洲各国青年失业率与在校率联动的计量经济学预警模型,发表于《劳动经济学》等期刊。此外,数据已被整合至开放性教育平台,作为教学案例用于演示分层时间序列数据的清洗与可视化技术,推动了数据科学在社会科学领域的应用。其与ILO其他数据集(如工资与工作时间数据)的联合使用,还催生了探讨亚洲青年劳动条件与人口结构关系的跨指标综合分析框架。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲36国青年劳动年龄人口按性别、年龄及就学状态的多维分布,为劳动经济学与人口统计学前沿研究提供了高分辨率时序数据。结合ILOSTAT官方统计框架,该数据可支撑青年失业与教育投资关联分析、性别差异对劳动力市场影响的纵向追踪,以及亚洲发展中国家人口红利消退期的政策建模。2024年以来,国际劳工组织在《世界青年就业趋势》中反复强调数据颗粒度对精准政策制定的重要性,而本数据集恰好填补了亚洲地区按就学状态拆分的空白,尤其适用于评估东南亚职业教育改革成效或南亚女性劳动参与率的结构性障碍。其跨度达55年的时序记录,更使研究者得以捕捉2020年后疫情时代青年群体“学业-就业”转换路径的剧烈变迁,进而为联合国2030年可持续发展议程中的体面工作目标提供实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务