遇见数据集

electricsheepasia/asia-ilo-emp-3emp-sex-age-how-nb-youth-employment-by-sex-age-and-weekly-hours-actua

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲青年就业统计数据,具体指标为按性别、年龄和每周实际工作小时数统计的青年就业(千计)。数据集涵盖33个亚洲国家从1990年至2025年的34,201个观测值,包含就业指标的分性别、年龄组和工作小时数分类的详细数据。数据经过ILO标准化处理,来源于各国劳动力调查等官方统计,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains youth employment statistics from the International Labour Organization (ILO) ILOSTAT database for Asia, specifically the indicator Youth employment by sex, age and weekly hours actually worked (thousands). It includes 34,201 observations across 33 Asian countries from 1990 to 2025, with detailed disaggregation by sex, age groups, and weekly working hours. The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions and sourced from national labour force surveys and administrative records, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-3emp-sex-age-how-nb-youth-employment-by-sex-age-and-weekly-hours-actua 数据集图片
构建方式
该数据集的构建依托于国际劳工组织(ILO)的ILOSTAT权威数据库,通过REST API接口直接拉取指标'EMP_3EMP_SEX_AGE_HOW_NB'的原始数据,并依据ISO3国家代码严格过滤至亚洲区域。数据整合了33个亚洲国家在1990年至2025年间的年度观测值,共计34,201条记录。构建过程中,ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化与调和,同时保留来源标签以确保数据溯源清晰。数据集由Electric Sheep Asia团队重新打包为Parquet格式,以统一的架构发布至HuggingFace平台,便于机器学习与时间序列分析任务的直接调用。
特点
本数据集的核心特色在于聚焦亚洲青年就业的精细维度和跨时空覆盖。它提供了按性别(男性、女性、总计及其他)、年龄(15-29岁青年段)以及每周实际工作小时数分层的就业人数统计,指标粒度丰富。数据结构以年度频率呈现,支持从国家层面到细分维度的深入探索,例如通过'classif1'与'classif2'字段实现对年龄和小时段的联合分组。此外,数据集包含详尽的元数据,包括观测状态标志(如临时或不可靠数据)以及系列中断注释,为数据质量评估提供了透明依据。其多维度分类能力尤其适用于研究亚洲劳动力市场中青年就业的性别差异和时间趋势。
使用方法
使用者可通过HuggingFace的datasets库轻松加载数据集,仅需一行代码`load_dataset("electricsheepasia/asia-ilo-emp-3emp-sex-age-how-nb-youth-employment-by-sex-age-and-weekly-hours-actua")`即可获取训练集,并快速转换为Pandas DataFrame进行后续分析。针对特定国家的研究,可依据'ref_area'列进行筛选,例如`df[df["ref_area"] == "IDN"]`提取印度尼西亚数据。对于时间序列分析,建议按'indicator'和'time'列排序后绘制趋势图,或利用`pivot_table`将数据重塑为国家×年份的矩阵格式,以观察区域间的横向对比。代码示例完整提供了从数据筛选到可视化的标准工作流,适用于劳动力经济学与政策评估领域的研究实践。
背景与挑战
背景概述
青年就业是衡量区域劳动力市场活力与社会可持续发展的重要指标,尤其在亚洲这一人口结构多元、经济发展水平差异显著的地区。国际劳工组织(ILO)下属的ILOSTAT数据库作为全球劳动统计的核心来源,系统整合了来自各国劳动力调查、行政记录等多源数据。在此背景下,Electric Sheep Asia于2025年基于ILOSTAT官方API构建了该数据集,覆盖33个亚洲国家1990年至2025年间青年就业的性别、年龄及实际周工作小时数分布情况,共计34,201条观测。该数据集通过标准化处理与精细分类标签,为区域劳动力市场分析、青年就业政策评估及跨国比较研究提供了可靠的时间序列基础,对推动亚洲劳动经济学与可持续发展目标监测具有重要影响力。
当前挑战
该数据集首先致力于解决亚洲青年就业领域中多维度精细度缺失的难题:传统统计常仅提供总量数据,而该数据集通过性别、年龄组及工作时长区间三重交叉分类,使研究者得以深入分析结构性差异,例如青年非充分就业的性别不平等或特定年龄段的工作时长分布模式。在构建过程中,面临的核心挑战包括:多国数据源在调查方法、时间频次与国际劳工统计学家会议(ICLS)定义上的异质性需经ILO统一协调,但仍存在时序中断、来源版本更新等标记处理需求;部分观测值标记为不可靠,需谨慎用于精确决策;亚洲区域覆盖虽广,但时序列长度与国家间数据密度差异显著,对跨国比较的统计推断构成约束。
常用场景
经典使用场景
该数据集提供了1990至2025年间33个亚洲国家的青年就业数据,按性别、年龄组和实际每周工作小时数进行细分。经典的使用场景包括跨国家、跨时间的青年劳动参与率比较分析,以及利用分类与回归任务构建预测模型,探究不同人口特征群体在就业市场中的分布模式。其结构化的面板数据格式天然适配于时间序列预测任务,研究者可据此模拟政策变动或经济周期对青年就业结构的影响。
实际应用
实际应用中,数据集的细粒度特征使其成为国际组织、政府部门和智库开展就业监测与评估的重要工具。例如,分析特定国家青年女性在不同年龄段的工时分布,可为制定反歧视就业政策或灵活工时方案提供量化依据。此外,结合宏观经济指标,该数据能够支持企业进行区域性人力资源规划,帮助跨国机构识别新兴市场的劳动力供给潜力及潜在结构性风险。
衍生相关工作
该数据集已衍生出多项经典研究工作,包括基于多国面板数据的青年就业决定因素计量回归分析、利用长短期记忆网络等深度学习模型对亚洲各国青年失业率的时序预测,以及结合地理信息系统对就业机会空间分布的探索。同时,数据集的标准化处理流程也催生了针对ILOSTAT数据源的自动化清洗与特征工程工具包,促进了开放数据在社会科学可重复性研究中的应用生态构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务