遇见数据集

electricsheepasia/asia-ilo-eap-3eap-sex-age-geo-nb-youth-labour-force-by-sex-age-and-rural-urban-area

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含13,110个观测值,覆盖32个亚洲国家,时间跨度为1970–2025年,涉及1个指标,主题为劳动力。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,具体指标为“按性别、年龄和城乡地区分组的青年劳动力(千人)”。数据集经过重新打包,以表格形式提供,支持分类、回归和时间序列预测任务,适用于机器学习研究。数据包括国家代码、年份、性别、年龄组、地区类型等维度,并包含数据来源和质量注释。

This dataset contains 13,110 observations across 32 Asia countries, spanning 1970–2025, covering 1 distinct indicator related to labour force. The data is sourced from ILOSTAT (the ILOs central statistics database), with the specific indicator being Youth labour force by sex, age and rural / urban areas (thousands). It has been repackaged for machine learning use, presented in tabular format, and supports tasks such as tabular classification, regression, and time-series forecasting. The data includes dimensions like country codes, years, sex, age groups, area types, along with source and quality annotations.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eap-3eap-sex-age-geo-nb-youth-labour-force-by-sex-age-and-rural-urban-area 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,聚焦于亚洲地区青年劳动力市场的关键指标。构建过程通过调用ILOSTAT的REST API接口,直接抽取了标识符为EAP_3EAP_SEX_AGE_GEO_NB的原始数据,并依据ISO 3166-1 alpha-3标准国家代码严格筛选出亚洲32国的观测记录。数据本身经过了ILO统计部门的统一协调处理,基于国际劳工统计学家会议(ICLS)的定义对各国劳动力调查微观数据进行了标准化清洗与整合,从而确保了跨国家与跨时间维度的可比性。最终,该数据集由Electric Sheep Asia团队重新打包为HuggingFace上可直接加载的格式。
特点
此数据集的核心特点在于其精细的多维分层架构与丰富的元数据记录。它涵盖了1970年至2025年间亚洲32个国家共13,110条观测值,不仅记录了青年劳动力数量的绝对值,还通过分类变量实现了极为细致的交叉分析,包括按性别(男性、女性、总计)、年龄组别及城乡地理区域的拆解。数据集中附带了详细的溯源标注,如数据来源编码与标签、观测状态标志(如序列中断)以及方法论变更注释,极大地增强了数据的透明度和可审计性。此外,作为ILO选定的“最佳来源”数据,其质量得到了充分保障。
使用方法
使用该数据集极为便捷,用户可通过HuggingFace的datasets库直接加载。典型的操作包括调用`load_dataset`函数将其读入为DataFrame格式,进而利用`ref_area`字段按国家代码进行过滤,如分析印度尼西亚的特定情况。对于时序分析,可按`indicator`字段筛选并依据`time`列排序后绘制趋势图。研究者亦可通过pandas的透视表功能,将数据重构为国家×年份的矩阵形式,便于进行面板数据分析或机器学习模型的特征构建。每个观测值均附带了`obs_value`浮点型数值与对应的分类标签,适用于分类、回归及时序预测等多种任务场景。
背景与挑战
背景概述
国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布了该数据集,并由Electric Sheep Asia进行重新封装,聚焦亚洲32个国家1970年至2025年间青年劳动力人口按性别、年龄及城乡区域的分布状况。青年就业问题是全球可持续发展目标(SDGs)中的关键议题,尤其在亚太地区,快速城镇化与人口结构变迁使得精细化、多维度劳动力数据的构建成为研究劳动力市场供需、区域经济不平等及政策评估的基础。该数据集整合了各国劳动力调查与行政记录,提供了13,110条观测值,涵盖一个核心指标,为社会科学、经济学及公共政策领域开展跨国比较与时间序列分析提供了权威且标准化的数据支撑。
当前挑战
该数据集所解决的领域挑战在于,发展中国家尤其是亚洲地区青年劳动力数据的碎片化与统计口径不统一长期阻碍了区域就业政策的精准制定。构建过程中面临多重困难:首先,需协调各国不同时期劳动力调查的抽样设计与定义差异,按国际劳工统计学家会议(ICLS)标准进行协调,但数据来源变更(如‘序列中断’标记)仍可能导致时序不一致;其次,城乡与性别维度的分解信息在部分国家与年份明显缺失,降低了面板数据的完整性;此外,亚太地区部分国家数据点稀缺(如阿富汗仅490条),使得模型对极端值敏感,且跨国家样本量不均衡增加了统计推断的偏倚风险。
常用场景
经典使用场景
这一数据集在劳动经济学领域被广泛应用于分析亚洲青年劳动力的时空分布特征。研究者通常利用其包含的性别、年龄段及城乡属性维度,构建面板数据模型,以刻画不同国家青年劳动参与率的演变轨迹。具体而言,经典使用方式包括对32个国家1970至2025年间青年劳动力规模进行纵向比较,或借助分类变量考察性别差异与城乡分割对青年就业结构的交互影响。数据的高时间分辨率和跨国覆盖特性,使其成为探索亚洲劳动力市场转型与青年就业弹性的理想素材。
衍生相关工作
基于该数据集衍生的经典工作集中于劳动力市场预测与政策模拟领域。研究者曾利用其时间序列特性构建ARIMA或结构化向量自回归模型,预测亚洲青年劳动力参与率的短期波动。另有团队结合机器学习方法,将性别、城乡和年龄特征作为输入变量,训练分类器以识别青年失业风险较高的国家集群。此外,该数据也被整合进更广泛的全球劳动力数据库,支撑了关于亚洲经济周期与青年就业弹性关系的跨国比较研究,催生了多篇发表于《国际劳动评论》等期刊的实证论文。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区青年劳动力在性别、年龄及城乡维度的时空分布,为劳动经济学与可持续发展研究提供了高分辨率面板数据。最新研究趋势围绕ILOSTAT框架下青年就业脆弱性展开,结合1970-2025年的长时序观测,学者正利用该数据剖析后疫情时代亚洲青年劳动参与率的性别鸿沟与城乡分化,并关联SDG 8体面工作目标的区域实现路径。其32国覆盖与多源调查数据的融合,为跨境劳动力迁移建模、非正规就业预警以及青年就业政策的异质性评估注入新的实证动能,尤其呼应了亚洲新兴经济体数字化转型对青年劳动技能供需的冲击探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务