遇见数据集

electricsheepasia/asia-ilo-eip-3eip-sex-age-geo-nb-youth-outside-the-labour-force-by-sex-age-and-rura

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含13,132条观测数据,覆盖32个亚洲国家,时间跨度为1970年至2025年,专注于“其他劳动力利用不足的衡量指标”主题。具体指标为“EIP_3EIP_SEX_AGE_GEO_NB”,描述为“按性别、年龄和城乡地区划分的青年非劳动力人数(以千计)”。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,经过标准化处理,包含国家代码、性别、年龄分组、城乡地区分类、观测年份和数值等列,用于分析亚洲青年在劳动力市场外的状况。数据集以表格形式提供,适用于分类、回归和时间序列预测等机器学习任务,并遵循CC-BY-4.0许可协议。

This dataset contains 13,132 observations across 32 Asian countries, spanning from 1970 to 2025, focusing on the topic of Other measures of labour underutilization. The specific indicator is EIP_3EIP_SEX_AGE_GEO_NB, described as Youth outside the labour force by sex, age and rural / urban areas (thousands). Sourced from the International Labour Organizations (ILO) ILOSTAT database, the data has been harmonized and includes columns such as country code, sex, age groups, rural/urban area classifications, observation year, and values, facilitating analysis of youth outside the labour force in Asia. It is presented in tabular format, suitable for machine learning tasks like classification, regression, and time-series forecasting, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-3eip-sex-age-geo-nb-youth-outside-the-labour-force-by-sex-age-and-rura 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接抽取指示为“EIP_3EIP_SEX_AGE_GEO_NB”的原始微数据,并依据国际劳工统计学家会议(ICLS)的定义进行统一化处理。原始数据经过ILO统计部门的整合以保障跨经济体可比性。随后,数据集通过Electric Sheep Asia的管线过滤至亚洲地区的ISO3国别代码,并整合了来源标签以实现完整的可追溯性,最终打包为便于机器学习的Parquet格式,共汇集13,132条观测值。
特点
该数据集的核心特点在于其精细的多维分类结构和广泛的历史覆盖范围,涵盖32个亚洲国家1970年至2025年间青年(15-29岁)脱离劳动力市场状况的观测。数据不仅包含性别(总计、男性、女性)的分层,还融合了年龄分组与城乡地域类型(如国家层面)的复合分类信息。此外,其独特之处在于保留了观测状态标志及序列中断等数据质量备注,使研究者能够掌握数据源变更与方法论修订的历史脉络,确保分析结论的审慎性。
使用方法
研究者可通过HuggingFace的`datasets`库直接调用`load_dataset()`方法将数据加载至Python环境,并便捷地转换为Pandas DataFrame进行后续分析。典型应用包括按单一国家代码筛选以聚焦特定区域,或针对特定指标进行时间序列的趋势可视化。此外,利用数据透视功能,可以构建以年份为行、以国家为列的矩阵视图,便于开展跨国比较与面板数据分析。数据集采用CC-BY-4.0许可协议,使用时需同时标注原始数据来源及Electric Sheep Asia的重新包装贡献。
背景与挑战
背景概述
在全球化与区域经济转型的背景下,青年劳动力市场的动态监测成为发展经济学关注的焦点。由国际劳工组织(ILO)于2025年发布、Electric Sheep Asia重新打包的该数据集,聚焦亚洲32个国家中青年(15-29岁)因性别、年龄及城乡地域差异而退出劳动力市场的现象,涵盖1970年至2025年间共13,132条观测记录。该数据集依托ILOSTAT数据库——国际劳工统计的权威来源,通过统一规范的国家劳动力调查等多源数据,为学界和政策制定者提供了分析亚洲青年就业脆弱性、劳动利用不充分及结构性失衡的量化基础,对区域劳动经济学、可持续发展目标(SDG)监测及跨境比较研究具有重要价值。
当前挑战
当前数据集面临多重挑战。在领域问题层面,青年退出劳动力市场的现象常因统计口径、季节性就业及非正规经济活动的隐匿性而被低估,且性别与城乡维度交叉分析时数据稀疏性加剧了模型偏差风险。在构建过程中,ILOSTAT虽实现跨时期规范化,但各国原始调查的抽样框架、定义差异(如就业与学业的界定)及时间序列中频繁出现的“序列中断”(Break in series)标记,要求使用者具备细致的数据清洗与归因能力;此外,少数国家和年份的数据缺失,以及多重来源冲突时的“最佳来源”选择策略,均对下游分析的鲁棒性构成挑战。
常用场景
经典使用场景
该数据集收录了1970年至2025年间亚洲32个国家的13,132条观测记录,聚焦于按性别、年龄和城乡区域划分的未进入劳动力市场的青年人口数量(以千计)。其经典使用场景在于构建多维度的时间序列预测模型,研究者可基于性别、年龄组别和地理区位等分层变量,对青年劳动参与率的变化趋势进行精准建模与预测。该数据集的独特价值在于其精细化的分层结构,能够支持研究者分离出不同人口亚群在劳动力市场边缘化过程中的异质性模式,为理解亚洲地区青年就业困境的时空演变提供了数据基础。
衍生相关工作
该数据集的发布催生了一系列以亚洲青年劳动力市场为核心的衍生研究工作。基于其分层结构,研究者开发了多套用于劳动力利用率预测的基准模型,包括基于面板数据的固定效应回归、时空地理加权回归以及长短期记忆网络(LSTM)时间序列模型。部分工作进一步将该数据与之社会经济变量(如GDP、教育支出、城市化率)进行链接,构建了因果推断框架以识别青年失业的深层驱动因素。此外,该数据还被用于训练迁移学习模型,将亚洲模式拓展至其他发展中地区的劳动力研究,形成了跨区域的青年就业基准评测体系。
数据集最近研究
最新研究方向
当前该数据集的前沿研究聚焦于利用1970至2025年间覆盖32个亚洲国家的长期面板数据,深入剖析青年群体(15-29岁)在性别、年龄及城乡维度上的劳动力市场外状态。结合ILOSTAT的标准化劳动统计体系,研究者正着力于量化分析亚洲地区青年失业与不充分就业的结构性特征,尤其关注新冠疫情前后及数字化转型浪潮中,青年劳动参与率的动态演变与区域异质性。该数据集的发布为追踪后疫情时代亚洲青年就业脆弱性、评估社会保障政策效能、以及探索非正规就业与技能错配等热点议题提供了关键的时序证据,对推动联合国可持续发展目标中体面工作议程的在地化实证研究具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务