遇见数据集

electricsheepasia/asia-ilo-eip-3eip-sex-age-dsb-nb-youth-outside-the-labour-force-by-sex-age-and-disa

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的“其他劳动力未充分利用指标”数据,具体聚焦于“按性别、年龄和残疾状况划分的未进入劳动力市场的青年(千人)”这一指标。数据集涵盖23个亚洲国家,时间跨度为1996年至2024年,共包含4,445条观测记录。数据通过ILOSTAT REST API获取,并经过标准化处理,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains Other measures of labour underutilization data from the International Labour Organization (ILO) ILOSTAT database, specifically focusing on the indicator Youth outside the labour force by sex, age and disability status (thousands). It covers 23 Asian countries from 1996 to 2024, with 4,445 observations. Data is sourced from the ILOSTAT REST API and harmonized, suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-3eip-sex-age-dsb-nb-youth-outside-the-labour-force-by-sex-age-and-disa 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT中央统计数据库,聚焦于亚洲地区青年因性别、年龄及残疾状况而脱离劳动力市场的现象。其构建路径清晰而严谨:首先通过ILOSTAT官方REST API接口直接抓取原始指标数据,随后依据亚洲ISO3国家代码进行地理筛选,最终生成包含23个亚洲国家、覆盖1996年至2024年时间跨度的4,445条观测记录。数据经过ILO基于国际劳工统计学家会议(ICLS)定义的系统性整合与标准化处理,确保了跨时期、跨地域的可比性与可靠性。
特点
此数据集的核心特质在于其精细的多维度分类体系与高时效性。它不仅提供了按性别(总人数、男性、女性)和年龄段(如15-29岁青年群体)的详细分割,更创新性地纳入了残疾状况这一关键维度,使研究者能够深入剖析弱势青年群体的劳动参与困境。所有观测值均附带详尽的状态标记(如“不可靠”)、来源标签及注释信息,为数据质量评估提供了透明依据。此外,数据集由Electric Sheep Asia团队重新封装为机器学习友好格式,兼具学术严谨性与工程可用性。
使用方法
数据集的使用极为便捷:用户可通过HuggingFace的`load_dataset`接口一键加载至Python环境,并转换为Pandas DataFrame进行深度分析。典型应用包括按国家筛选特定地区趋势(如印度尼西亚)、对单一指标进行时序可视化(以年份为轴绘制观测值变化),或通过数据透视构建国家×年份的矩阵面板。尤其适合从事劳动经济学、社会保障政策及国际发展研究的学者,用于建模青年就业困境、评估政策干预效果或进行跨国比较分析,所有操作均可在几行代码内高效完成。
背景与挑战
背景概述
在全球劳动统计领域,国际劳工组织(ILO)凭借其权威数据库ILOSTAT,长期致力于追踪各国劳动力市场的多维动态。由Electric Sheep Asia于2024年重新整理并发布的这一数据集,聚焦于亚洲23个国家中15至29岁青年因性别、年龄及残疾状况而处于劳动力市场之外的现象,涵盖1996至2024年间共计4,445条观测值。该数据集的创建旨在填补区域层面青年劳动参与不足的精细化分析空白,尤其关注残疾青年这一脆弱群体,为政策制定者与研究者提供基于ILO标准化统计口径的可靠依据。其影响力体现在推动亚洲劳动力市场包容性研究、支持可持续发展目标中体面工作的量化评估,以及促进跨国比较分析的科学性。
当前挑战
该数据集所应对的核心领域挑战在于,传统劳动统计往往忽视青年‘不在劳动力队伍中’的复杂成因,尤其是残疾状态与社会性别结构的交互作用,导致针对边缘化群体的政策干预缺乏数据支撑。在构建过程中,数据集面临的挑战包括:跨23个国家与近30年时间序列的数据整合,需应对各国调查方法、定义差异及来源标注不一致的问题;ILO在协调多源微观数据时,对残疾定义的非标准化(如‘C14:6260’备注)可能引入分类偏差;年度频率数据无法捕捉短期波动,且部分观测值因质量问题被标记为‘不可靠’,影响模型的时序分析精度。
常用场景
经典使用场景
该数据集记录了1996年至2024年间亚洲23个国家的青年(15-29岁)因性别、年龄及残疾状况而处于劳动力市场之外的详细数据,共计4445条观测。其经典使用场景在于构建多层次分类与回归模型,以预测不同亚群中青年脱离劳动力市场的概率与规模。研究者可利用时间序列分析技术,捕捉青年劳动力参与率在多年间的动态演变趋势,揭示其背后隐藏的社会结构性变迁。数据集的多维分类特征(如性别、残疾状态)使其成为检验交叉性不平等理论的理想实验场,能够系统评估多重身份变量叠加对劳动力市场参与度的复合影响。
衍生相关工作
该数据集衍生了一系列围绕青年劳动弱势群体异质性分析的前沿研究。以该数据为训练集,研究者开发了多水平贝叶斯模型来量化国家层面政策差异对残疾青年就业率的调节效应。另有工作基于时间序列分解方法,将趋势、季节性与残差成分分离,精准识别出2008年全球金融危机和COVID-19疫情对亚洲不同国家青年劳动参与率的非对称冲击。该数据还被用作基准数据集,推动了考虑测量误差的统计方法创新,解决了ILOSTAT标记为不可靠('unreliable')观测值对面板数据估计的扰动问题。此外,基于该数据集衍生的可解释性机器学习框架,系统揭示了年龄分段和残疾类型交互作用在解释青年劳动力退出行为中的非线性特征。
数据集最近研究
最新研究方向
当前,随着全球青年就业形势日趋严峻,劳动力市场中的隐性失业与边缘化群体成为国际劳工组织与各国政策制定者关注的焦点。该数据集聚焦于亚洲地区因性别、年龄与残疾状况而被排斥在劳动力市场之外的青年群体,提供1996年至2024年间23个国家的时序观测,为研究结构性就业障碍、社会包容性政策效果以及残疾青年群体的经济参与困境提供了珍贵的量化基础。前沿研究正借助此类高粒度面板数据,结合机器学习和因果推断方法,深入剖析残疾状况与性别不平等如何交叉作用于青年人的劳动市场退出行为,进而评估各国就业促进及残障融合政策的社会经济效益,推动实现体面劳动与可持续发展目标。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务