遇见数据集

electricsheepasia/asia-ilo-eip-2eip-sex-age-nb-persons-outside-the-labour-force-by-sex-and-age-il

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲49个国家从1990年至2027年的50,031个观测值,专注于其他劳动力未充分利用指标,具体指标为EIP_2EIP_SEX_AGE_NB,即按性别和年龄划分的非劳动力人口(国际劳工组织模型估计值,单位:千人)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并经过处理和重新打包,以提供机器学习就绪的格式。数据集为表格结构,包含国家代码、年份、性别分类、观测值等列,适用于表格分类、回归和时间序列预测等自然语言处理任务。数据覆盖亚洲地区,旨在帮助研究劳动力市场趋势和人口经济分析。

This dataset contains 50,031 observations across 49 Asia countries from 1990 to 2027, focusing on Other measures of labour underutilization with the specific indicator EIP_2EIP_SEX_AGE_NB — Persons outside the labour force by sex and age (ILO modelled estimates, in thousands). Sourced from the International Labour Organization (ILO) ILOSTAT database, it is retrieved via API and repackaged to provide an ML-ready format. The dataset is in tabular form with columns such as country code, year, sex disaggregation, and observed values, suitable for tabular classification, regression, and time-series forecasting tasks. It covers Asia and aims to support research on labour market trends and demographic-economic analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-2eip-sex-age-nb-persons-outside-the-labour-force-by-sex-and-age-il 数据集图片
构建方式
该数据集由Electric Sheep Asia基于国际劳工组织(ILO)的ILOSTAT数据库重新打包而成。数据直接通过ILOSTAT REST API接口获取,并以ISO 3166-1 alpha-3国家代码为标准,筛选出亚洲49个国家的观测记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一处理,数据集中的'source.label'列可追溯数据来源,确保了信息的可溯源性。最终整合为包含50,031条观测值、时间跨度为1990年至2027年的结构化表格数据,涵盖性别与年龄维度的劳动力外人口估算。
特点
该数据集的核心特点在于其高维度的精细切分与广泛的覆盖范围。它不仅按性别(男性、女性、总计)进行拆分,还包含了年龄分组等分类变量,为深入剖析不同群体的劳动力参与状况提供了结构化的数据基础。全部观测值均经过ILO的模型估计调整,数据质量标记列('obs_status')清晰标识了观测值的调整状态,增强了研究的可靠性。此外,数据集覆盖49个亚洲国家长达38年的时间序列,为进行区域比较与纵向趋势分析提供了珍贵的资源。
使用方法
使用者可通过HuggingFace Datasets库的'load_dataset'函数直接加载数据集,并将其转换为Pandas DataFrame以便于处理。典型应用包括:按国家代码(如'ref_area')筛选特定国家的数据以进行国别分析;基于'indicator'列筛选特定指标,利用'time'列进行时间序列可视化;以及通过透视表功能,构建以年份为行、国家为列的矩阵,便于开展面板数据分析。数据集的列结构清晰,包含标识符、标签、分类维度和数值观测值,适合用于分类、回归及时序预测等任务。
背景与挑战
背景概述
在国际劳工组织(ILO)的统计框架下,劳动力市场的全面理解不仅取决于就业与失业数据,还依赖于对劳动力市场边缘人群的细致刻画。该数据集由ILO统计部门基于其旗舰数据库ILOSTAT创建,并于2025年11月发布,聚焦亚洲地区49个国家的劳动力市场未充分利用状况。核心研究问题在于量化并追踪1990年至2027年间,按性别与年龄分层的劳动力市场外人口规模,以揭示区域劳动力参与率的结构性动态。Electric Sheep Asia团队对该数据进行了重新封装,将其转化为机器学习友好的表格与时间序列格式,为亚洲劳动力经济学、政策模拟与人口迁移分析提供了标准化的数据基础,显著推动了区域经济发展与SDG体面工作目标的研究深度。
当前挑战
该数据集所解决的领域问题在于,传统劳动力统计往往忽略那些因各种原因退出劳动力市场的群体,从而无法完整反映劳动力供给的真实潜力与结构性失衡。其构建过程中面临的首要挑战是数据源的异构性与一致性:ILO需从各国家庭调查、行政记录等不同来源中提取数据,并依据国际劳工统计学家会议(ICLS)定义进行复杂的模型估计与统一,以生成跨时间、跨国别的可比序列。此外,数据质量标识(如“调整值”与“暂定值”)的存在,要求研究者在使用中审慎甄别观测值的可靠性,并妥善处理因分类维度(如年龄、性别)缺失而导致的回归分析中的信息损失问题。
常用场景
经典使用场景
该数据集收录了国际劳工组织(ILO)对亚洲49个国家1990年至2027年间劳动力市场之外人口的建模估算,覆盖男性、女性及总人口三个维度。研究者常将其作为面板数据,用于分析亚洲各国未参与劳动力市场人群的规模、性别构成及长期演变趋势。典型应用包括构建多元回归模型,探究经济增长、教育水平、社会保障政策等因素对劳动力外溢人口的影响,或通过时间序列分析揭示该指标随经济周期波动的规律。数据的高时间跨度与国别覆盖使其成为比较区域劳动力市场韧性、评估结构性失业或隐性失业风险的理想资源。
解决学术问题
该数据集主要服务于劳动经济学与人口经济学中关于劳动力市场边缘化群体的学术探讨。它解决了由于统计口径不一致导致跨国劳动力外溢人口可比性差的难题,为检验‘沮丧工人效应’(在衰退期劳动者因求职无望而退出市场)提供了统一度量基准。研究者得以量化性别差异对劳动力参与决策的约束,论证社会保障体系完善度与非经济活动人口规模之间的负向关联。基于这些数据,学术界能够更精准地诊断新兴经济体在从农业社会向服务业转型过程中潜藏的隐性失业问题,从而丰富对非正规就业与劳动力市场分割现象的理解。
衍生相关工作
基于该数据集衍生出一系列聚焦亚洲劳动力市场结构变迁的经典研究。有学者结合ILO同一体系内的就业率与失业率指标,构建‘劳动力市场脆弱性指数’以刻画区域性就业质量恶化风险;另一些工作则将其与教育年限或城镇化率等外部数据融合,运用面板向量自回归模型揭示人口结构转型对劳动力外流率的长期冲击。此外,该数据集常作为基准测试用于评估机器学习模型在官方统计时序数据上的预测性能,如利用LSTM网络更新ILO的建模估算框架,改进短期劳动力市场情景模拟的可信度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务