遇见数据集

electricsheepasia/asia-ilo-emp-2emp-sex-age-cla-nb-employment-by-sex-age-and-economic-class-ilo-model

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含59,124个观测值,涉及“工作贫困”数据,覆盖33个亚洲国家,时间跨度为1991年至2025年,涵盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为亚洲国家代码。数据集包括就业按性别、年龄和经济阶层分类的ILO模型估计值(以千计),并提供了详细的数据模式,如国家代码、来源、指标、性别分类、年龄分类、经济阶层分类、观测年份、观测值等列。数据为年度频率,经过ILO harmonisation处理,使用国际劳工统计学家会议(ICLS)定义,并标注了来源以便追溯。数据集适用于表格分类、表格回归和时间序列预测等任务,已由Electric Sheep Asia重新打包为Parquet格式,便于机器学习使用。

This dataset contains 59,124 observations focused on "working poverty" data, covering 33 Asian countries over the period from 1991 to 2025, with 1 unique indicator. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via REST API and filtered to retain only Asian country codes. It includes ILO model-based employment estimates broken down by gender, age group and economic class (in thousands), with detailed columns such as country code, source, indicator, gender classification, age classification, economic class classification, observation year and observed value. The data is of annual frequency, processed via ILO harmonisation, defined in accordance with the standards set by the International Conference of Labour Statisticians (ICLS), and sources are annotated for traceability. This dataset is applicable to tasks including tabular classification, tabular regression and time series forecasting, and has been repackaged into Parquet format by Electric Sheep Asia to facilitate machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-2emp-sex-age-cla-nb-employment-by-sex-age-and-economic-class-ilo-model 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接提取指标“EMP_2EMP_SEX_AGE_CLA_NB”的原始数据,并依据亚洲ISO3国家代码进行地理筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、家庭收入调查及行政记录等微观数据进行标准化处理与整合,最终生成覆盖33个亚洲国家、时间跨度为1991年至2025年的59,124条观测记录。数据集由Electric Sheep Asia进行重新封装,以Parquet格式发布,确保数据的一致性与机器学习就绪性。
特点
本数据集聚焦于“按性别、年龄和经济阶层划分的就业人数”这一核心指标,提供了包含性别(总、男、女)在内的多维度细分变量。其时间序列覆盖长达35年,横跨亚洲33个国家,为区域劳动力市场分析提供了纵向与横向的双重比较基础。数据集中还包含了来源标记(source.label)与观察状态标识(obs_status),便于用户追溯数据来源并评估数据质量。整体而言,该数据集具备较高的结构性、时效性与可解释性。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,利用load_dataset()函数即可获取训练集形式的DataFrame。基于Pandas库,用户可以方便地按国家(如过滤出印度尼西亚的数据)、按指标进行时间序列分析,或通过pivot_table方法构建国家×年份的矩阵数据。该数据集适用于表格分类、回归以及时间序列预测等任务,是研究亚洲就业结构变迁、性别差异及经济阶层分布的核心数据资源。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,由Electric Sheep Asia重新打包整合,聚焦亚洲33个国家1991至2025年间按性别、年龄和经济阶层划分的就业状况,包含59,124条观测数据。研究核心在于通过ILO的建模估计方法,揭示亚洲区域工作贫困(working poverty)的时空演变规律,为劳动力市场政策制定提供量化依据。作为ILOSTAT数据库的精细化子集,该数据集弥补了亚洲地区长时间序列、多维度就业数据的稀缺性,对劳动经济学、发展经济学及国际比较研究具有重要推动作用。
当前挑战
领域问题方面,该数据集旨在应对工作贫困与复杂社会结构(如性别差异、年龄分层、经济阶级)之间非线性关系的量化挑战,传统聚类或回归模型难以捕捉多因素交互效应。构建过程中,挑战在于:1) 跨33国数据源的异质性校准,需协调不同国家劳动力调查口径与统计标准;2) 时间序列跨度长达35年,需处理历史数据缺失、测量误差及分类标准变迁带来的不一致性;3) 数据重构时需保留ILO原始建模估计的标识性字段(如obs_status),同时保证机器学习框架下的可即用性与模式兼容性。
常用场景
经典使用场景
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,提供了1991年至2025年间亚洲33个国家的就业人口按性别、年龄和经济阶层分类的估算数据,共计59,124条观测记录。其经典使用场景在于支撑劳动经济学与区域发展研究,研究者可通过该数据集对不同国家、不同时期的就业结构进行横向与纵向对比分析,尤其适用于探究亚洲地区工作贫困(Working Poverty)现象的演变特征、性别差异以及代际分布规律。数据集丰富的分维度标签(如性别、年龄组、经济阶层)使其成为构建统计模型与进行面板数据分析的理想原材料。
衍生相关工作
围绕该数据集已衍生出多项具有代表性的研究工作。经济学家常将其与ILO发布的其他指标(如失业率、工资分布、非正规就业)结合,构建多维度体面劳动指数,用于评估亚洲各国的劳动市场健康状况。另一类经典工作是利用该数据集的性别与年龄分类,与国家统计局的人口普查数据及世界银行的教育数据进行匹配,分析人力资本积累与劳动成果的关联。在机器学习领域,该数据集已被用于训练时序预测模型,例如利用1991年至2020年的数据预测2021至2025年的就业结构变化,从而验证ILO建模估算的可靠性,并为劳动政策的提前设计提供证据支持。
数据集最近研究
最新研究方向
基于亚洲33国1991–2025年就业按性别、年龄及经济阶层分类的ILO建模数据,前沿研究聚焦于利用深度学习时序模型(如Transformer、LSTM)解析亚太地区“工作贫困”(Working poverty)的长期演化规律,并交叉年龄分层与性别差异探讨不平等结构。同时联动ILOSTAT标准化指标,结合国家间面板数据构建亚洲劳动力弹性预警系统,推动SDG体面劳动目标下的政策模拟与评估。该数据集为区域比较经济学、劳动社会学及公平转型研究提供了可复现的雄辩支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务