遇见数据集

electricsheepasia/asia-ilo-une-tune-sex-age-edu-nb-unemployment-by-sex-age-and-education-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、年龄和教育程度划分的失业人数(千)| 亚洲(ILOSTAT),是一个关于亚洲国家失业情况的表格数据集。它包含230,350个观测值,覆盖45个亚洲国家,时间跨度为1970年至2025年,涵盖1个核心指标:UNE_TUNE_SEX_AGE_EDU_NB,即按性别、年龄和教育程度划分的失业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,这是全球劳动力统计的主要来源,通过REST API获取并过滤为亚洲国家。数据集包括详细的列结构,如国家代码、国家名称、数据来源、指标代码、性别分类、年龄和教育分类、观测年份、观测值、观测状态等,并提供了按性别(总计、男性、女性等)的细分维度。数据质量方面,注意数据为年度频率,ILO选择最佳来源,且细分列仅在指标发布该细分时非空。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、机器学习就绪的数据层,便于研究人员和开发者使用。

This dataset, titled Unemployment by sex, age and education (thousands) | Asia (ILOSTAT), is a tabular dataset focusing on unemployment statistics across Asian countries. It contains 230,350 observations covering 45 Asia countries from 1970 to 2025, with 1 distinct indicator: UNE_TUNE_SEX_AGE_EDU_NB, which represents unemployment disaggregated by sex, age, and education (in thousands). The data is sourced from ILOSTAT, the International Labour Organizations (ILO) central statistics database, a leading global source for labour statistics, retrieved via REST API and filtered to Asia ISO3 country codes. The dataset features a detailed schema including columns such as country code, country name, source, indicator code, sex classification, age and education classifications, observation year, observed value, observation status, and more, with disaggregation dimensions like sex (total, male, female, etc.). Data quality notes include annual frequency, use of ILO-selected best source for duplicates, and non-null disaggregation columns only when published. Repackaged by Electric Sheep Asia, it aims to provide a unified, ML-ready data layer for Asia, facilitating easy access for researchers and developers.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-tune-sex-age-edu-nb-unemployment-by-sex-age-and-education-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API(https://rplumber.ilo.org/data/indicator?id=UNE_TUNE_SEX_AGE_EDU_NB)直接拉取失业指标数据,并依据ISO3国家代码筛选出45个亚洲国家。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化调和,数据来源涵盖劳动力调查、家庭收入调查、机构调查及行政记录,并在source.label列中标注来源以确保可追溯性。Electric Sheep Asia对原始数据进行重新打包,以Parquet格式发布,形成覆盖1970至2025年、共计230,350条观测的即用型数据集。
使用方法
研究者可通过Hugging Face datasets库以load_dataset()函数便捷加载该数据集,并转换为Pandas DataFrame进行后续分析。典型用法包括:按ref_area列筛选特定国家(如印度尼西亚IDN)以构建国别子集;按indicator列选取失业指标,结合time列排序后绘制单指标时间序列图;或利用pivot_table将数据重塑为国家×年份矩阵,支持跨国比较与面板分析。数据集亦适用于训练机器学习模型,执行失业率预测、趋势外推或跨国差异分类等任务,其结构化的模式与丰富的注释字段为特征工程提供了坚实基础。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计体系的构建与完善,其核心数据库ILOSTAT汇集了涵盖就业、失业、工资及体面劳动等维度的跨国可比数据。在此背景下,Electric Sheep Asia于2025年对ILOSTAT原始数据进行系统性重包装,发布了聚焦亚洲区域的面板数据集,涵盖45个国家、1970至2025年间逾23万条按性别、年龄与教育程度三重维度细分的失业观测记录。该数据集的核心研究问题在于揭示亚洲劳动力市场中失业现象的结构性异质性,为劳动经济学、人口学及社会政策评估提供高分辨率的实证基础,其细致的人口学分层设计显著提升了区域失业动态分析的精度与政策相关性。
当前挑战
亚洲区域失业统计面临跨国数据可比性与完整性的双重困境。各国劳动力调查在抽样设计、失业定义及教育分类标准上存在显著异质性,ILO虽以国际劳工统计学家会议决议为基准进行调和,但原始数据中仍普遍存在序列中断、方法修订及观测值可靠性存疑等标记。同时,数据在时间维度上覆盖不均,部分国家起始年份滞后且终止年份较早,性别与教育维度的分层信息也非全部年份可得。构建过程中,如何在不损失国家特异信息的前提下,将多源异构的行政记录与调查微数据整合为统一的面板结构,并保持分类标签的语义一致性,构成了该数据集在可复用性与分析稳健性方面的核心挑战。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域中,该数据集最经典的使用场景在于构建亚洲地区失业率的细粒度面板数据,用以刻画性别、年龄与教育程度三维交互下的失业动态。研究者常以年度为时间轴,将45个亚洲国家的失业观测值按性别(男、女、总计)、年龄组(青年与成年人)及教育层级(初等、中等、高等)进行分层聚合,进而绘制失业率的时空热力图或分解趋势曲线。此类场景下,数据集的时间跨度自1970年延伸至2025年,提供了逾23万条观测记录,使得跨国比较与组内演变分析得以在同一框架内并行展开。
解决学术问题
该数据集有效回应了劳动市场中长期存在的结构性失业识别难题,尤其是教育错配与性别差异对失业风险的异质性影响。传统研究受限于国别数据口径不一或教育分类粗疏,难以在亚洲范围内进行一致性的比较分析。本数据集依托国际劳工组织的标准化协调流程,将各国劳动力调查数据统一至国际劳工统计学家会议定义之下,从而支持学者检验“教育扩张是否缓解青年失业”“女性高等教育回报是否在失业维度上被削弱”等假设。其意义在于为跨国劳动政策评估提供了可复现的量化基准,并推动了失业研究从总量分析向分层机制分析的范式迁移。
实际应用
在实际应用层面,该数据集为国际组织、国家统计部门及区域政策制定者提供了监测亚洲劳动力市场脆弱性的操作工具。具体而言,政策分析师可按国家与年份筛选出青年女性低教育群体的失业规模,用于设计靶向就业培训或社会保障干预方案;企业人力资源部门亦可借助跨国失业率的教育分层数据,优化海外用工布局与人才储备策略。此外,非政府组织在评估教育援助项目成效时,可将该数据集作为基线参照,追踪受援国特定人口组的失业率变动轨迹。数据集以Parquet格式封装并支持HuggingFace快速加载,大幅降低了从数据获取到决策支持的转化成本。
数据集最近研究
最新研究方向
在劳动经济学与可持续发展研究领域,该数据集为解析亚洲地区失业问题的结构性异质性提供了关键支撑。当前前沿研究聚焦于性别、年龄与教育程度三重维度的交互效应,借助时间序列预测与面板回归方法,揭示青年群体与低教育水平劳动者在劳动力市场中的脆弱性。相关热点与联合国可持续发展目标第八项“体面工作与经济增长”密切呼应,政策制定者利用该数据评估技能错配与性别鸿沟的演变趋势。其意义在于以跨国可比口径推动精准就业干预,并为机器学习模型提供高维、长时序的基准数据,赋能不平等测度与政策模拟研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务