遇见数据集

electricsheepasia/asia-ilo-une-tune-sex-edu-mts-nb-unemployment-by-sex-education-and-marital-status-t

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含91,492个观测值,涉及失业数据,覆盖34个亚洲国家,时间跨度为1970年至2025年,包含1个不同指标:UNE_TUNE_SEX_EDU_MTS_NB,即按性别、教育程度和婚姻状况划分的失业人数(千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API提取并过滤到亚洲国家代码,涵盖了国家代码、来源、指标、性别、分类变量、年份、观测值等列,支持按性别等维度进行分解,数据为年度频率,并包含数据质量注释如观测状态标志。数据集由Electric Sheep Asia重新打包,以方便机器学习使用。

This dataset contains 91,492 observations of Unemployment data across 34 Asia countries, spanning from 1970 to 2025, covering 1 distinct indicator: UNE_TUNE_SEX_EDU_MTS_NB, which represents unemployment by sex, education and marital status (thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), extracted via REST API and filtered to Asia country codes. It includes columns such as country code, source, indicator, sex, classification variables, year, observed value, and observation status flags, with disaggregation dimensions like sex. The data is annual frequency and includes data quality caveats such as observation status labels. The dataset is repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-tune-sex-edu-mts-nb-unemployment-by-sex-education-and-marital-status-t 数据集图片
构建方式
该数据集以国际劳工组织(ILO)核心统计数据库ILOSTAT为唯一权威来源,通过其REST API接口直接提取指标代码为UNE_TUNE_SEX_EDU_MTS_NB的原始观测记录,并依据ISO 3166-1 alpha-3国家编码筛选出34个亚洲经济体,最终由Electric Sheep Asia完成模式归一化与Parquet格式封装。ILOSTAT在汇聚各国劳动力调查、家庭收入调查及行政记录的基础上,依照国际劳工统计学家会议(ICLS)定义对原始微观数据进行统一协调,每项观测均标注来源标签以确保可追溯性。
特点
数据集涵盖1970至2025年间亚洲地区失业人口的性别、教育程度与婚姻状况三维交叉分类数据,共计91,492条年度观测记录,覆盖34个国家。字段结构包含国家代码、来源名称、指标代码、性别分类、教育分类、婚姻状况分类、年份、观测值及各类质量状态与注释标签,其中性别维度提供总计、男性、女性及其他四类取值。数据以表格形式组织,单指标多维度分解特征显著,适用于分类、回归及时间序列预测等多类建模任务。
使用方法
研究者可借助HuggingFace datasets库以load_dataset函数直接加载该数据集,并通过to_pandas方法转换为数据框进行后续分析。针对特定国家的研究,可利用ref_area字段筛选目标经济体;针对时间序列建模,可选取单一指标并按time字段排序后绘制趋势图;针对面板数据分析,可借助pivot_table将数据结构重塑为国家与年份的交叉矩阵。数据采用cc-by-4.0许可协议发布,使用时须同时引用国际劳工组织原始来源与Electric Sheep Asia的再封装工作。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的系统化整理与传播,其ILOSTAT数据库已成为劳动经济学研究不可或缺的基础设施。在此背景下,Electric Sheep Asia于2026年对ILOSTAT原始数据进行重新打包,构建了覆盖34个亚洲国家、时间跨度自1970年至2025年、包含91,492条观测的亚洲失业数据集。该数据集以性别、教育程度和婚姻状况为核心分层维度,旨在为亚洲地区劳动力市场结构性差异的量化研究提供细粒度面板数据,对探究教育回报、性别就业差距及婚姻状态与劳动参与的关系具有重要支撑价值。
当前挑战
该数据集所回应的领域问题在于,亚洲各国劳动力市场统计长期存在口径不一、覆盖面参差、细分维度缺失等结构性难题,跨国可比的教育与婚姻状态失业数据尤为稀缺。其构建过程中的核心挑战包括:各国劳动力调查方法差异显著,ILO需借助国际劳工统计学家会议定义进行事后协调,数据来源的异质性可能导致时序断裂;部分国家特定年份的数据缺失或仅提供汇总层级,性别、教育及婚姻状况的交叉分类在多数经济体中并非普遍发布;观测状态标志显示部分数据点为暂定值或可靠性不足,直接建模时需审慎处理。
常用场景
经典使用场景
在劳动经济学与人口统计学的交叉领域,针对性别、教育程度与婚姻状况等多重维度剖析失业格局,始终是实证研究的核心命题。该数据集凭借其细粒度的分层变量与跨越半个世纪的时间序列,为刻画亚洲34国失业率的异质性特征提供了不可多得的量化基础。研究者惯常将其用于构建面板数据模型,以检验教育与婚姻状态如何交互作用于不同性别的劳动力市场表现,从而在宏观层面揭示结构性失业的演变轨迹。
实际应用
在政策制定与劳动力市场监测的实务场景中,该数据集成为政府机构与国际组织评估失业保障政策效果的重要工具。例如,社会保障部门可依据不同教育程度与婚姻状况群体的失业动态,精准识别需要优先干预的目标人群,进而优化职业培训与就业补贴的资源配置。同时,跨国企业及人力资源研究机构亦可借助该数据研判亚洲各国劳动力供给结构与失业风险,为投资布局与人才战略提供数据支撑。
衍生相关工作
基于该数据集,学界与业界衍生出一系列具有影响力的经典工作。一方面,研究者利用其分层维度构建了性别失业差距的分解模型,量化了教育结构变化对总体失业率波动的贡献度;另一方面,该数据被广泛整合进全球劳动统计数据库,用于训练失业率预测的机器学习模型,并支撑了关于亚洲婚姻状况与女性劳动参与率关系的多篇高被引论文。这些衍生工作不仅拓展了ILOSTAT数据的应用边界,也为后续微观调查数据的链接分析奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务