遇见数据集

electricsheepasia/asia-ilo-une-tune-sex-edu-nb-unemployment-by-sex-and-education-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲38个国家从1970年至2025年间的15,161个观测值,涵盖1个特定指标:按性别和教育程度划分的失业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,包括国家代码、年份、失业数值、数据来源、性别分类、教育水平分类等字段。数据集主要用于表格分类、回归和时间序列预测等任务,适用于劳动力市场分析和经济研究。

This dataset comprises 15,161 observations from 38 Asian countries over the period 1970 to 2025, covering a single specific indicator: the number of unemployed individuals (in thousands) classified by gender and educational attainment. The data is retrieved from the ILOSTAT database of the International Labour Organization (ILO), and has undergone standardization, with fields including country code, year, unemployment figures, data source, gender classification, and educational level classification. This dataset is primarily utilized for tasks including tabular classification, regression, and time series forecasting, and is suitable for labor market analysis and economic research.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-tune-sex-edu-nb-unemployment-by-sex-and-education-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接拉取指标编码为UNE_TUNE_SEX_EDU_NB的原始记录,并依据亚洲ISO3国家代码进行筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调,数据集保留来源标签以实现可追溯性,最终由Electric Sheep Asia重新封装为机器学习就绪的Parquet格式。
使用方法
使用者可通过HuggingFace datasets库以load_dataset()函数直接加载数据,并转化为Pandas DataFrame进行灵活操作。常见用法包括按ref_area字段筛选特定国家、按indicator字段提取时间序列、利用pivot_table将数据重塑为国家与年份的矩阵形式,进而支持表格分类、回归及时间序列预测等任务。使用时应遵循CC-BY-4.0许可,并同时引用ILO原始来源与Electric Sheep Asia的再封装工作。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与推广,其核心数据库ILOSTAT汇集了200余个经济体的劳动力调查数据,成为劳动经济学与政策评估的权威基石。该数据集由Electric Sheep Asia于2025年重新封装发布,覆盖亚洲38个国家、1970至2025年间15,161条按性别与教育程度细分的失业观测记录,旨在为探究亚洲地区教育水平与性别差异对失业率的长期影响提供结构化、可复现的数据支撑。通过整合各国劳动力调查与行政记录,该数据集提升了跨国比较研究的透明度和可操作性,对劳动市场分析、教育政策制定及可持续发展目标监测具有重要参考价值。
当前挑战
失业率作为劳动市场健康的核心指标,其跨国与跨期比较长期受制于定义差异、调查方法不一及数据缺失等难题。该数据集所应对的领域挑战在于:如何将国际劳工统计学家会议(ICLS)的标准化定义有效应用于亚洲多元经济体的原始微观数据,以消除统计口径偏差,实现性别与教育维度的可比性。构建过程中,研究者需克服数据源异质性——包括不同国家劳动力调查覆盖范围悬殊、教育分类体系非标准化以及部分年份观测值标注为“不可靠”或“序列断裂”等障碍。此外,性别维度中“其他”类别数据的稀疏性、各年可用观测值的不均衡,以及非标准教育层级的注释处理,均对数据整合与后续分析提出了严谨的方法论要求。
常用场景
经典使用场景
在劳动经济学与性别研究的交汇处,该数据集凭借其对亚洲38个国家1970至2025年间失业人口的性别与教育程度双重解构,成为探究结构性失业与人力资本错配的经典素材。研究者常以面板数据分析为路径,将obs_value作为因变量,sex与classif1作为核心分组维度,构建跨国别、跨时段的失业动态比较框架,进而揭示不同教育层级劳动力在市场中的脆弱性差异。
解决学术问题
该数据集有效回应了劳动经济学中长期存在的性别失业差距与教育回报异质性难题。以往研究多受限于国别数据的碎片化与口径不一,而ILOSTAT依据国际劳工统计学家会议定义进行标准化协调,使得跨国的性别失业比率、教育层级失业分布得以在统一标尺下比较,为检验人力资本理论、歧视经济学假说以及结构性转型对女性就业的冲击提供了可靠的经验基础。
实际应用
政策制定者与国际组织可借助该数据集监测亚洲地区失业形势的演变,识别高失业风险群体并评估教育与培训政策的靶向效果。例如,通过追踪SEX_F与低教育层级组合的失业趋势,可为人社部门优化职业培训资源配置提供量化依据;世界银行、亚洲开发银行等在国别援助战略中亦可将此数据作为劳动力市场诊断的关键输入。
数据集最近研究
最新研究方向
在劳动经济学与发展经济学交叉领域,该数据集为探究亚洲地区失业结构与教育回报异质性提供了高粒度面板数据。前沿研究聚焦于利用性别与教育分层数据,结合时间序列预测模型,揭示不同教育层级劳动力市场脆弱性的演变规律,尤其是在经济波动与结构性转型背景下,低教育群体与女性失业的周期性敏感度差异。近期全球青年就业危机与技能错配议题升温,使该数据集成为评估亚洲各国教育政策与劳动力市场干预效果的关键实证基础,推动了基于机器学习的分层失业预测与政策模拟研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务