遇见数据集

electricsheepasia/asia-ilo-une-tune-sex-eco-edu-nb-unemployment-of-previously-employed-persons-by-sex

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲地区先前就业人员失业情况的表格型数据集,包含27,897个观测值,覆盖35个亚洲国家(如巴基斯坦、印度尼西亚、泰国等),时间跨度为1985年至2025年。核心指标为UNE_TUNE_SEX_ECO_EDU_NB,用于衡量按性别、先前经济活动和教育程度分类的先前就业人员的失业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集包含详细的元数据列,如国家代码、数据来源、性别分类(总计、男性、女性)、经济活动和教育分类、观测年份、数值及质量标志等。该数据集适用于机器学习任务,如表格分类、回归分析和时间序列预测,可用于研究亚洲劳动力市场趋势。数据以Parquet格式发布,遵循CC-BY-4.0许可。

This dataset is a tabular dataset on unemployment of previously employed persons in Asia, containing 27,897 observations across 35 Asian countries (e.g., Pakistan, Indonesia, Thailand) spanning 1985–2025. The core indicator is UNE_TUNE_SEX_ECO_EDU_NB, measuring unemployment of previously employed persons by sex, former economic activity, and education (in thousands). Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asian countries. It includes detailed metadata columns such as country codes, data sources, sex disaggregation (total, male, female), economic activity and education classifications, observation year, values, and quality flags. The dataset is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, useful for studying labor market trends in Asia. It is published in Parquet format under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-tune-sex-eco-edu-nb-unemployment-of-previously-employed-persons-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接提取指标UNE_TUNE_SEX_ECO_EDU_NB的原始观测记录,并依据ISO3国家代码筛选出亚洲地区的数据。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行统一标准化处理,每个观测值均标注来源以便追溯。Electric Sheep Asia在此基础上重新打包为Parquet格式,规范了模式结构,最终形成涵盖35个亚洲国家、时间跨度为1985至2025年的约2.8万条记录。
特点
数据集聚焦于曾就业人员的失业状况,按性别、前经济活动部门和教育程度进行多维分解,具备丰富的分类维度与时间序列特征。观测值以千人为单位,涵盖SEX_T、SEX_M、SEX_F三种性别分类,并包含数据质量标志、分类注释及来源注释等辅助信息。数据以年度频率发布,部分指标保留原始调查的可靠性标记,为劳动经济学研究、性别就业差距分析以及教育水平与失业风险关联的实证探索提供了结构化的跨国面板数据。
使用方法
研究者可通过HuggingFace的datasets库以单行代码加载数据集,并直接转换为Pandas数据框进行后续分析。典型操作包括按国家代码筛选特定经济体的时间序列,例如提取印度尼西亚的全部记录;或针对单一指标绘制失业率的年度趋势图。此外,利用透视表功能可将数据重构为国家与年份的交叉矩阵,便于开展跨国比较或面板回归。数据亦支持时间序列预测与表格分类等机器学习任务的直接调用。
背景与挑战
背景概述
在全球劳动力市场深刻变革的背景下,失业问题始终是劳动经济学与社会政策研究的核心议题。国际劳工组织(ILO)自成立以来即致力于构建跨国可比的劳动力统计体系,其ILOSTAT数据库汇聚了200余个经济体的调查与行政记录,成为该领域最具权威性的数据基础设施。本数据集由Electric Sheep Asia于2025年基于ILOSTAT REST API重新封装发布,聚焦亚洲35个国家1985至2025年间曾就业人员的失业状况,按性别、前经济部门与教育程度三维度展开,包含27,897条观测。该数据集为探究亚洲地区结构性失业、性别差异与人力资本错配等议题提供了长时段、细粒度的实证基础,对区域劳动政策评估具有重要参考价值。
当前挑战
该数据集所回应的领域问题在于:如何精准刻画曾就业群体的失业动态,并揭示性别、行业与教育水平之间的交互影响,从而弥补传统失业统计中对“前就业状态”信息刻画不足的缺陷。构建过程中的核心挑战在于跨国数据协调——亚洲各国劳动力调查在抽样设计、变量定义与报告标准上存在显著差异,ILO虽以国际劳工统计学家会议(ICLS)定义进行调和,仍难以完全消除测量误差。此外,部分国家时间序列存在断点,观测状态标注包含“不可靠”与“临时性”等旗标,教育分类的非标准层级亦增加编码复杂度。数据集对高维分类变量的稀疏覆盖,进一步对建模中的缺失值处理与偏差校正提出了方法学挑战。
常用场景
经典使用场景
在劳动经济学与人口统计学领域,针对曾就业人员失业问题的量化分析长期依赖跨国可比数据。该数据集源自国际劳工组织ILOSTAT的标准化统计,覆盖亚洲35个国家、1985至2025年间的27897条观测,按性别、前经济 activity 与教育程度三重维度细分。经典使用场景聚焦于面板数据回归与时间序列预测,研究者可通过load_dataset()直接载入,快速构建国家×年份矩阵,用以比较不同教育层级或经济部门退出者的失业风险差异,亦常用于性别失业鸿沟的长期演变刻画。
实际应用
在政策制定与劳动力市场监测中,该数据集为亚洲各国政府与国际组织提供了可操作的证据基础。就业服务机构可依据不同教育层次与前任经济部门的失业规模,精准设计再培训与就业匹配项目;社会保障部门可借助性别维度的时序趋势,评估失业救济覆盖的公平性。此外,数据支持构建区域失业预警指标,辅助跨国劳动力流动政策协调。其年度频率与长期覆盖范围,亦使其成为评估经济周期冲击与结构性改革对曾就业群体影响的实用工具。
衍生相关工作
围绕该数据集,已衍生出一系列劳动统计与机器学习交叉的经典工作。Electric Sheep Asia将其标准化为Parquet格式并发布统一数据卡,催生了多个亚洲劳动力市场面板分析项目。研究者利用其多维分类变量,开发了失业率预测模型与性别差异分解方法,部分工作将ILOSTAT指标与世界银行发展指标链接,探讨教育与部门结构转型的协整关系。这些衍生研究进一步巩固了ILOSTAT作为全球劳动统计基准的地位,并为后续亚洲就业政策评估提供了可复现的数据范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务