遇见数据集

electricsheepasia/asia-ilo-une-tune-sex-edu-cct-nb-unemployment-by-sex-education-and-citizenship-thou

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)的ILOSTAT数据库的失业统计数据,专注于亚洲地区。它提供了3,918个观测值,覆盖18个亚洲国家(如亚美尼亚、塞浦路斯、伊朗等),时间跨度为1999年至2024年。数据以年度频率收集,核心指标为UNE_TUNE_SEX_EDU_CCT_NB,即按性别、教育和公民身份分类的失业人数(单位:千)。数据集包括详细的分类维度,如性别(总计、男性、女性)、教育水平和公民身份,并通过列如ref_area(国家代码)、time(年份)、obs_value(观测值)等结构化存储。数据来源包括国家劳动力调查等,经过ILO的标准化处理,并包含数据质量说明(如可靠性标志)。该数据集旨在支持表格分类、回归和时间序列预测等任务,适用于劳动力市场分析研究。

This dataset contains unemployment statistics from the ILOSTAT database of the International Labour Organization (ILO), focusing on Asia. It includes 3,918 observations across 18 Asian countries (e.g., Armenia, Cyprus, Iran) spanning 1999–2024. The data is collected annually, with the core indicator being UNE_TUNE_SEX_EDU_CCT_NB—unemployment disaggregated by sex, education, and citizenship (in thousands). It features detailed breakdowns such as sex (total, male, female), education level, and citizenship, structured with columns like ref_area (country code), time (year), and obs_value (observed value). Sources include national labor force surveys, harmonized by ILO, and data quality notes (e.g., reliability flags). The dataset is designed for tasks like tabular classification, regression, and time-series forecasting, supporting labor market analysis.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-tune-sex-edu-cct-nb-unemployment-by-sex-education-and-citizenship-thou 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接提取指标“UNE_TUNE_SEX_EDU_CCT_NB”,并依据亚洲ISO3国家代码进行筛选,最终由Electric Sheep Asia以机器学习就绪的Parquet格式重新封装发布。数据采集过程严格遵循国际劳工统计学家会议(ICLS)的定义标准,对源自国家劳动力调查、家庭收入调查等原始微观数据进行调和处理,并以source.label字段标注来源,确保可追溯性。观测覆盖1999至2024年,共3,918条记录,涉及18个亚洲国家,反映了国际移民失业状况的年度变化。
特点
数据集以表格形式组织,囊括性别、教育程度和公民身份三个维度的分解变量,其中性别维度提供总计、男性和女性三类取值,教育及公民身份分类则按需非空呈现。观测值以千人为单位,单位为float64类型,辅以观测状态标志(如临时性、不可靠性)和分类注释,用以提示数据质量。地理覆盖集中于亚洲,其中塞浦路斯、伊朗和格鲁吉亚等国记录最为丰富,时间跨度自1999年延续至2024年,为分析移民失业动态提供了长时序面板基础。
使用方法
研究者可借助Hugging Face的datasets库以单行代码加载数据集,并转换为Pandas数据框进行灵活处理。典型操作包括按国家代码筛选子集、提取单一指标的时序趋势,以及通过透视表构建国家与年份的矩阵视图。该数据集适用于表格分类、回归及时间序列预测任务,支持失业率影响因素的探索性分析和跨国比较研究。使用时应留意观测状态标志和来源注释,以准确解读数据质量与系列中断情形。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场的统计监测与标准化工作,其维护的ILOSTAT数据库汇集了二百余个经济体的就业、失业、工资及劳动条件等核心指标。该数据集由Electric Sheep Asia于2026年从ILOSTAT REST API中提取并重新封装,聚焦亚洲十八个国家1999至2024年间按性别、教育程度和公民身份分类的失业人口数据,共计3918条观测记录。研究核心在于揭示移民身份与教育水平对失业风险的交互影响,为理解亚洲地区劳动力市场分层与移民融入提供量化基础。该数据集依托国际劳工统计学家会议(ICLS)定义进行跨国协调,对移民就业政策比较研究具有重要参考价值。
当前挑战
该数据集所回应的领域问题在于移民身份与教育程度如何共同塑造失业风险,这一议题在亚洲多元劳动力市场中尤为复杂。构建过程中的挑战首先体现为跨国数据协调:各国劳动力调查在教育分类与公民身份界定上存在显著异质性,ILO需借助ICLS标准进行事后标准化,部分观测值仍被标注为不可靠或序列中断。其次,数据覆盖呈现高度不均衡,塞浦路斯与伊朗占据近半数观测,而泰国、老挝等国仅有一年数据,时序分析可行性受限。再者,分类变量非空值仅在该指标发布细分维度时出现,缺失机制非随机,对建模中的插补与偏差校正构成实质困难。
常用场景
经典使用场景
在劳动经济学与移民研究的交叉领域中,该数据集最为经典的运用场景在于构建亚洲地区按性别、教育程度与公民身份三重维度解构的失业率面板数据,进而支撑跨国别、跨时段的比较分析。研究者借助其涵盖十八个亚洲国家、一九九九年迄二零二四年的三千九百余条观测,可系统描绘不同公民身份群体在劳动力市场中的失业风险分布图谱。
衍生相关工作
基于该数据集,后续研究衍生出多条经典工作脉络。其一为跨国移民失业率收敛性分析,检验亚洲区域劳动力市场一体化程度;其二为教育-公民身份交互效应的多层模型建构,揭示制度环境对移民就业结果的调节机制;其三为时间序列预测模型的基准数据集,用以评估机器学习方法在劳动市场指标外推中的表现。
数据集最近研究
最新研究方向
在全球劳动力市场结构性转型与国际移民治理深化的背景下,该数据集所承载的亚洲18国按性别、教育程度与公民身份交叉分类的失业统计,正成为劳动经济学与迁移研究交汇的前沿阵地。近期研究聚焦于移民身份在失业风险中的调节效应,借助教育分层与性别维度的嵌套结构,识别非公民群体在特定教育层级所遭遇的系统性就业壁垒,并据此检验技能错配假说与歧视性劳动力市场理论。时序跨度1999至2024年为双重差分与合成控制等因果推断方法提供了充足窗口,使研究者得以评估金融危机、疫情冲击及各国移民政策调整对脆弱群体失业轨迹的异质性影响。该数据集亦推动SDG 8体面劳动目标的国别监测与跨国比较,为包容性劳动力市场政策的精准设计提供实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务