遇见数据集

electricsheepasia/asia-ilo-une-deap-sex-age-cct-rt-unemployment-rate-by-sex-age-and-citizenship

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家按性别、年龄和公民身份划分的失业率百分比数据,涵盖1999年至2025年期间的9,449个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。核心指标为UNE_DEAP_SEX_AGE_CCT_RT,表示失业率按性别、年龄和公民身份细分。数据集包括国家代码、年份、观测值、性别分类(总计、男性、女性)、年龄分类(如15岁以上)、公民身份分类(总计)等字段,并包含数据来源、观测状态和相关注释信息。数据以年度频率提供,经过ILO harmonisation处理,确保符合国际劳工统计学家会议(ICLS)定义。

This dataset contains unemployment rate percentages disaggregated by sex, age, and citizenship for 26 Asian countries, with 9,449 observations spanning the years 1999 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asian countries. The core indicator is UNE_DEAP_SEX_AGE_CCT_RT, representing unemployment rate by sex, age, and citizenship. The dataset includes fields such as country codes, year, observed values, sex classification (total, male, female), age classification (e.g., 15 and above), citizenship classification (total), along with data sources, observation status, and relevant notes. The data is provided at annual frequency, harmonized by ILO to align with International Conference of Labour Statisticians (ICLS) definitions.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-deap-sex-age-cct-rt-unemployment-rate-by-sex-age-and-citizenship 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,依托其标准化数据采集与协调体系构建而成。原始数据通过ILOSTAT的REST API接口直接获取,并依据亚洲ISO3国家代码进行筛选,最终由Electric Sheep Asia团队进行重包装与ML就绪化处理。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行统一调和,确保指标的可比性与溯源性,数据来源在source.label列中予以标注,涵盖1999年至2025年间的9449条观测记录。
使用方法
用户可通过HuggingFace的datasets库以单行代码加载数据集,并转换为Pandas DataFrame进行灵活操作。典型用法包括:按国家代码筛选特定区域数据,例如提取印度尼西亚的记录;针对单一指标绘制时间序列图以观察趋势;或利用透视表功能将数据重塑为国家与年份的矩阵形式,便于跨国家比较。数据集支持表格分类、回归及时间序列预测等任务,使用时应留意观测状态标志与注释列,以正确处理临时性或不稳定数据,同时建议引用原始ILO来源及Electric Sheep Asia的再包装工作。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计的标准化与传播,其ILOSTAT数据库是覆盖200余个经济体、跨越数十年劳动统计的权威来源。在此背景下,Electric Sheep Asia于2025年对ILOSTAT中失业率指标进行系统性提取与重构,发布了覆盖26个亚洲国家、1999至2025年间9449条观测的失业率数据集,按性别、年龄和公民身份三重维度细分。该数据集直面亚洲移民与本土劳动力市场差异的研究空白,为揭示公民身份在就业脆弱性中的角色提供了关键数据基础,有力支撑了劳动力市场分层、移民融入及社会保护等议题的实证分析。
当前挑战
该数据集所应对的核心领域问题在于失业率的多维异质性刻画与跨国可比性,具体挑战包括:公民身份维度的数据在多数亚洲国家存在系统性缺失,非公民与移民群体的失业统计常被排除或归入模糊类别,导致细分分析面临样本稀疏与代表性不足。构建过程中,源数据来自各国家庭调查和劳动力调查,其问卷设计、年龄分组、公民身份定义及参考期存在显著差异,ILO虽经国际劳工统计学家会议标准协调,仍需大量数据清洗、指标映射和缺失值处理。同时,1982年以来ILO失业定义多次修订导致的序列断点,以及部分年份仅提供非标准年龄组或临时估值,进一步加剧了时序比较与方法论一致性的困难。
常用场景
经典使用场景
在劳动经济学与移民研究的交汇处,该数据集凭借按性别、年龄及公民身份交叉分类的失业率时序记录,成为刻画亚洲劳动力市场分层结构的经典素材。研究者常将其用于面板数据分析,通过固定效应模型或时间序列分解,考察不同公民身份群体(如本国公民、外籍劳工)在失业风险上的系统性差异,并揭示性别与年龄维度上的交互效应。其覆盖二十六国、跨逾四分之一世纪的特点,为跨国比较与趋势追踪提供了扎实的观测基础。
解决学术问题
该数据集有效回应了移民融入与劳动力市场排斥这一长期学术争论。传统研究常受限于公民身份维度的数据缺失,难以精确量化外籍群体与本地居民之间的失业率缺口。本数据集通过标准化协调的ILO统计框架,使研究者能够控制年龄与性别构成,分离出公民身份本身的净效应,进而检验歧视假说、人力资本假说与制度分割理论。其意义在于将移民就业脆弱性从描述性议题提升为可检验的因果推断问题,为政策评估提供了微观证据基础。
实际应用
在政策制定与劳动力市场监测领域,该数据集为国际组织与亚洲各国政府提供了识别高风险群体的实证工具。就业服务机构可依据年龄与公民身份交叉的失业率异常值,精准定位青年外籍劳工等脆弱人群,优化职业培训与就业匹配资源的配置。此外,跨国企业人力资源部门可借助国别时序数据评估东道国劳动力市场的结构性风险,而社会保障机构则能据此调整失业保险的覆盖范围与给付标准,推动包容性就业政策的落地。
数据集最近研究
最新研究方向
在全球劳动力市场结构性变革与跨境人口流动日益频繁的背景下,该数据集为解析亚洲地区移民与本土居民在失业率上的异质性提供了细粒度的时间序列支撑。当前前沿研究聚焦于利用性别、年龄与公民身份的多维交叉分层,借助面板回归与机器学习方法识别移民群体在就业市场中的结构性弱势,尤其关注海湾国家与东南亚经济体在客籍劳工制度下的失业率分化机制。该数据集涵盖1999至2025年26个亚洲国家的9,449条观测,其长时段与多维分类特征契合了国际迁移研究中关于移民经济融入与劳动力市场分割的热点议题,为政策评估与跨国比较研究提供了可复现的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务