遇见数据集

electricsheepasia/asia-ilo-une-5eap-sex-age-rt-unemployment-rate-by-sex-and-age-19th-icls

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1,467个观测值,涉及26个亚洲国家在2014年至2025年期间的失业率数据,聚焦于按性别和年龄划分的失业率指标(基于第19届国际劳工统计学家会议定义)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API获取并过滤到亚洲国家。数据集包含详细列结构,如国家代码、指标代码、性别分类(总计、男性、女性)、年龄分类、观测年份、观测值(失业率百分比)以及数据来源和质量标志,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 1,467 observations of unemployment data across 26 Asia countries, spanning 2014–2025, covering the indicator Unemployment rate by sex and age -- 19th ICLS (%). Sourced from ILOSTAT, the ILOs central statistics database, it includes detailed columns such as country codes, indicator codes, sex disaggregation (total, male, female), age classification, observation year, observed values (unemployment rate percentage), and source and quality flags, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-5eap-sex-age-rt-unemployment-rate-by-sex-and-age-19th-icls 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接抽取`UNE_5EAP_SEX_AGE_RT`指标数据,并依据亚洲ISO3国家代码进行地理范围筛选。原始数据基于各国劳动力调查等微观资料,经第19届国际劳动统计学家会议(ICLS)定义进行统一规范化处理。由Electric Sheep Asia团队重新封装为Parquet格式,形成包含1,467条观测、覆盖26个亚洲国家、时间跨度为2014至2025年的清洁表格数据集。
特点
数据集聚焦于按性别和年龄分层的失业率指标,提供唯一代码`UNE_5EAP_SEX_AGE_RT`,并以百分数呈现。数据以年度频率记录,涵盖26个亚洲国家,其中新加坡、日本、塞浦路斯等国观测数量最为丰富。表中包含`sex`(性别拆分,共3个唯一值)和`classif1`(年龄等分类)等关键维度,并带有`source.label`列追溯原始数据来源。此外,数据质量标识如`obs_status`和`note_indicator`为用户提供了数据可靠性与方法论变更的透明参考。
使用方法
用户可通过HuggingFace `datasets`库的`load_dataset`函数便捷加载数据,并利用`to_pandas()`转化为DataFrame进行深入分析。典型使用场景包括按国家代码(如`ref_area == "IDN"`)筛选特定国家的时间序列,或按指示器代码对观测值进行排序与可视化。数据还支持透视表操作,可将表格重塑为国家×年份的矩形矩阵,便于进行跨区域比较与建模。整体而言,该数据集为劳动经济学与区域研究提供了即开即用的结构化数据源。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT于2025年整理发布,并由Electric Sheep Asia团队重新封装为机器学习就绪格式,聚焦于亚洲26个国家2014至2025年间基于第19届国际劳工统计学家会议(ICLS)定义的失业率数据,含1,467条观测值。失业率作为衡量劳动力市场健康程度的核心指标,在宏观经济分析、政策制定及可持续发展目标(SDG)追踪中占据关键地位,而亚洲作为全球经济增长最活跃且劳动力结构最为多元的区域,其分性别与年龄的细化失业率数据对深入理解结构性就业矛盾、性别不平等及青年就业困境具有不可替代的研究价值,为跨国家时间序列分析和区域比较研究提供了标准化、可复现的数据基础。
当前挑战
本数据集应对的核心领域挑战在于,亚洲各国在失业统计中普遍面临定义不统一、调查方法各异及数据频次不匹配的问题,19th ICLS标准的引入虽促进了概念协调,但不同国家的劳动力调查(LFS)在问卷设计、抽样框架及季节性调整上的差异仍可能导致跨国可比性偏差。构建过程中的主要挑战包括:从ILOSTAT API抽取时需处理多源数据冲突,ILO虽已筛选‘最佳来源’,但部分国家同年存在多个调查结果并非罕见;分类维度中年龄分组、性别划分等元数据在不同时期可能存在调整,需通过‘classif1’和‘obs_status’等标记字段进行溯源性修正;同时,观测值标记为‘B’或附有‘注记’的条目暗示数据中断或方法论修订,对构建连续时间序列形成约束,要求使用者审慎过滤异常值以确保模型训练可靠性。
常用场景
经典使用场景
该数据集涵盖了2014年至2025年间亚洲26个国家的失业率观测数据,按性别和年龄维度进行细分,是劳动经济学与区域发展研究中的宝贵资源。其最经典的使用场景在于利用面板数据结构,开展跨国别、跨时段的失业率动态比较分析。研究者可通过该数据集构建时间序列模型或固定效应回归,系统考察亚洲各国劳动力市场的周期性波动与结构性差异。此外,基于性别和年龄的细粒度分层,为探讨青年就业困境、性别不平等在劳动力市场的体现提供了数据支撑,使得分析不同群体面临的就业风险成为可能。
实际应用
在实际应用层面,该数据集为国际组织、政府机构及研究智库的政策评估与决策支持提供了关键工具。国际劳工组织可基于这些数据监测亚洲各国在体面劳动目标和可持续发展议程上的进展,识别青年失业率高企或女性劳动参与率偏低的国家进行重点干预。各国劳动部门能够利用历史趋势构建失业预警模型,制定更具针对性的就业促进方案。同时,金融机构与投资咨询公司可以借助失业率的时间序列变化,评估东南亚或东亚国家的经济稳定性,辅助跨境投资与市场风险管理。
衍生相关工作
基于该数据集,研究者已衍生出若干影响深远的相关工作。其中之一是利用面板数据分析亚洲各国失业率与宏观经济变量之间的互动关系,例如检验奥肯定律在亚洲地区的适用性或评估外商直接投资对东道国就业质量的影响。另一类经典工作聚焦于劳动力市场性别差异的跨国比较,通过构建混合效应模型或分位数回归,定量分析教育水平、产业结构与文化因素对女性失业率的调节作用。这些研究不仅深化了对亚洲劳动力市场运行机制的理解,也为全球劳动经济学理论的本土化修正提供了实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务