遇见数据集

electricsheepasia/asia-ilo-emp-2tru-sex-age-rt-time-related-underemployment-rate-by-sex-and-age-i

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲49个国家从2005年至2027年的时间相关不足就业率数据,由国际劳工组织(ILO)建模估计,按性别和年龄分类。数据包括10,062条观测值,核心指标为“EMP_2TRU_SEX_AGE_RT”,即时间相关不足就业率(百分比)。数据来源于ILOSTAT数据库,经过标准化处理,涵盖国家代码、年份、观测值、性别(总计、男性、女性)和年龄分类(如15岁以上)等维度。数据集旨在为劳动统计、经济研究和机器学习应用提供结构化、标准化的时间序列数据。

This dataset contains time-related underemployment rate data for 49 Asian countries from 2005 to 2027, based on ILO modelled estimates, disaggregated by sex and age. It includes 10,062 observations, with the core indicator being EMP_2TRU_SEX_AGE_RT, representing the time-related underemployment rate (%). The data is sourced from the ILOSTAT database, harmonized using ILO standards, and covers dimensions such as country codes, year, observed values, sex (total, male, female), and age classifications (e.g., 15+). The dataset is designed to provide structured, standardized time-series data for labor statistics, economic research, and machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-2tru-sex-age-rt-time-related-underemployment-rate-by-sex-and-age-i 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API直接获取指标EMP_2TRU_SEX_AGE_RT的数据,并依据亚洲ISO3国家代码进行地理筛选。原始数据基于各国劳动力调查的微观数据,经ILO依据国际劳工统计学家会议(ICLS)定义进行标准化处理,以确保跨国可比性。数据集包含10,062条观测记录,覆盖49个亚洲国家,时间跨度从2005年至2027年,每条记录均包含国家、性别、年龄分层、观测值及来源标记等字段,由Electric Sheep Asia进行重新打包和规范化,以Parquet格式发布。
特点
该数据集聚焦于“时间相关未充分就业率”这一劳动力市场核心指标,按性别(总、男、女)和年龄组(如15岁以上青年与成年人)进行精细分层,为分析亚洲区域劳动力利用不足的结构性特征提供了高颗粒度的时序数据。其突出特点在于结合了ILO的模型估算方法,确保了数据在时间和空间上的连续性与可比性,尤其适用于跨国产出缺口、性别差异及青年就业困境的比较研究。此外,数据来源透明,每条记录均附有来源代码与标签,便于追溯与质量评估。
使用方法
用户可通过HuggingFace的datasets库快速加载该数据集,使用`load_dataset`命令即可获取训练集并转换为Pandas DataFrame进行后续分析。典型应用包括按国家过滤以探索特定经济体的时序趋势,例如筛选印度尼西亚(IDN)的数据;或按指标排序后绘制时间序列图以观察变化。该数据集也支持透视操作,可将数据重塑为国家×年份的矩阵,便于进行面板数据回归或可视化聚类分析。所有操作均基于开源工具,无需额外预处理,极大降低了研究门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建并由Electric Sheep Asia重新打包发布于2026年,聚焦亚洲49个国家和地区2005至2027年间的时间相关未充分就业率(按性别和年龄分层的ILO模型估计值)。时间相关未充分就业率作为衡量劳动力市场闲置产能的核心指标,能够捕捉传统失业率遗漏的隐性劳动不充分现象,对理解亚洲区域发展不平衡与就业质量差异具有关键意义。数据集涵盖10,062条观测记录,依托ILOSTAT数据库的标准化方法(基于ICLS定义)整合各国劳动力调查微观数据,为跨国比较和时序分析提供了统一基础,对发展经济学、劳动经济学及可持续生计研究领域具有持久影响力。
当前挑战
该数据集在领域问题层面主要挑战包括:传统失业率指标无法刻画亚洲地区普遍存在的非正规就业和隐性失业,而时间相关未充分就业率虽可补充分析,却面临各国统计口径差异、数据可比性不足的难题。构建过程中遭遇的挑战涵盖:不同国家的原始调查数据因采集年份、问卷设计和样本框架的差异需进行ILO统计部门的复杂协调与模型估算;来自多源数据的缺失值、离群值与观测状态标签(如临时值、不可靠值)增加了清洗与校验难度;此外,在基于API抽取并限定至亚洲国家代码时,需处理部分小国数据的稀疏性和时间序列不连续性问题,以确保分析稳健性。
常用场景
经典使用场景
该数据集收录了2005年至2027年间亚洲49个国家的时间相关就业不足率,并按性别与年龄进行了细致分组,总计包含10,062条观测记录。研究者常将其作为面板数据,利用国家—年份—性别—年龄的四维结构,构建广义线性模型或机器学习回归模型,以探究经济发展水平、劳动力市场政策、性别平等程度等因素对非充分就业形态的影响。同时,该数据集也适用于时间序列预测任务,如基于历史波动规律,采用ARIMA、Prophet或Transformer架构,对特定亚洲国家的未来就业不足趋势进行推估。
解决学术问题
在劳动经济学领域,该数据集的核心贡献在于填补了亚洲地区时间相关就业不足率这一精细指标的公开数据空白,使学者得以突破仅关注失业率的传统分析框架。它为检验劳动力吸收效率、评估灵活就业形态下的劳动过剩问题提供了量化基础。借助不同性别的细分数据,研究能够深入揭示女性在职场中面临的非自愿性工时不足困境,推动了性别平等相关的实证分析。基于ILO标准化方法论构建的这一跨时数据库,还帮助研究者控制了各国统计口径差异,提升了比较研究的内在效度。
衍生相关工作
以该数据集为基础,研究者已衍生出多项经典学术前沿工作。有团队将其与ILO发布的工资面板数据、世界银行的制度质量指标相融合,构造了亚洲工作时间不充分的驱动因素多重中介模型,发现产业结构转型路径与劳动力市场规制强度是预测就业不足率的关键变量。另一项代表性研究聚焦性别维度的异质性,借助差异中的差异(DID)方法,量化了新冠疫情对亚洲男性和女性就业不足率冲击的非对称性及其恢复轨迹。部分学者还将其作为基准数据集,评估不同机器学习算法(如LightGBM与XGBoost)在劳动力市场不平衡状态预测中的泛化能力,推动了劳动统计与计算社会科学的交叉发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务