遇见数据集

electricsheepasia/asia-ilo-eip-5plf-sex-age-nb-potential-labour-force-by-sex-and-age-19th-icls-th

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲22个国家在2014年至2025年期间的潜在劳动力数据,具体按性别和年龄进行划分,遵循第19届国际劳工统计学家会议(ICLS)的定义,数据以千计。数据集来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖1,249个观测值,涉及一个独特指标(EIP_5PLF_SEX_AGE_NB),用于衡量劳动力利用不足的其他指标。数据包括国家代码、来源、指标、性别分类、年龄分类、观测年份和观测值等字段,适用于表格分类、回归和时间序列预测等任务。

This dataset contains potential labour force data for 22 Asian countries from 2014 to 2025, disaggregated by sex and age based on the 19th International Conference of Labour Statisticians (ICLS) definitions, in thousands. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), with 1,249 observations covering one distinct indicator (EIP_5PLF_SEX_AGE_NB) related to other measures of labour underutilization. The data includes fields such as country codes, sources, indicators, sex classifications, age classifications, observation years, and observed values, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-5plf-sex-age-nb-potential-labour-force-by-sex-and-age-19th-icls-th 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT数据库直接通过REST API获取,并经由Electric Sheep Asia团队重新打包与整理。原始数据源自各国劳动力调查、家庭收入调查等官方统计,依据第19届国际劳工统计学家会议(ICLS)定义进行标准化处理。数据筛选聚焦于亚洲22个国家的潜在劳动力指标,涵盖2014至2025年间的年度观测值,共计1249条记录。每个观测点均包含国家代码、性别、年龄分类、数据来源及质量标记等元信息,确保数据可追溯与可复现。
特点
该数据集的核心特色在于其聚焦于“劳动力利用不足的其他衡量指标”——即潜在劳动力(Potential labour force)的估算,为研究非传统就业形态和隐性失业提供了关键数据支撑。数据按性别(总、男、女)和年龄分组,便于进行细致的劳动参与率分析。来源标注清晰,每个观测值均附有数据采集机构、方法论修订记录及系列中断标记,提升了统计透明度和使用可靠性。覆盖22个亚洲经济体,时间跨度达12年,为区域比较与时间序列建模奠定了坚实基础。
使用方法
用户可通过HuggingFace的`datasets`库一键加载该数据集,调用`load_dataset()`即可获得可转换为Pandas DataFrame的训练集。适用于表格分类、回归分析及时间序列预测任务。典型操作包括:按国家过滤进行国别研究;按指标排序后绘制潜在劳动力随年份变化的趋势图;通过数据透视表构建国家×年份观测矩阵,便于面板数据分析。代码示例直观展示了基础的筛选、绘图与透视功能,降低了使用门槛,尤其适合劳动经济学与机器学习交叉领域的研究者快速开展实证探索。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Asia重新打包至HuggingFace平台,旨在提供亚洲地区潜在劳动力按性别与年龄分层的标准化统计信息。潜在劳动力是衡量劳动力未充分利用的重要指标,涵盖那些未在积极求职但有意愿且可使用的人群体,其数据对于理解亚洲劳动力市场的结构性特征与动态变化具有关键意义。数据集涵盖22个亚洲国家,时间跨度从2014年至2025年,包含1,249条观测值,基于第19届国际劳动统计学家会议(ICLS)定义进行标准化处理。作为ILOSTAT数据库的分支,该数据集为区域劳动力研究、政策评估与跨国家比较提供了统一、可靠的统计基础,在劳动经济学、发展经济学及国际比较研究中具有广泛影响力。
当前挑战
该数据集面临的核心领域挑战在于劳动力未充分利用的测度本身具有模糊性,潜在劳动力统计依赖于多国调查方法和定义的一致性,而各国在调查设计、数据采集频率及覆盖人群上的差异可能导致国家间数据可比性不足。构建过程中,ILOSTAT需将来自多种来源(如劳动力调查、行政记录)的微观数据依据ICLS标准进行调和,面临跨源数据一致性、年度频次与更细粒度数据(如季度或月度)的取舍、以及因国家政策或调查更新引发的时间序列断裂等障碍。此外,数据集中缺失值(如细分分类变量的空缺)以及观测状态标注(如阶段性或不可靠数据)均需研究者在使用前进行审慎的质量评估与预处理。
常用场景
经典使用场景
在劳动经济学与人口统计学研究中,该数据集常用于分析亚洲地区潜在劳动力规模的时空演变规律。研究人员可依托其按性别和年龄细分的人口结构特征,构建多元回归模型以量化劳动力闲置程度与宏观经济指标间的关联,或利用其时间序列属性开展趋势预测,从而揭示亚太新兴经济体在劳动参与率波动中的结构性问题。
解决学术问题
该数据集有效填补了亚洲区域劳动力剩余指标标准化对比分析的学术空白。它解决了跨国家庭调查方法不统一所致的统计口径差异问题,使学者得以在ILO定义的19届ICLS框架下,精准识别性别、代际与地域维度的劳动力蓄积差异。这一工作深化了学界对隐性失业及劳动资源错配现象的理解,为劳动力市场效率评估提供了可靠的经验证据。
衍生相关工作
该数据集衍生了若干具有影响力的研究工作,包括基于机器学习方法的亚洲劳动力非充分利用状态分类模型、结合性别差异的时间序列分解研究,以及将潜在劳动力指标纳入CGE模型以模拟劳动力市场冲击效应的政策仿真论文。同时,其标准化的数据结构促进了与ILOSTAT其他指标(如失业率、非正规就业占比)的联合分析,催生了多项关于劳动制度改革效果的跨国比较研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务