遇见数据集

electricsheepasia/asia-ilo-eap-2eap-sex-age-nb-labour-force-by-sex-and-age-ilo-modelled-estimates

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲49个国家从1990年至2027年的劳动力数据,具体为按性别和年龄划分的劳动力——ILO建模估计(以千计),共50,031个观察值,涵盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤到亚洲国家,包括国家代码、性别分类、年龄分类、年份和观察值等列,用于表格分类、回归和时间序列预测等任务。

This dataset contains 50,031 observations of labour force data across 49 Asia countries, spanning 1990–2027, covering 1 distinct indicator: Labour force by sex and age -- ILO modelled estimates, Nov. 2025 (thousands). It is sourced from ILOSTAT, the ILOs central statistics database, with data pulled via API and filtered to Asian countries, including columns for country codes, sex disaggregation, age classification, year, and observed values, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eap-2eap-sex-age-nb-labour-force-by-sex-and-age-ilo-modelled-estimates 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接提取指标代码为EAP_2EAP_SEX_AGE_NB的劳动力数据,并依据亚洲ISO3国家代码进行筛选。原始调查微观数据经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行协调处理,来源信息在source.label列中标记以确保可追溯性。最终由Electric Sheep Asia进行重新打包,生成包含50,031条观测记录的结构化表格数据。
特点
数据集覆盖49个亚洲国家,时间跨度为1990年至2027年,包含唯一劳动力指标及其按性别(总、男、女)、年龄(如15岁以上)等维度的分类数据。每个观测值均附有观测状态标志,指示数据是否经过调整或为临时值。数据为年度频率,当同一国家与年份存在多个来源时,使用ILO挑选的“最佳来源”,确保数据质量与一致性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载数据集,并转换为Pandas DataFrame进行后续分析。典型用法包括按国家代码过滤子集、针对特定指标进行时间序列可视化,或通过透视表构建国家×年份的观测值矩阵。数据集采用cc-by-4.0许可协议,使用时需同时引用ILO原始数据来源及Electric Sheep Asia的重新打包版本。
背景与挑战
背景概述
国际劳工组织(ILO)下属的ILOSTAT数据库是全球劳动统计领域的权威数据源,其发布的劳动力参与率、失业率等核心指标为各国制定就业政策与可持续发展目标监测提供了关键依据。在这一框架下,由Electric Sheep Asia于2026年基于ILO建模数据重新打包发布的“亚洲劳动力按性别与年龄分布(ILO模型估计,2025年11月版)”数据集,聚焦1990年至2027年间49个亚洲国家的劳动力总量,共包含50031条观测。该数据集以ILO第19届国际劳动统计学家会议(ICLS)定义为准绳,通过标准化接口从ILOSTAT REST API直接抽取,并统一为机器学习就绪的Parquet格式。其核心研究问题在于帮助研究者便捷获取高质量、可对比的亚洲劳动力时间序列数据,以支持区域经济分析、劳动力市场建模以及性别平等议题的量化研究。该数据集因其覆盖长周期、多区域以及标准化处理,在劳动经济学和计算社会科学领域具有重要参考价值。
当前挑战
该数据集在应用中主要面临三重挑战。一是领域问题层面的复杂整合需求:亚洲国家在劳动力调查方法、数据采集频率和统计口径上存在显著差异,ILO虽然采用ICLS定义进行协调,但不同国家原始数据来源(如劳动力调查、行政记录)的质量和可用性不一,导致建模估计值可能引入系统性偏差。二是构建过程中的技术挑战:从ILOSTAT的庞大数据库中精确筛选出覆盖49个亚洲国家的特定指标,需要处理API调用中的异步延迟、数据一致性校验以及缺失值填充问题;此外,将跨年度、跨性别与年龄分组的非平衡面板数据重塑为规整的表格结构,并保留源标签(source.label)以便于溯源性,增加了数据清洗的复杂性。三是应用层面的统计挑战:该数据集包含调整值(obs_status为'A'),用户需谨慎区分原始调查数据与模型估计值的差异,避免在不适宜的场景下直接使用而忽视估计不确定性。
常用场景
经典使用场景
该数据集涵盖了1990年至2027年间亚洲49个国家的劳动力人口数据,按性别和年龄进行细致分解,是时间序列预测与面板数据分析的经典资源。研究者常借助这些观测值构建劳动力供给模型,评估人口结构变迁对就业市场的动态影响,或运用回归分析探讨经济发展阶段与劳动参与率之间的内在关联。
解决学术问题
该数据集有效解决了亚洲地区长期缺乏标准化、可比较的劳动力统计数据的困境。它使得学者能够系统性地研究性别差异在劳动力市场中的演化趋势,量化人口老龄化对劳动供给的冲击,并检验国际劳工标准在不同发展水平经济体中的实施效果。其跨越近四十年的纵向观测为宏观劳动经济学提供了坚实的数据基础。
衍生相关工作
基于该数据集的标准化格式与广泛覆盖范围,衍生出了多项辅助性研究工作。例如,有学者将其与世界经济数据库整合以构建跨国劳动弹性面板,也有人基于此开发了用于劳动力供需预测的机器学习基线模型。此外,Electric Sheep Asia的重新打包工作本身即为一项重要的数据工程贡献,使得研究者得以利用HuggingFace的`load_dataset()`接口直接调用,极大降低了数据获取与预处理的门槛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务