electricsheepasia/asia-ilo-emp-5nif-sex-age-nb-informal-employment-by-sex-and-age-19th-icls-thous
收藏数据链接:
官方服务:
资源简介:
该数据集包含774个观测值,涉及18个亚洲国家的非正规就业数据,时间跨度为2014年至2025年,覆盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤亚洲国家代码,涵盖了按性别和年龄分类的非正规就业统计信息(单位:千)。数据集适用于表格分类、回归和时间序列预测等机器学习任务,并提供了详细的数据字段和用法示例。
This dataset contains 774 observations of informal economy data across 18 Asia countries, spanning 2014–2025, covering 1 distinct indicator. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), extracted via API and filtered to Asian country codes, providing statistics on informal employment by sex and age (in thousands). The dataset is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting, and includes detailed field descriptions and usage examples.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
该数据集由Electric Sheep Asia团队从ILOSTAT官方REST API直接抓取并重新打包而成。原始数据源自国际劳工组织(ILO)基于第19届国际劳工统计学家会议(ICLS)定义所协调的各国劳动力调查、家庭收入调查及行政记录等微观数据。通过筛选亚洲地区的ISO3国家代码,最终整合了18个亚洲国家在2014至2025年间关于非正规就业的观测值,共计774条记录。数据以Parquet格式存储,确保了高效的读写性能与机器学习兼容性。
特点
数据集的核心特点在于其聚焦于亚洲地区的非正规就业状况,并依据性别与年龄维度进行精细分解。指标仅包含“EMP_5NIF_SEX_AGE_NB”一项,但提供了性别(总、男性、女性、其他)和年龄(如15岁以上青少年与成人)的交叉分类。此外,数据来源明确标注了每个观测值背后的具体调查或行政记录出处,增强了透明度与可追溯性。所有记录均为年度频率,且优先选用ILO认定的“最佳来源”数据,以保障质量。
使用方法
用户可通过HuggingFace Datasets库简洁地加载数据:使用`load_dataset`函数即可获取包含全部观测值的训练集,并利用`to_pandas()`方法转换为Pandas DataFrame进行后续分析。典型用法包括按国家筛选(如过滤印度尼西亚的IDN代码)、针对单一指标进行时间序列可视化,或通过pivot_table构建国家与年份的交叉矩阵。数据集包含丰富的元数据列(如sex、classif1及其标签),便于进行多维度的统计与回归建模。
背景与挑战
背景概述
非正规就业是发展中国家劳动力市场的核心特征,尤其在亚洲地区,其规模与动态变化对理解就业质量、社会保障覆盖及可持续发展目标(SDGs)的进展至关重要。国际劳工组织(ILO)自2019年起通过第19届国际劳动统计学家会议(ICLS)框架,持续收集并统一各国非正规就业数据。本数据集由Electric Sheep Asia于2025年整理发布,基于ILOSTAT官方API,聚焦亚洲18个国家的774条观测记录,涵盖2014至2025年间按性别和年龄分层的非正规就业人数(千人为单位)。该数据集通过标准化处理,为区域比较和时序分析提供了可靠基础,显著推进了非正规经济领域的研究与政策制定。
当前挑战
构建该数据集面临多重挑战。首先,非正规就业的定义与统计口径在不同国家间存在显著差异,ILO虽通过ICLS框架进行协调,但数据源(如劳动力调查)的方法论更新常导致序列断点(如‘Break in series’标识),影响纵向可比性。其次,亚洲各国数据可获取性不均,部分国家(如阿富汗、韩国)仅有单一年份数据,而缺乏连续序列限制了面板分析的应用。此外,数据集仅包含年度频率,缺失更高时间分辨率(月度或季度)的观测,对捕捉短期波动构成局限。数据质量方面,观测值中的‘best source’选择规则虽保证了权威性,但多源数据融合可能引入偏差,需结合来源标签进行谨慎解读。
常用场景
经典使用场景
在劳动经济学的实证研究领域中,非正规就业的跨国比较分析长期受困于数据口径不一与可得性薄弱。该数据集聚焦亚洲18个国家2014至2025年间按性别与年龄分层的非正规就业人数,依托国际劳工组织ILOSTAT数据库的标准化统计框架,为研究者提供了一个时间序列完整、分类维度清晰的面板数据。借助这一资源,学者能够系统描绘亚洲地区非正规就业的时空演化图谱,分析人口结构变迁对劳动力市场形态的影响,从而揭示经济发展阶段与就业非正规化之间的内在关联。
实际应用
面向政策制定与国际发展实务,该数据集的价值体现于其对劳动力市场监测与干预评估的直接支持。国际组织与政府机构可利用其年度观测值追踪各国非正规就业的演进趋势,识别因性别或代际失衡所导致的脆弱群体,进而精准设计社会保障扩面方案与就业促进政策。此外,数据中附带的源调查标识与序列中断注释,为数据质量审计与多源融合建模奠定了可溯源基础,提升了在制定区域劳动力迁移与产业升级策略时的决策科学性。
衍生相关工作
围绕该数据集已涌现出一系列旨在提升其分析与整合能力的衍生工作。以Electric Sheep Asia为代表的机构对原始ILOSTAT接口数据进行了清洗与格式标准化,将其封装为可与HuggingFace Datasets工具链无缝对接的Parquet格式,大幅降低了劳动经济研究者的数据获取成本。后续工作还在探索将非正规就业数据与教育水平、行业分类等辅助维度进行融合,构建面向亚洲地区的劳动力市场预测模型。此外,通过提供按国家与年度透视的矩阵变换样例,该数据集成为编写劳动经济学教学案例与开发自动报告系统的参考基准。
以上内容由遇见数据集搜集并总结生成



