遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-edu-dsb-nb-employment-outside-the-formal-sector-by-sex-educat

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲地区按性别、教育和残疾状况划分的非正规部门就业人数(千人)的统计数据。数据集涵盖17个亚洲国家,时间跨度为2006年至2024年,共包含3,059个观测值。核心指标为EMP_PIFL_SEX_EDU_DSB_NB,用于衡量非正规经济中的就业情况。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过过滤以仅包含亚洲国家。数据集经过Electric Sheep Asia重新打包,以统一模式提供,便于机器学习使用。数据包括国家代码、来源信息、指标代码、性别分类(总计、男性、女性等)、教育水平分类、残疾状况分类、观测年份、观测值及其状态标志等列。数据频率为年度,并包含数据质量说明,如来源选择和分类列的非空条件。

This dataset contains statistics on employment outside the formal sector by sex, education, and disability status (in thousands) for Asia. It includes 3,059 observations across 17 Asian countries, spanning the years 2006 to 2024. The core indicator is EMP_PIFL_SEX_EDU_DSB_NB, which measures employment in the informal economy. Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and filtered for Asian countries. The dataset is repackaged by Electric Sheep Asia with a normalized schema for machine learning readiness. It includes columns such as country codes, source information, indicator codes, sex classification (total, male, female, etc.), education level classification, disability status classification, observation year, observed values, and status flags. The data is annual in frequency and comes with caveats on data quality, including source selection and non-null conditions for disaggregation columns.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-edu-dsb-nb-employment-outside-the-formal-sector-by-sex-educat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口直接提取指标EMP_PIFL_SEX_EDU_DSB_NB的原始数据,并筛选出亚洲地区的ISO3国家代码。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查等微观数据进行标准化调和,数据经过Electric Sheep Asia的重新打包,以Parquet格式发布,涵盖2006至2024年间17个亚洲国家的3059条观测记录。
特点
数据集聚焦于非正规部门就业的性别、教育程度和残疾状况维度,具有显著的亚洲区域覆盖和多维分类特征。其时间跨度近二十年,包含年度频率的观测值,并附带来源标签、观测状态标志及详细的分类注释,便于追溯数据质量与修订情况。分类维度涵盖性别、教育水平和残疾状态,支持细粒度的不平等分析,数据规模适中,适合探索性研究与建模。
使用方法
用户可通过HuggingFace的datasets库以load_dataset函数加载数据集,并借助to_pandas转换为数据框进行灵活操作。典型用法包括按国家代码筛选特定区域数据,针对单一指标绘制时间序列趋势图,或利用透视表将数据重构为国家与年份的矩阵形式,以支持横截面与时间序列分析。数据亦可直接用于表格分类、回归或时间序列预测等机器学习任务。
背景与挑战
背景概述
非正规部门就业长期以来构成亚洲劳动力市场的显著特征,其规模与结构差异深刻映射出各国经济发展阶段、社会保障覆盖水平及教育资源配置的不均衡。国际劳工组织(ILO)依托其核心统计数据库ILOSTAT,系统整合各国劳动力调查微观数据,构建了涵盖性别、教育程度与残疾状况等多维度的非正规就业测度体系。该数据集由Electric Sheep Asia于2024年重新封装发布,覆盖17个亚洲国家、2006至2024年间共计3059条观测记录,旨在为计量分析与机器学习建模提供标准化、可直接调用的表格型数据资源。其核心研究价值在于揭示非正规就业的性别分化与教育梯度,为劳动经济学、发展研究及社会政策评估提供跨国可比的经验基础。
当前挑战
该数据集所回应的领域难题在于,非正规就业的跨国测度长期受制于定义分歧、调查口径异质及数据稀疏等结构性障碍,致使性别与教育维度的交互效应难以被稳健识别。构建过程中的具体挑战涵盖多个层面:各国劳动力调查在抽样设计、问卷模块与参考期设定上存在显著差异,ILOSTAT虽依据国际劳工统计学家会议(ICLS)标准进行协调,但原始数据的不一致性仍导致部分观测被标注为不可靠或存在序列断点;教育分类与残疾状况的界定在不同国家间尚未完全统一,非标准教育层级的注记频繁出现;此外,多数国家仅有个别年份的观测值,时序覆盖极不均衡,缺失值处理与面板结构构建面临严峻的方法论约束。
常用场景
经典使用场景
在劳动经济学与 Informal Economy 研究领域,该数据集依据国际劳工组织(ILO)第17届国际劳动统计学家会议(ICLS)决议,按性别、教育程度与残疾状况三维分层,系统记录亚洲17国2006至2024年非正规部门就业规模(千人)。其经典用法在于支撑跨国面板回归与时间序列分析,学者可借以刻画非正规就业的性别鸿沟、教育梯度及残障群体边缘化态势,例如借助 `pivot_table` 构建国别×年份矩阵以观测结构性演变轨迹。
解决学术问题
该数据集直击非正规就业测度中长期存在的口径不一与维度缺失难题。通过ILOSTAT的统一协调流程与来源标记机制,它有效化解了跨国比较中统计标准异质性对结论稳健性的干扰,并使残疾状况这一在既有劳动统计中常被忽略的维度得以系统纳入。其意义在于为检验教育回报递减假说、性别职业隔离理论以及结构性排斥机制提供了高分辨率的经验基础,推动非正规经济研究从总量估算迈向精细化分群分析。
衍生相关工作
依托该数据集,Electric Sheep Asia 进一步构建了覆盖亚洲的 ML-ready 数据层,衍生出非正规就业预测建模、性别就业差距分解以及教育与非正规性关联分析等系列工作。学者亦在其基础上探索残疾状况与就业形式的交互效应,并与ILOSTAT其他指标(如工资、工时、社会保护)数据集联动,形成多维度劳动市场脆弱性评估框架,为后续因果推断与政策仿真研究奠定数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务