遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-ocu-edu-nb-employment-outside-the-formal-sector-by-sex-occupa

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家从2000年至2025年的非正规部门就业统计数据,共有81,725个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并过滤为亚洲国家。数据集涵盖一个核心指标:EMP_PIFL_SEX_OCU_EDU_NB,即按性别、职业和教育划分的非正规部门就业人数(以千计)。数据包括国家代码、国家名称、数据来源、指标代码、性别分类(如总计、男性、女性)、职业分类、教育分类、观测年份、观测值、观测状态及相关注释。数据集旨在提供亚洲地区非正规经济劳动力的详细分析,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 81,725 observations of informal economy employment data across 26 Asian countries, spanning the years 2000 to 2025. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via the ILOSTAT REST API and filtered to Asian ISO3 country codes. The dataset focuses on one key indicator: EMP_PIFL_SEX_OCU_EDU_NB, which represents employment outside the formal sector by sex, occupation, and education (in thousands). It includes columns such as country codes, country names, data sources, indicator codes, sex disaggregation (e.g., total, male, female), occupation classification, education classification, observation year, observed values, observation status flags, and related notes. The dataset is designed for detailed analysis of informal labor in Asia and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-ocu-edu-nb-employment-outside-the-formal-sector-by-sex-occupa 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接提取指标EMP_PIFL_SEX_OCU_EDU_NB的原始记录,并筛选亚洲ISO3国家代码,最终由Electric Sheep Asia重新打包为HuggingFace数据集。原始数据由ILO统计部门依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、住户收入调查等微观数据进行标准化处理,确保跨区域可比性;提取过程中保留来源标签和观测状态标记,以支持数据溯源与质量评估。
特点
数据集涵盖2000至2025年26个亚洲国家的81,725条观测记录,聚焦非正规部门就业的性别、职业与教育维度。数据以年度频率呈现,包含国家代码、来源信息、指标代码、性别分类、职业与教育分类变量、观测值及各类注释标签。分类维度提供性别(总计、男性、女性、其他)及职业、教育的细分层级,部分指标附带非标准教育水平、序列中断等方法论注释,便于用户识别数据一致性与可靠性。
使用方法
用户可通过HuggingFace的datasets库以load_dataset函数加载数据集,并转换为Pandas数据框进行后续分析。典型操作包括按国家代码筛选特定国家数据、按指标和时间排序构建时间序列、以及利用透视表生成国家与年份的二维矩阵。数据支持表格分类、回归和时间序列预测等任务,适用于劳动经济学、非正规就业性别差异及教育回报等实证研究,使用时需遵循CC-BY-4.0许可并引用ILO及Electric Sheep Asia。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计体系的构建与完善,其核心数据库ILOSTAT为监测非正规经济中的就业状况提供了权威数据基础。该数据集由Electric Sheep Asia于2025年重新封装发布,源自ILOSTAT的EMP_PIFL_SEX_OCU_EDU_NB指标,涵盖2000至2025年间26个亚洲国家的81,725条观测记录,按性别、职业与教育程度三维度细分。非正规部门就业是发展中国家劳动力市场的核心议题,直接关系体面劳动、社会保障与贫困减缓等可持续发展目标。该数据集的发布为亚洲地区非正规就业的量化研究与政策评估提供了跨国、长时序的标准化数据支撑,对劳动经济学与发展经济学领域具有重要参考价值。
当前挑战
该数据集所应对的领域挑战在于,非正规部门就业统计长期受限于定义分歧与测量口径不一,国际劳工组织虽通过国际劳工统计学家会议(ICLS)标准加以协调,但各国劳动力调查在抽样设计、覆盖范围与变量分类上仍存在显著异质性,导致跨国可比性面临结构性障碍。构建过程中的挑战同样突出:原始数据源自多国异构调查,需经ILOSTAT统一分类与最佳源筛选,部分观测存在方法修订导致的序列断裂或统计可靠性不足,且性别、职业与教育维度的交叉分类并非所有国家均完整发布,缺失值与不成对分类进一步增加了数据清洗与建模的复杂度。
常用场景
经典使用场景
在非正规经济部门就业的量化研究领域,该数据集构成了刻画亚洲劳动力市场非正规性的核心实证基础。研究者凭借其涵盖26个亚洲国家、2000至2025年、逾八万条观测的精细化结构,惯常将其用于分析不同性别、职业类别与教育水平下非正规就业的规模与演变趋势。经由按国家、年份及人口维度的交叉制表,该数据集支撑了劳动经济学中关于非正规部门性别隔离与技能分化的经典分析范式。
实际应用
在政策制定与劳动力市场监测的实务层面,该数据集为国际组织及各国劳工部门评估非正规经济规模、设计社会保障扩面政策提供了关键依据。其分性别与职业的细化数据可用于识别非正规就业中的脆弱群体,如低教育水平女性劳动者,进而支撑定向职业培训与体面劳动干预措施的规划。同时,时间序列结构便于追踪政策变动前后非正规就业比重的动态响应,服务于可持续发展目标中充分就业与体面工作的进展评估。
衍生相关工作
围绕该数据集,一系列衍生性研究得以展开,包括基于面板回归的非正规就业决定因素分析、运用时间序列模型对亚洲非正规部门演变趋势的预测,以及结合地理信息系统进行的次区域比较研究。Electric Sheep Asia所进行的标准化重构亦推动了机器学习方法在劳动统计表格数据上的应用探索,诸如分类与回归任务中的特征重要性评估,进一步拓展了非正规经济数据在计算社会科学中的使用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务