遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-edu-dsb-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲17个国家在2006年至2024年间关于非正规经济的3,058个观测值,核心指标为“按性别、教育程度和残疾状况划分的非正规部门就业比例(%)”。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API提取并过滤至亚洲国家。数据集包含国家代码、性别(总计、男性、女性、其他)、教育程度(总计)、残疾状况(总计)等分类变量,以及观测年份、观测值、数据状态标志等字段。数据经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化处理,并标注来源以确保可追溯性。

This dataset contains 3,058 observations of informal economy data across 17 Asia countries, spanning 2006–2024, covering the indicator Share of employment outside the formal sector by sex, education and disability status (%). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Asia ISO3 country codes. It includes disaggregation dimensions such as country codes, sex (total, male, female, other), education (total), disability status (total), along with observation year, value, and status flags. The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions, with source information provided for traceability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-edu-dsb-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦亚洲地区非正规部门就业占比这一核心指标,细化了性别、教育程度与残疾状况的分层维度。数据经由ILOSTAT REST API直接抽取,并按亚洲国家的ISO 3166-1 alpha-3代码进行地域筛选,同时借助国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行标准化调和,确保跨地域、跨时间的可比性。数据整理过程中,来源信息被详尽标注于`source.label`列,以供溯源。最终,数据以Parquet格式封装,通过HuggingFace数据集接口提供便捷访问。
特点
该数据集涵盖了17个亚洲国家、2006至2024年间共3058条观测记录,时间跨度近二十年,为分析非正规就业的长期演变趋势提供了坚实的纵向数据基础。其核心特色在于精细的多维分类体系,不仅区分了总性别、男性、女性等类别,还嵌入了教育水平和残疾状态的细分变量,使得研究者能够深入探究不同群体在非正规就业中的差异化表现。数据质量方面,ILO采用了‘最佳来源’原则,在多源并存时择优选录,并对异常值及方法论变动设置了状态标记,增强了数据可信度与透明度。
使用方法
该数据集与HuggingFace生态无缝集成,开发者可通过一行代码`load_dataset("electricsheepasia/asia-ilo-emp-pifl-sex-edu-dsb-rt-share-of-employment-outside-the-formal-sector-by-s")`快速加载,并利用Pandas进行后续处理。使用者既可以按国家筛选,如提取印度尼西亚数据,亦可针对特定指标构造时间序列并绘图,展示失业率随年份的波动;更可通过透视表功能重塑数据为‘国家×年份’的矩阵结构,便于进行跨国的横向比较分析。数据集结构清晰,字段命名遵循ILOSTAT标准,附有详细的数据字典,降低了使用门槛,适用于学术研究与政策评估等多元场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门编制,经由Electric Sheep Asia于2024年重新封装并发布在HuggingFace平台上,聚焦亚洲17个国家2006至2024年间非正规部门就业比例的动态变化。其核心研究问题在于通过性别、教育程度及残疾状况的多维划分,揭示亚洲区域非正规就业的结构性特征,为劳动经济学、发展研究及政策评估提供可靠的数据支撑。作为ILOSTAT数据库的重要子集,该数据集承袭了ILO在劳动力统计领域的权威性与标准化方法,成为探究亚洲非正规经济规模与演变趋势的关键实证资源,对相关领域的学术研究与政策制定具有显著影响力。
当前挑战
该数据集所应对的领域挑战在于非正规就业的界定与测量难题,因各国统计标准及调查方法存在差异,导致跨国比较与时间序列的一致性面临障碍。构建过程中,数据整合需克服多源异构数据的协调复杂性,包括不同调查类型(如劳动力调查、住户收入调查)间的方法论统一,以及数据缺失、标记为不可靠的观测值(如'U'状态)与序列断裂(如方法论修订)等质量问题。此外,针对性别、教育及残疾状况的分类交互极大丰富了维度,但亦加剧了数据稀疏性与非可比性,要求在使用时审慎处理,以保障分析结论的稳健性。
常用场景
经典使用场景
该数据集基于国际劳工组织ILOSTAT数据库,聚焦亚洲17个国家2006至2024年间非正规部门就业份额的性别、教育及残障分布情况,共计3,058条观测记录。其经典应用场景在于构建面板数据模型,以剖析亚洲各国非正规就业的演变轨迹与结构性差异。通过时间序列分析与多元回归,研究者可揭示性别、教育水平及残障状态对非正规就业参与率的边际效应,进而评估宏观经济波动、政策干预及社会变迁对劳动力市场非正规化的影响程度。
解决学术问题
此数据集有效回应了劳动经济学与发展经济学领域关于非正规就业决定因素的长期争论。它使得研究者能够在跨国、跨时背景下系统检验非正规就业与人力资本积累、性别平等及残障包容之间的理论关联,弥补了以往单一国家或截面研究在外部效度上的不足。数据所附的详细分类变量与来源标记,为处理测量误差与样本选择偏差提供了便利,从而支持更为严谨的因果推断与稳健性检验,为相关学术命题提供了坚实的实证基础。
衍生相关工作
围绕此数据集,衍生出一系列富有影响力的学术探究。其一,基于其丰富的分类维度,研究者构建了非正规就业的性别差异指数,用于跨国比较分析;其二,结合其他社会经济指标,开展了关于非正规就业与贫困、不平等关系的实证研究;其三,利用其时间序列特征,评估了劳动力市场规制改革对非正规化的因果效应。此外,该数据还常作为基准,用于训练机器学习模型以预测非正规就业趋势,或作为教学案例,推动劳动统计方法的探讨与传播,充分展现了其在学术共创与知识拓展方面的核心价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务