遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-est-geo-nb-employment-outside-the-formal-sector-by-sex-establ

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含8,857个观测值,涉及21个亚洲国家在2000年至2025年期间的非正规经济就业数据。核心指标为EMP_PIFL_SEX_EST_GEO_NB,即按性别、企业规模和城乡地区划分的非正规部门就业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过劳动力调查等原始数据协调而成,涵盖国家代码、年份、性别分类(总计、男性、女性)、企业规模分类和地区类型分类等多维度信息。数据集适用于表格分类、回归分析和时间序列预测任务,旨在为亚洲地区的劳动力市场研究提供机器学习就绪的数据支持。

This dataset contains 8,857 observations of informal economy employment data across 21 Asia countries, spanning 2000–2025. The primary indicator is EMP_PIFL_SEX_EST_GEO_NB, which measures employment outside the formal sector by sex, establishment size, and rural/urban areas (in thousands). Data is sourced from the ILOSTAT database of the International Labour Organization (ILO), harmonized from raw survey microdata such as labour force surveys, and includes multi-dimensional classifications like country codes, years, sex disaggregation (total, male, female), establishment size, and area type. It is suitable for tabular classification, regression, and time-series forecasting tasks, providing a machine learning-ready data layer for labour market research in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-est-geo-nb-employment-outside-the-formal-sector-by-sex-establ 数据集图片
构建方式
该数据集以国际劳工组织(ILO)所维护的ILOSTAT中央统计数据库为根基,通过其REST API接口拉取指标EMP_PIFL_SEX_EST_GEO_NB的原始记录,并依据ISO3国家代码筛选出亚洲地区样本。ILOSTAT本身遵循国际劳工统计学家会议(ICLS)确立的定义体系,对各国劳动力调查、住户收入调查及机构调查等微观数据进行标准化调和,由ILO统计局负责质量把控。Electric Sheep Asia在此基础上完成模式归一化、Parquet格式封装与数据集卡片编制,保留了来源标签以保障可追溯性。
特点
此数据集聚焦于非正规部门就业这一劳动力市场核心议题,涵盖21个亚洲国家、2000至2025年的8857条年度观测,按性别、机构规模及城乡区域维度进行分解。字段设计兼顾分析灵活性与信息完整性,包含国家代码、来源名称、指标编码、性别分类、机构规模分类、区域类型、观测值及其状态标记等。部分观测附有序列中断或数据可靠性提示,为研究者评估数据质量提供了透明依据。整体规模适中,适合开展跨国比较与时序趋势分析。
使用方法
研究者可通过HuggingFace datasets库以load_dataset函数直接加载该数据集,并转换为Pandas数据框进行后续处理。针对具体研究问题,可依据ref_area字段筛选单一国家,或按indicator字段提取特定指标并排序以构建时间序列。若需跨国面板分析,可利用pivot_table方法将数据重塑为国家与年份交叉矩阵。该数据集适用于表格分类、回归及时间序列预测等任务,亦可作为非正规经济研究的基础数据源。
背景与挑战
背景概述
非正规经济就业的测度长期以来构成劳动统计领域的核心议题。国际劳工组织(ILO)依托国际劳工统计学家会议(ICLS)确立的定义框架,自二十世纪末起系统性地汇编各国劳动力调查数据,构建了ILOSTAT这一全球劳动统计的权威数据库。本数据集由Electric Sheep Asia于2025年前后从ILOSTAT REST API抽取并重新封装,涵盖21个亚洲国家2000至2025年间8857条观测记录,聚焦于按性别、企业规模及城乡地域分层的非正规部门外就业指标。该数据集为探究亚洲发展中经济体非正规就业的结构性特征、性别差异与空间分异提供了跨国可比的基础数据支撑,对劳动经济学、发展研究及社会政策评估具有重要参考价值。
当前挑战
该数据集所回应的领域问题在于,非正规就业的跨国可比测度始终面临定义分歧与统计口径不统一的困境,各国劳动力调查在抽样设计、问卷模块及非正规部门界定标准上的异质性,使得直接横向比较存在系统性偏误风险。就构建过程而言,原始微观数据需经ILO统一协调与再编码,部分国家年份存在数据缺失或仅覆盖单一维度,观测状态标志中亦标注了"不可靠"或"方法修订导致序列断裂"等情形。此外,指标仅提供年度频率且部分分类变量存在非空限制,对精细时序建模与多维度交互分析构成制约,研究者需在数据清洗与缺失值处理上投入额外的方法论考量。
常用场景
经典使用场景
在非正规经济部门就业规模的量化研究中,该数据集构成了一项关键的经验基石。依托国际劳工组织所提供的高度协调化微观调查数据,研究者得以针对亚洲二十一个国家自两千年至二零二五年的非正规就业人数展开跨国比较与纵向追踪。其经典用法体现于以性别、企业规模及城乡地域三重维度为分析轴心,借助面板数据建模或时间序列预测等方法,细致刻画非正规就业的性别差距与企业规模分布特征。数据集所独有的观测状态标记与来源注释,亦支持研究者对数据可靠性进行甄别,从而使非正规部门就业的时序演变与空间异质性分析具备了坚实的实证根基。
解决学术问题
在劳动经济学与发展经济学的交叉领域,非正规就业的测度长期面临定义分歧与数据碎片化的双重困境。该数据集凭借国际劳工组织统一采用的国际劳工统计学家会议标准,系统性地回应了非正规部门就业规模估算口径不一致的问题。其核心学术贡献在于,通过性别与城乡等维度的精细化分解,为探究非正规就业中的性别隔离、城乡二元结构以及企业规模对就业正规化的影响等议题提供了可复现的量化证据。此类数据资源推动了关于非正规经济与贫困、社会保障覆盖及体面劳动赤字之间关系的比较研究,对理解发展中经济体劳动力市场分割具有重要的方法论意义与实证价值。
衍生相关工作
该数据集衍生的相关经典工作主要体现于国际劳工组织定期发布的《世界非正规就业报告》及可持续发展目标中关于体面劳动的监测报告,这些成果均以该数据体系为基准进行跨国比较分析。在学术界,诸多围绕亚洲劳动力市场正规化进程的实证论文亦直接引用此数据集,用以检验贸易开放、技术进步与制度变迁对非正规就业比重的影响。此外,部分研究将该数据与家庭调查微观数据衔接,拓展了关于非正规就业与收入不平等、代际流动等议题的讨论,逐步形成了以国际劳工组织统计标准为纽带的研究谱系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务