遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-ocu-geo-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家从2000年至2025年的非正规经济就业数据,共22,216个观测值,涵盖1个核心指标:按性别、职业和城乡地区划分的非正规部门就业比例(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至亚洲地区,经过ILO基于国际劳工统计学家会议定义的标准化处理。数据集以表格形式提供,包括国家代码、年份、指标值、性别分类、职业分类、城乡地区分类以及数据来源和质量标注等信息,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 22,216 observations of informal economy employment data across 23 Asia countries, spanning 2000–2025, covering 1 distinct indicator: Share of employment outside the formal sector by sex, occupation and rural/urban areas (%). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia ISO3 country codes, harmonized using ICLS definitions. It is provided in tabular format with columns for country code, year, indicator value, sex disaggregation, occupation classification, rural/urban area classification, and data source and quality flags, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-ocu-geo-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接获取指标EMP_PIFL_SEX_OCU_GEO_RT的原始数据,并依据亚洲ISO3国家代码进行筛选,最终由Electric Sheep Asia重新封装为HuggingFace数据集。数据涵盖2000年至2025年间23个亚洲国家的22216条观测记录,原始调查微观数据经ILO依据国际劳工统计学家会议(ICLS)定义进行标准化调和,source.label列标注了数据来源以确保可追溯性,体现了从权威统计机构到机器学习就绪数据层的严谨构建流程。
特点
数据集聚焦于非正规部门就业份额这一非正规经济核心指标,按性别、职业和城乡区域多维 disaggregation,涵盖SEX_T、SEX_M、SEX_F、SEX_O四种性别分类以及职业技能水平和区域类型等分类变量。时间跨度为2000至2025年,包含年度频率数据,涉及23个亚洲国家,数据规模介于10K至100K行之间。每行记录包含国家代码、来源、指标代码、性别、分类变量、年份、观测值及观测状态等字段,并附有note_indicator和note_source等注释列以标注序列断裂或方法修订等质量信息,为分析亚洲非正规就业的性别差异、职业分布和城乡差距提供了细粒度面板数据。
使用方法
研究者可通过HuggingFace datasets库以一行代码加载该数据集,并转换为Pandas DataFrame进行灵活操作。典型用法包括按ref_area列筛选特定国家(如印度尼西亚IDN),按indicator列提取目标指标并依time排序绘制时间序列图以观察趋势演变,或利用pivot_table将数据重塑为国家×年份矩阵以进行跨国比较分析。数据集支持表格分类、回归和时间序列预测等机器学习任务,其结构化的模式设计便于特征工程和建模,同时遵循CC-BY-4.0许可,使用时需同时引用ILO原始来源和Electric Sheep Asia的重新封装工作。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与系统化。其核心数据库ILOSTAT汇集了涵盖就业、失业、工资、非正规经济等领域的跨国可比数据,为劳动经济学与政策研究奠定实证基础。本数据集由Electric Sheep Asia于2025年重新封装发布,聚焦亚洲23国2000至2025年间非正规部门就业份额的性别、职业与城乡分布,共含22,216条观测。该数据集填补了亚洲非正规经济长期跨国比较的数据空白,为监测可持续发展目标中的体面劳动进程提供了关键支撑。
当前挑战
非正规就业的测度本身即构成重大挑战,因其边界模糊且高度依赖各国劳动统计定义与调查方法的异质性,国际劳工组织虽以国际劳工统计学家会议标准进行协调,仍难以完全消除跨国可比性偏差。构建过程中,数据缺失与来源不统一问题突出,部分国家年份覆盖稀疏,且同一国家不同年份的统计口径变更导致序列断裂。此外,职业与城乡维度的交叉分类造成样本稀疏,观测状态中常出现“不可靠”标识,对时间序列建模与因果推断构成显著障碍,要求研究者在利用该数据集时须审慎处理结构性缺失与测量误差。
常用场景
经典使用场景
在非正规经济部门的劳动计量研究中,该数据集以性别、职业与城乡维度为轴心,刻画亚洲二十三国的非正规就业占比变迁,其典型应用即在于从多维交互视角审视非正规就业的结构性差异。研究者常以年度观测值为基础,绘制性别与城乡分类下的时间序列曲线,揭示女性与农村地区劳动者在非正规部门中的过度集聚现象,进而为劳动力市场分层理论提供实证支撑。
衍生相关工作
基于该数据集及其同源ILOSTAT指标,学界衍生出一系列比较劳动制度研究,涉及非正规就业与经济增长、贫困减缓及性别平等之间的关联分析。部分工作进一步将之与家庭调查微观数据匹配,构建多层次模型以检验制度环境对非正规就业规模的调节效应。Electric Sheep Asia的标准化封装亦促进了机器学习方法在劳动统计预测中的迁移应用。
数据集最近研究
最新研究方向
在全球南方非正规经济持续扩张的背景下,该数据集所刻画的正规部门外就业份额成为劳动经济学与发展经济学交叉领域的前沿议题。近期研究聚焦于性别、职业技能层级与城乡区位的三重交互效应,运用面板回归与时间序列预测方法揭示非正规就业的结构性差异及其对社会保障覆盖率的溢出影响。伴随国际劳工组织推进体面劳动议程以及SDG目标8的监测需求,该数据被广泛用于评估亚洲新兴经济体在劳动市场正规化进程中的异质性表现,为政策制定者识别脆弱就业群体、优化社会保障资源配置提供了关键实证基础,亦为机器学习驱动的劳动力市场分层预测研究开辟了新的方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务