遇见数据集

electricsheepasia/asia-ilo-emp-5nif-sex-eco-rt-informal-employment-rate-by-sex-and-economic-activ

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是关于亚洲地区非正规就业率的统计数据集,具体指标为按性别和经济活动划分的非正规就业率——基于第19届国际劳工统计学家会议(ICLS)定义(百分比)。数据集包含1,001个观测值,覆盖18个亚洲国家(包括阿富汗、孟加拉国、文莱、塞浦路斯、格鲁吉亚、约旦、韩国、老挝、黎巴嫩、蒙古、缅甸、马尔代夫、巴基斯坦、越南等),时间跨度为2014年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过ILOSTAT REST API获取,并经过处理和过滤以仅包含亚洲国家。数据集采用表格形式,包含多个列,如国家代码(ref_area)、国家名称(ref_area.label)、数据来源代码和标签(source, source.label)、指标代码和标签(indicator, indicator.label)、性别分类(sex, sex.label)、经济活动分类(classif1, classif1.label)、观测年份(time)、观测值(obs_value)、观测状态(obs_status, obs_status.label)以及相关注释列。数据按年度频率提供,并包含数据质量说明,如当同一国家×年份有多个数据来源时,使用ILO选择的最佳来源。数据集适用于表格分类、回归和时间序列预测等任务,主要用于劳动经济学、就业政策分析和非正规经济研究。

This dataset contains statistical data on the informal employment rate in Asia, specifically the indicator Informal employment rate by sex and economic activity -- 19th International Conference of Labour Statisticians (ICLS) definition (%). It includes 1,001 observations across 18 Asian countries (such as Afghanistan, Bangladesh, Brunei, Cyprus, Georgia, Jordan, Korea, Lao Peoples Democratic Republic, Lebanon, Mongolia, Myanmar, Maldives, Pakistan, Vietnam, etc.), spanning the years 2014 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via the ILOSTAT REST API, and processed and filtered to include only Asian countries. The dataset is in tabular format with multiple columns, including country code (ref_area), country name (ref_area.label), source code and label (source, source.label), indicator code and label (indicator, indicator.label), sex disaggregation (sex, sex.label), economic activity classification (classif1, classif1.label), observation year (time), observed value (obs_value), observation status (obs_status, obs_status.label), and related note columns. Data is provided at an annual frequency and includes data quality caveats, such as the use of the ILO-selected best source when multiple sources exist for the same country×year. The dataset is suitable for tasks like tabular classification, regression, and time-series forecasting, primarily for labor economics, employment policy analysis, and informal economy research.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-5nif-sex-eco-rt-informal-employment-rate-by-sex-and-economic-activ 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接提取指标代码为EMP_5NIF_SEX_ECO_RT的原始数据,并依据亚洲ISO3国家代码进行地域筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)的统一定义对各国劳动力调查微观数据进行标准化处理,数据来源在source.label字段中予以明确标注,确保数据溯源清晰。数据集由Electric Sheep Asia重新封装,以Parquet格式发布,共包含1,001条观测记录,覆盖2014年至2025年间18个亚洲国家的非正规就业率信息。
特点
该数据集的核心特点在于其聚焦亚洲区域、时间跨度长且维度丰富。其覆盖18个亚洲国家,时间跨度达12年,提供非正规就业率这一单一指标,但按性别(总、男、女)及经济活动类型进行细致分层。数据字段设计规范,包含国家代码、指标代码、观测值、数据来源、观测状态及注释信息,便于用户追溯数据质量和来源变更。此外,数据集以年度频率呈现,并采用ILO统一筛选的‘最佳来源’数据,确保跨国家与跨年份的可比性,为亚洲非正规经济研究提供高质量的数据基础。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,调用load_dataset()函数即可快速获取训练集,并转换为Pandas DataFrame进行后续分析。典型使用场景包括按国家筛选数据子集、按时间序列绘制单一指标变化趋势、以及通过透视表构造国家×年份矩阵以进行跨区域对比分析。数据集结构清晰,支持基于ref_area、sex、classif1等维度进行灵活分组与聚合,适合从事劳动经济学、发展经济学及政策评估等领域的研究者直接应用于统计分析或机器学习建模。
背景与挑战
背景概述
非正规经济是全球劳动力市场的重要构成部分,尤其在亚洲地区,其规模庞大且影响深远。然而,由于非正规就业的隐蔽性和统计口径的差异,系统性地追踪其性别与经济活动的分布模式长期面临数据匮乏的困境。国际劳工组织(ILO)于2025年由其统计部门依托ILOSTAT数据库发布的本数据集,通过整合18个亚洲国家2014至2025年间超过1000条观测记录,首次以标准化指标(基于第19届国际劳工统计学家会议定义)呈现非正规就业率的性别与经济活动维度。该数据集由Electric Sheep Asia重新封装,为研究亚洲非正规经济动态、评估可持续发展目标中的体面劳动进展提供了关键数据基础,显著提升了区域比较研究的可操作性。
当前挑战
该数据集所解决的核心领域挑战在于,非正规经济因其统计脆弱性常被边缘化,传统数据源难以捕捉其性别分异与行业异质性,阻碍了精准政策干预。构建过程中面临多重挑战:首先,各国调查方法(如劳动力调查、行政记录)不一致,ILO需通过ICLS定义进行繁琐的协调与归并;其次,数据质量参差不齐,存在序列断裂、指标修订等问题,设计中通过`obs_status`和`note_indicator`字段标记以保证透明度;此外,年度频率限制了高频波动分析,且仅覆盖特定国家与时段,难以全面反映亚洲非正规经济的全貌,对时空外推与模型泛化构成制约。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇处,该数据集最经典的使用场景是开展亚洲国家非正规就业率的跨国比较与纵向趋势分析。凭借其涵盖18个亚洲国家、跨越2014至2025年的观测记录,研究者能够精准刻画不同经济体非正规就业的结构性特征及其演变轨迹,尤其适用于构建面板数据模型以识别性别、经济部门等维度下非正规就业的动态变化规律。
实际应用
在实际应用层面,该数据集为国际组织、政策制定者及社会研究机构提供了关键决策支持。劳动部门可利用其观测值监测不同性别群体在非正规经济中的参与态势,从而设计更具包容性的就业促进政策。发展机构能够基于非正规就业率的时空变化评估经济转型效果,而社会学家则将其用于探究非正规就业与社会保障覆盖面不足之间的关联,为完善劳动权益保护体系提供数据根基。
衍生相关工作
该数据集的发布催生了一系列重要的衍生研究工作。一方面,它激发了基于时空统计方法的非正规就业预测模型开发,研究者利用其年度时序构建贝叶斯结构时间序列模型以推测数据稀疏国家的就业态势。另一方面,围绕该数据集的分类与回归特征,涌现了多项融合经济地理信息的机器学习工作,旨在揭示非正规就业率与国家发展水平、产业结构的隐含关联,进而推动劳动统计领域的可重复计算研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务