遇见数据集

electricsheepasia/asia-ilo-emp-nifl-sex-ind-nb-informal-employment-by-ilo-sector-and-sex-thousand

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲非正规就业的统计数据集,由国际劳工组织(ILO)的ILOSTAT数据库提供,并由Electric Sheep Asia重新打包发布。数据集包含10,388个观测值,覆盖25个亚洲国家,时间跨度为2004年至2025年,重点关注一个核心指标:EMP_NIFL_SEX_IND_NB,即“按ILO部门和性别划分的非正规就业(以千为单位)”。数据内容涉及就业统计,按性别(总计、男性、女性等)和ILO部门分类进行细分,包括国家代码、年份、观测值、数据来源和质量标志等字段。数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,旨在为研究人员和开发者提供标准化、易于使用的亚洲劳动市场数据,支持经济和社会分析。数据以年度频率发布,经过ILO的标准化处理,确保一致性和可追溯性。

This dataset is a statistical dataset on informal employment in Asia, sourced from the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Asia. It contains 10,388 observations covering 25 Asian countries from 2004 to 2025, focusing on a core indicator: EMP_NIFL_SEX_IND_NB, which represents Informal employment by ILO sector and sex (thousands). The data pertains to employment statistics, disaggregated by sex (total, male, female, etc.) and ILO sector classification, and includes fields such as country codes, years, observed values, data sources, and quality flags. The dataset is suitable for machine learning tasks like tabular classification, tabular regression, and time-series forecasting, aiming to provide standardized, easy-to-use labor market data for Asia to support economic and social analysis. Data is published at an annual frequency and has been harmonized by the ILO for consistency and traceability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-nifl-sex-ind-nb-informal-employment-by-ilo-sector-and-sex-thousand 数据集图片
构建方式
在劳动力统计的学术版图中,非正规就业的测度一直是发展经济学与国际劳动组织关注的焦点。该数据集源自ILOSTAT官方REST API,经由Electric Sheep Asia团队系统性地抽取与重构而得。构建过程首先基于ILO统一化的EMP_NIFL_SEX_IND_NB指标,从原始API端点爬取覆盖全球的观测数据,随后严格按照ISO 3166-1 alpha-3标准筛选出25个亚洲国家或地区的记录。所有原始调查微观数据均依据国际劳动统计学家会议(ICLS)定义进行规范化处理,并在源标签列中保留数据溯源信息,最终封装为结构化表格形式,确保学术研究的可复现性与跨国家比较的严谨性。
特点
该数据集以高度结构化的面板数据形态呈现,汇聚了2004年至2025年间横跨25个亚洲经济体的非正规就业统计,共计10,388条精心标注的观测记录。其突出特点在于精细的维度拆解能力:按性别(总、男、女、其他)与ILO经济部门实现多层级交叉分类,并附有观测状态标记与序列中断等元数据注释,为研究者辨析数据质量与序列可比性提供了透明依据。此外,每个指标均包含英文标签与标准化编码,配合source.label字段的原始调查来源追踪,使得该数据集兼具时空覆盖的广度与微观数据来源的深度,成为分析亚洲非正规就业演变趋势的优质资料。
使用方法
该数据集可通过HuggingFace Datasets库实现便捷调用,用户仅需一行代码即可完成数据加载。推荐的工作流包括:利用`load_dataset`函数将数据载入为pandas DataFrame,随后可依据`ref_area`字段筛选特定国家(如印度尼西亚)进行国别分析,或基于`indicator`字段选取非正规就业指标构建时间序列图。对于跨国家比较研究,推荐使用`pivot_table`方法将数据重塑为国家×年份的矩阵形式,以支持面版计量模型与动态可视化。观测值中的`obs_status`与`note_indicator`字段可用于过滤不可靠数据,从而提升下游统计建模的稳健性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,并由Electric Sheep Asia于2025年重新打包发布,聚焦亚洲25个国家2004至2025年间非正规就业的跨部门与性别分布。非正规就业是劳动经济学与发展研究的核心议题,直接关系到劳动者权益保障、经济统计体系的完善以及联合国可持续发展目标(SDG)中体面工作的实现。ILOSTAT作为全球劳动统计的权威数据库,通过对各国劳动力调查数据的协调处理,构建了这一包含逾万条观测值的标准化数据集。其问世为学术界和政策制定者提供了纵向比较亚洲各国非正规就业规模、结构变迁及性别差异的宝贵资源,显著推动了区域劳动市场的实证研究。
当前挑战
该数据集所解决的领域挑战在于,非正规就业因其隐蔽性和统计口径差异,长期以来难以被准确量化与跨国比较。ILO需克服各国调查方法、行业分类标准以及性别定义不一致等难题,运用ICLS框架统一数据来源。在构建过程中,挑战尤为突出:面对原始微观数据来自劳动力调查、家庭收入调查及行政记录等多源异构渠道,需实施精细的数据清洗与缺失值处理;同时,部分国家或年份的观测值被标记为“不可靠”或存在序列断裂,数据质量标识(如obs_status字段)的引入虽提升了透明度,却也揭示了数据整合中无法完全消除的异质性与时序不一致性。
常用场景
经典使用场景
在劳动经济学与发展研究的广阔领域中,该数据集凭借其覆盖25个亚洲国家、跨越2004至2025年的非正规就业观测值,成为进行区域劳动力市场比较分析的核心资源。研究者可通过性别、行业等分类维度,追溯非正规就业规模的时空演变轨迹,构建面板数据模型以剖析其驱动因素。其经典应用场景在于利用时间序列预测方法,如ARIMA或Prophet,对各国非正规就业人数进行短期推估,从而揭示亚洲劳动力市场的结构转型动态,并为经济政策制定提供数据锚点。
解决学术问题
该数据集直面非正规经济监测中长期存在的跨国数据碎片化与可比性缺失难题。通过整合ILOSTAT官方统一定义框架下的高粒度指标,它使学者能够系统性地量化非正规就业在不同性别群体与行业部门间的分布差异,进而解构经济发展水平、劳动力市场规制、社会保障体系与非正规化程度之间的复杂关联。这一成果显著推动了关于可持续发展目标(SDG)中体面劳动指标(如SDG 8.3.1)的实证研究,填补了亚洲区域比较分析的数据空白。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的学术探索。典型工作包括构建非正规就业程度的跨国指数,并将其与宏观经济波动(如GDP增长率)、制度质量(如营商环境指标)进行面板格兰杰因果检验。亦有研究利用其性别分类维度,探讨女性在非正规部门中的就业粘性与经济冲击下的脆弱性差异。此外,该数据还支撑了结合卫星夜间灯光数据与机器学习模型,预测欠发达区域非正规经济规模的方法论创新,拓展了官方统计与遥感数据融合的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务