遇见数据集

electricsheepasia/asia-ilo-emp-pifl-sex-est-dsb-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲14个国家(如蒙古、斯里兰卡、巴勒斯坦、亚美尼亚等)在2006年至2024年期间的非正规经济就业数据,共1,757个观测值。核心指标为“按性别、企业规模和残疾状况划分的非正规部门就业比例(%)”,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家。数据集提供了详细的模式,包括国家代码、数据来源、指标、性别分类、企业规模分类、残疾状况分类、观测年份、观测值及状态等字段,适用于表格分类、回归和时间序列预测等任务。数据质量方面,注意数据为年度频率,ILO选择“最佳来源”处理多源情况,且分类字段仅在指标发布细分时非空。数据集由Electric Sheep Asia重新打包,以CC-BY-4.0许可发布,便于机器学习使用。

This dataset contains 1,757 observations of informal economy data across 14 Asia countries, spanning 2006–2024, covering the indicator Share of employment outside the formal sector by sex, establishment size and disability status (%). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), filtered to Asia ISO3 country codes via API. The schema includes columns such as ref_area (country code), source, indicator, sex, classif1 (establishment size), classif2 (disability status), time (year), obs_value, and data quality flags. Data is annual, with the ILOs best source used for multiple sources, and disaggregation columns are non-null only when published. Repackaged by Electric Sheep Asia under CC-BY-4.0 license for ML-ready use in tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-pifl-sex-est-dsb-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织ILOSTAT数据库,通过其REST API接口直接获取原始数据,并依据亚洲ISO3国家代码进行筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,确保数据可比性。数据经Electric Sheep Asia重新打包,以Parquet格式发布,保留源标签和注释列以便追溯。
使用方法
用户可通过Hugging Face的datasets库加载数据集,并转换为Pandas DataFrame进行灵活操作。支持按国家、指标或时间序列筛选,例如提取特定国家的数据或绘制时间趋势图。还可利用透视表功能生成国家与年份的矩阵视图,便于进行跨国比较或时序分析。
背景与挑战
背景概述
非正规经济就业的测度长期以来构成劳动经济学与发展研究的核心议题,其数据基础直接关乎体面劳动议程的监测与政策评估。国际劳工组织(ILO)依托其中央统计数据库ILOSTAT,依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查等原始微观数据进行跨国标准化调和,构建了覆盖200余国、可追溯数据来源的就业指标集合。在此框架下,Electric Sheep Asia于2026年将该指标中亚洲区域数据重新打包发布,涵盖14个亚洲国家、2006至2024年间1757条观测,按性别、企业规模与残疾状况对非正规部门以外就业占比进行多维分解,为比较就业结构转型与脆弱群体劳动参与提供了标准化、可直接用于机器学习任务的数据资源。
当前挑战
该数据集所应对的领域问题在于,非正规就业本身具有高度异质性且长期缺乏跨国可比的统一测度,各国对非正规部门的界定、调查口径与抽样方法差异显著,致使横向比较与趋势分析面临系统性偏差。构建过程中,ILOSTAT需对来源各异的劳动力调查、家庭收入调查与行政记录进行概念对齐与统计调和,而亚洲区域数据的时序断裂尤为突出:多数国家仅有一至两年观测,蒙古一国即占近四成记录,残疾状况与企业规模等分类维度在多数年份缺失,观测状态标记亦提示部分数值可靠性存疑,这些因素共同构成对模型泛化能力与因果识别策略的实质性挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于刻画亚洲地区非正规部门就业份额的性别差异、企业规模异质性与残障状况关联。研究者常以面板数据模型或时间序列分解方法,考察2006至2024年间14个亚洲经济体的非正规就业占比演变轨迹,尤其聚焦蒙古、斯里兰卡、印度尼西亚等国的结构性变迁。通过性别分组(SEX_T、SEX_M、SEX_F)与建立规模分类的交叉维度,可识别女性与残障劳动者在非正规部门中的过度代表现象,进而为体面劳动赤字提供量化证据。
解决学术问题
该数据集有效回应了非正规就业测量中跨国可比性不足与多维分解缺失的学术困境。国际劳工组织借助国际劳工统计学家会议定义对原始调查微数据进行统一协调,使得不同国家、不同年份的观测值可以在共同分类框架下进行比较。这解决了既往研究因各国非正规部门界定差异而难以开展稳健跨国回归的问题。同时,数据集内置的观测状态标志与序列断裂注释,为学者甄别数据质量问题、控制测量误差提供了透明依据,显著提升了非正规就业决定因素研究的内部效度与可复制性。
实际应用
在政策实践层面,该数据集为亚洲各国劳动监察、社会保障扩面及残障融合就业政策提供实证基线。国际组织与国别智库可据此监测可持续发展目标中体面工作指标的落实进度,识别非正规就业高发的人群与行业特征。平台经济与零工经济快速扩张的背景下,研究者利用该数据评估正规化改革措施对不同性别和残障身份劳动者的差异化影响。此外,机器学习从业者可将该表格数据用于缺失值插补、非正规就业率预测及跨国聚类分析,服务于劳动市场风险预警系统的开发。
数据集最近研究
最新研究方向
在全球非正规经济研究持续深化的背景下,该数据集为亚洲地区非正规就业的性别差异、企业规模与残疾状况交互效应提供了稀缺的跨国面板证据。前沿研究正逐渐从单一维度的非正规就业测度转向多维异质性分析,利用该数据可探究残疾劳动者在不同规模企业中的非正规就业脆弱性,以及性别与残疾双重劣势的叠加机制。这与国际劳工组织推动的“向正规化转型”政策议程及联合国可持续发展目标第八项体面劳动密切相关。该数据集覆盖2006至2024年14个亚洲国家,支持时间序列预测与面板因果推断,为评估非正规就业的动态演变、政策干预效果及包容性增长提供了关键的实证基础,对劳动经济学与发展经济学交叉领域具有重要学术价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务