遇见数据集

electricsheepasia/asia-ilo-ees-tees-sex-ifl-ocu-nb-employees-by-sex-informal-formal-job-and-occupatio

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家的25,348个观测值,时间跨度为2000年至2025年,主要指标为“按性别、非正式/正式工作和职业划分的雇员(千计)”。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,涵盖了雇员数据,并按性别、工作性质(非正式或正式)和职业进行细分。数据集包含国家代码、国家名称、数据来源、指标代码、性别分类、分类变量、观测年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据以CC-BY-4.0许可证发布,由Electric Sheep Asia重新打包,旨在为亚洲地区提供机器学习就绪的数据层。

This dataset contains 25,348 observations of employees by sex, informal/formal job and occupation (in thousands) across 26 Asian countries, spanning the years 2000 to 2025. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), providing detailed breakdowns by gender, job nature (informal or formal), and occupation. It includes columns such as country codes, country names, data sources, indicator codes, sex classifications, classification variables, observation years, and observed values, suitable for tabular classification, regression, and time-series forecasting tasks. Released under the CC-BY-4.0 license, it is repackaged by Electric Sheep Asia as part of a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tees-sex-ifl-ocu-nb-employees-by-sex-informal-formal-job-and-occupatio 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接提取指标EES_TEES_SEX_IFL_OCU_NB的原始记录,并依据亚洲ISO3国家代码进行筛选,最终由Electric Sheep Asia完成标准化重打包,形成涵盖26个亚洲国家、2000至2025年、共计25,348条观测值的结构化表格数据。ILOSTAT在汇聚各国劳动力调查、家庭收入调查及行政记录的基础上,依据国际劳工统计学家会议(ICLS)定义对原始微观数据进行统一调和,数据来源在source.label列中予以标注,以保证可追溯性。
使用方法
研究者可通过HuggingFace datasets库以一行代码加载该数据集,并借助pandas转换为数据框进行灵活分析。典型用法包括:按ref_area字段筛选特定国家(如印度尼西亚IDN)以开展国别研究;按indicator字段提取单一指标并依time排序,绘制时间序列趋势图;或利用pivot_table将数据重塑为国家×年份矩阵,以支持跨国比较与面板回归分析。该数据集亦适用于表格分类、表格回归及时间序列预测等机器学习任务,为劳动经济学、发展研究及非正规就业政策分析提供可直接利用的标准化数据基础。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的标准化与传播,其ILOSTAT数据库为研究非正规经济提供了权威依据。在此背景下,Electric Sheep Asia于2025年对ILOSTAT原始数据进行重新封装,构建了涵盖26个亚洲国家、2000至2025年间25348条观测的非正规/正规就业与职业性别分布数据集。该数据集聚焦于非正规经济中雇员性别与职业结构的量化刻画,填补了亚洲区域该维度系统性面板数据的空白,为劳动经济学、性别研究与区域发展政策分析提供了关键数据支撑。
当前挑战
该数据集所应对的核心领域问题在于非正规就业的精确测度与跨国可比性。由于各国劳动力调查方法、非正规经济定义及职业分类标准存在差异,即便经过ICLS框架调和,仍难以完全消除系统性偏差。构建过程中亦面临多重挑战:原始数据源自异构调查工具,存在指标年份不连续、性别分类中其他类别(SEX_O)样本稀疏、部分观测值标注为不可靠等问题;此外,多源数据合并时需依赖ILO最佳源选择策略,可能引入选择性偏差,对时间序列建模与跨国比较的稳健性构成潜在威胁。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最为经典的使用场景在于刻画亚洲各国非正规就业的性别结构与职业分布图景。研究者依托国际劳工组织标准化的劳动力调查数据,通过交叉分析性别、非正规/正规就业身份与职业技能层级三个维度,得以系统性地追踪2000至2025年间亚洲26国非正规经济部门中男女劳动者的就业形态变迁。此类面板数据为构建时间序列模型、比较不同国家非正规就业率的变化趋势提供了坚实的数据基础,常用于分析非正规就业的性别差距及其随经济周期波动的动态特征。
解决学术问题
该数据集有效回应了非正规经济研究中长期存在的度量与可比性难题。国际劳工组织依据国际劳工统计学家会议的定义对原始微观调查数据进行调和,使得跨国比较成为可能,从而解决了不同国家非正规就业定义不一致、数据碎片化的问题。其意义在于为检验非正规就业与性别不平等、职业隔离及经济发展水平之间的关系提供了标准化的实证素材,支持学者探究女性在非正规经济中的过度代表现象及其背后的结构性因素,推动了劳动统计与发展经济学交叉领域的知识积累。
实际应用
在实际应用层面,该数据集为国际组织、政府部门及社会保障机构制定劳动政策提供了量化依据。政策制定者可借助数据识别非正规就业集中度较高的国家与行业,评估非正规就业者的社会保障覆盖缺口,并针对女性劳动者设计更具包容性的就业促进措施。与此同时,该数据集也被用于监测联合国可持续发展目标中关于体面劳动的进展,为劳动力市场监测报告、国别就业诊断以及非正规经济正规化战略的效果评估提供数据支撑。
数据集最近研究
最新研究方向
在全球非正规经济研究持续深化的背景下,该数据集所承载的按性别、非正规/正规就业形态及职业分类细分的雇员统计,正推动亚洲劳动力市场结构性不平等的前沿探索。围绕非正规就业的性别差异、职业分层与技能错配等议题,研究者日益关注如何利用跨国面板数据识别非正规就业对经济增长与社会保护的长期影响。国际劳工组织近期强调的非正规经济统计标准化进程,以及后疫情时代亚洲各国非正规就业规模反弹的现实,使该数据集成为检验体面劳动目标进展、评估性别包容性政策效果的关键实证基础,对区域劳动治理与可持续发展目标的量化监测具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务