遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-ocu-est-rt-informal-employment-rate-by-sex-occupation-and-est

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含19,074个观测值,涉及欧洲4个国家(MDA、BIH、SRB、MKD)从2003年至2025年的非正规就业率数据,按性别、职业和机构规模进行分类。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码。数据集包含一个主要指标:EMP_NIFL_SEX_OCU_EST_RT(按性别、职业和机构规模划分的非正规就业率百分比)。数据以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、性别分类、职业分类、机构规模分类、观测年份、观测值、观测状态等列。数据质量方面,数据为年度频率,ILO选择“最佳来源”处理多源情况,分类列仅在指标发布细分数据时非空。该数据集适用于表格分类、回归和时间序列预测任务,旨在为欧洲提供统一的机器学习就绪数据层。

This dataset contains 19,074 observations of informal employment rate data across 4 Europe countries (MDA, BIH, SRB, MKD), spanning from 2003 to 2025, disaggregated by sex, occupation, and establishment size. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to Europe ISO3 country codes. The dataset includes one main indicator: EMP_NIFL_SEX_OCU_EST_RT (Informal employment rate by sex, occupation and establishment size, %). It is organized in tabular format with columns such as country code, country name, data source, indicator code, sex classification, occupation classification, establishment size classification, observation year, observed value, observation status, etc. Data quality notes: the data is annual frequency, the ILO selects the best source for multiple sources per country-year, and disaggregation columns are non-null only when the indicator publishes breakdowns. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, and is part of a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-ocu-est-rt-informal-employment-rate-by-sex-occupation-and-est 数据集图片
构建方式
在国际劳工统计领域,非正规就业的精准测度长期依赖各国劳动力调查微观数据的整合与标准化。该数据集由Electric Sheep Europe机构自ILOSTAT官方REST API端点直接抽取原始数据,并以欧洲ISO3国家代码为条件进行筛选,最终覆盖摩尔多瓦、波黑、塞尔维亚和北马其顿四国。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国调查微观数据进行协调化处理,数据来源在source.label列中予以标注,确保了从原始采集到指标生成的可追溯性。
特点
该数据集以年度频率汇集了2003年至2025年间19,074条观测记录,聚焦非正规就业率这一核心指标。其突出特征在于多维度的性别与职业分类交叉,涵盖性别(总计、男性、女性)以及职业技能水平和机构规模的分类变量,为剖析非正规就业的结构性差异提供了细粒度支撑。数据同时附带观测状态标志与系列断裂说明等质量注释,便于研究者识别数据的可靠性与方法学变迁。
使用方法
研究者可通过HuggingFace datasets库以load_dataset()函数便捷加载该数据集,并转换为Pandas数据框进行后续分析。典型操作包括按ref_area列筛选特定国家、按indicator列提取单一指标的时间序列,以及利用pivot_table方法将数据重塑为国家与年份的二维矩阵。这些操作路径使得该数据集既适用于描述性统计分析,也可服务于面板数据建模与跨国比较研究。
背景与挑战
背景概述
非正规就业作为全球劳动力市场的重要议题,长期受到国际劳工组织(ILO)与各国统计机构的密切关注。该数据集由ILO统计部门基于ILOSTAT数据库整理,经Electric Sheep Europe于2026年重新封装发布,涵盖2003至2025年间摩尔多瓦、波黑、塞尔维亚和北马其顿四国的19074条观测记录,聚焦按性别、职业与机构规模分列的非正规就业率。其核心研究问题在于揭示欧洲转型经济体中非正规就业的结构性差异与演变趋势,为劳动经济学、社会政策评估及可持续发展目标监测提供微观实证基础,对推动区域劳动力市场治理具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于非正规就业测度的跨国可比性与时序一致性,其核心挑战源于非正规经济概念界定随国际劳工统计学家会议决议不断演进,导致不同国家与年份的统计口径存在系统性断裂。构建过程中,原始调查数据的稀疏性、部分国家早期年份缺失、以及观测状态标注中大量“不可靠”或“临时性”标记,均对数据质量构成威胁。此外,性别、职业与机构规模三重分类维度的非均衡覆盖,使得细粒度交叉分析常面临样本不足困境,而不同来源调查方法的异质性亦为跨区域趋势比较带来额外障碍。
常用场景
经典使用场景
在非正规经济与劳动市场分割研究领域,该数据集最经典的使用场景在于刻画按性别、职业与机构规模多维交叉的非正规就业率分布。研究者可借助其面板结构,系统比较摩尔多瓦、波黑、塞尔维亚与北马其顿四国在2003至2025年间非正规就业的性别差异与职业分化,从而揭示非正规部门在不同经济体中的结构性特征与演化轨迹。
实际应用
在政策实践层面,该数据集可为劳动监察部门、社会保障机构与国际发展组织提供量化依据。基于分性别与分职业的非正规就业率时序变化,决策者可识别脆弱就业群体集中行业,评估既有劳动法规覆盖缺口,并针对不同机构规模特征设计差异化的正规化激励措施,从而服务于体面劳动目标下的就业质量监测与干预评估。
衍生相关工作
围绕该数据集,已衍生出若干经典研究方向。比较劳动制度学者利用其开展西巴尔干地区非正规就业趋同与分异分析;计量经济学者以其为因变量检验贸易开放、移民汇款与劳动力市场管制对非正规性的影响;机器学习研究者则将其作为表格回归与时间序列预测基准,推动区域劳动统计数据的可解释建模与缺失值插补方法发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务