遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-edu-geo-rt-informal-employment-rate-by-sex-education-and-rura

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲31个国家从2003年至2025年的非正规就业率数据,共计23,789条观测记录。核心指标为按性别、教育程度和城乡地区划分的非正规就业率(%)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并经过标准化处理。数据集提供了多维度的分类信息,包括性别(总计、男性、女性)、教育程度和城乡地区类型,并包含国家代码、年份、观测值、数据来源及质量标志等字段。适用于表格分类、回归和时间序列预测等机器学习任务,旨在支持对欧洲劳动力市场中非正规就业情况的分析与研究。

This dataset contains 23,789 observations of informal employment rate data across 31 European countries, spanning from 2003 to 2025, with one core indicator: Informal employment rate by sex, education and rural / urban areas (%). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to European countries. It includes multi-dimensional breakdowns such as sex, education level, and rural/urban areas, along with country codes, year, observed values, data sources, and quality flags. Suitable for tabular classification, regression, and time-series forecasting tasks, it supports analysis of informal employment trends in the European labour market.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-edu-geo-rt-informal-employment-rate-by-sex-education-and-rura 数据集图片
构建方式
国际劳工组织(ILO)基于其全球劳动统计数据库ILOSTAT,通过REST API接口直接提取指标EMP_NIFL_SEX_EDU_GEO_RT的原始数据。该指标经国际劳工统计学家会议(ICLS)定义框架统一协调各国劳动力调查、家庭收入调查及行政记录等多元来源的微观数据。数据采集后,由Electric Sheep Europe依据欧洲ISO3国家代码进行筛选与重封装,以标准化Parquet格式发布,并附有来源标签和注释列以确保可追溯性。
特点
该数据集覆盖31个欧洲国家自2003年至2025年的23,789条观测记录,聚焦非正规就业率这一劳动经济学核心议题。其显著特征在于多维度分解结构,涵盖性别(总数、男性、女性)、教育程度及城乡地理区域三层分类,并包含来源标签、观测状态标志及方法学注释等元数据。数据以年度频率发布,部分指标经ILO最佳来源筛选,兼顾跨国可比性与统计可靠性。
使用方法
研究者可通过Hugging Face的datasets库以load_dataset函数直接加载数据并转换为Pandas数据框,便于开展探索性分析。典型操作包括按国家代码筛选特定国家子集,针对单一指标绘制时间序列图以观察非正规就业率演变趋势,或利用透视表将数据重塑为国家×年份矩阵进行面板分析。此外,该数据集可服务于表格分类、回归及时间序列预测等机器学习任务。
背景与挑战
背景概述
非正规就业作为全球劳动力市场的重要议题,长期困扰着社会保障体系与经济发展政策的制定。国际劳工组织(ILO)依托其统计部门,自2003年起系统采集欧洲地区非正规就业率数据,该数据集由Electric Sheep Europe于2025年重新封装发布,覆盖31个欧洲国家,共计23,789条观测记录,时间跨度达2003至2025年。数据集以性别、教育程度及城乡区域为核心分层维度,为探究非正规就业的结构性差异提供了跨国可比的基础数据,对劳动经济学、社会政策评估及可持续发展目标监测具有重要支撑价值。
当前挑战
非正规就业的界定与测度本身即面临概念模糊与跨国口径不一的难题,国际劳工组织虽以国际劳工统计学家会议定义进行协调,但各国劳动力调查的抽样设计、问卷措辞及覆盖范围差异仍导致数据可比性受限。数据构建过程中,部分国家年份存在来源更替或方法修订所引发的序列断裂,观测值亦标注有可靠性不足等质量警示;此外,城乡分类与教育层级在不同国家间的映射并非完全一致,部分维度组合存在缺失或非公开披露,这些因素共同构成了对该数据集进行时序分析与跨国比较时需谨慎应对的挑战。
常用场景
经典使用场景
在非正规经济研究领域,该数据集最经典的使用场景在于剖析非正规就业率在性别、教育程度与城乡地域之间的多维分异格局。研究者通常以国际劳工组织(ILO)标准化框架为基准,将观测值按年份、国别与人口特征进行交叉分组,借助面板回归或时间序列分解方法,揭示非正规就业在转型经济体与发达经济体之间的结构性差异,进而刻画欧洲劳动力市场非正规化的动态演进轨迹。
实际应用
在政策实践层面,该数据集为国际组织与各国劳工部门监测体面劳动目标进展提供了量化基准。就业服务机构可据此识别非正规就业高发群体,如低教育水平女性或农村劳动者,从而设计更具靶向性的技能培训与社会保障扩面方案。同时,该数据集亦可嵌入劳动力市场预警系统,辅助评估经济波动或制度变革对非正规就业规模的即时冲击。
衍生相关工作
围绕该数据集已衍生出一系列具有影响力的研究工作。部分学者利用其面板结构检验非正规就业与贫困脆弱性之间的因果链条,另有研究将其与欧洲社会调查等微观数据匹配,探讨非正规就业对主观福祉与职业流动的影响。此外,若干方法论论文以该数据集为基准,开发了处理国际劳工统计中缺失值与序列断裂的插补与校正技术,推动了劳动统计数据的二次分析规范。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务