遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-eco-edu-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于欧洲非正规经济就业份额的表格数据集,包含140,556个观测值,覆盖35个欧洲国家,时间跨度为2003年至2025年。核心指标为“按性别、经济活动和教育划分的非正规部门就业份额(百分比)”,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家。数据集结构包括国家代码、性别(总计、男性、女性)、经济活动和教育分类变量、年份、观测值及其状态标志等列,适用于表格分类、回归和时间序列预测等NLP任务。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的“最佳来源”和处理缺失分类列的情况。

This dataset is a tabular dataset on the share of employment outside the formal sector in Europe, containing 140,556 observations across 35 European countries from 2003 to 2025. The core indicator is Share of employment outside the formal sector by sex, economic activity and education (%), sourced from the International Labour Organization (ILO) ILOSTAT database via API and filtered to European countries. The dataset structure includes columns such as country code, sex (total, male, female), economic activity and education classification variables, year, observed value, and status flags, suitable for tabular classification, regression, and time-series forecasting tasks. Data is published at annual frequency and includes quality caveats, such as the use of ILO-selected best source and handling of null disaggregation columns.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-eco-edu-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
非正规经济部门的就业测算长期依赖劳动力调查与住户收入调查等微观数据,国际劳工组织统计司依据国际劳工统计学家会议(ICLS)的定义对原始调查资料进行标准化调和。该数据集由Electric Sheep Europe通过ILOSTAT的REST API接口直接获取指标EMP_PIFL_SEX_ECO_EDU_RT,并依据ISO3国家代码筛选出欧洲地区,最终汇聚为涵盖35个欧洲国家、时间跨度为2003至2025年的年度面板数据,共收录140,556条观测记录。
特点
数据以表格形式组织,包含国家代码、数据来源、指标代码、性别、经济活动分类、教育程度以及观测值与质量状态标志等字段,并保留来源标签与注释信息以增强可追溯性。其覆盖范围横跨欧洲35国,观测粒度按性别、经济活动和教育水平多维分解,规模处于十万至百万级别,采用CC-BY-4.0许可协议,兼具时间序列预测、表格分类与回归等多类分析任务的适配能力。
使用方法
研究者可借助HuggingFace的datasets库调用load_dataset函数加载数据并转换为Pandas数据框,进而按国家代码筛选特定经济体,或针对单一指标构建时间序列并绘制趋势图,亦可利用透视表将数据结构化为国家与年份的二维矩阵。该数据集适用于非正规就业比例的跨国比较、教育维度差异分析以及时间序列建模等研究场景。
背景与挑战
背景概述
非正规部门就业的规模与结构,历来是发展经济学与劳动经济学关注的焦点。国际劳工组织(ILO)自2003年起系统采集并发布相关指标,旨在刻画全球非正规经济的分布与演变。该数据集由Electric Sheep Europe于2025年从ILOSTAT REST API重新封装,覆盖35个欧洲国家、140,556条观测记录,时间跨度为2003至2025年,核心指标为按性别、经济活动与教育程度分组的非正规部门就业占比。作为欧洲劳动市场非正规性研究的基础性数据资源,其发布为跨国比较、政策评估与机器学习建模提供了统一且可追溯的标准化面板数据。
当前挑战
从领域问题看,非正规就业的测量长期受制于定义分歧、数据来源异质性与跨国可比性不足,如何精确刻画不同性别、行业与教育群体间的非正规就业差异,构成劳动统计中的核心难题。就构建过程而言,原始数据源自各国劳动力调查、家庭收入调查等异质性来源,ILO虽依据国际劳工统计学家会议定义进行协调,但仍存在序列中断、观测状态标记为不可靠或临时值等问题;此外,分类变量仅在特定细分层级下非空,多源合并时需谨慎处理‘最佳来源’的选择偏差,这些因素共同对数据质量与分析结果的稳健性构成挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的用途在于构建跨国别、跨性别的非正规就业份额面板数据,以剖析欧洲各国劳动力市场非正规化程度的时空演变。研究者常借助其按性别、经济活动部门与教育程度的三重分类,开展非正规就业的结构性分解与趋势外推,从而识别不同社会群体在正式部门之外谋生的异质性模式。
解决学术问题
该数据集有效回应了非正规就业测度中长期存在的可比性难题,为厘清性别差距、教育回报及部门差异对非正规就业的影响提供了标准化观测基础。其学术意义在于支撑关于劳动力市场二元结构、社会保护覆盖面及体面劳动赤字的实证检验,进而深化对欧洲边缘劳动力群体经济脆弱性的理论认知,并推动跨国比较研究的方法论精进。
衍生相关工作
基于该数据集已衍生出一系列围绕欧洲非正规经济动态的实证研究,包括探讨教育分层与非正规就业概率的关联、分析经济周期对非正规部门规模的非对称冲击,以及评估劳动力市场制度改革对非正规就业份额的因果效应。这些工作进一步催生了多国比较的机器学习预测模型与政策模拟工具,丰富了劳动统计数据的再利用生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务