遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-ec2-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲3个国家(2006年至2025年)的2,576条非正规经济观测数据,涵盖1个独特指标,具体为按性别和经济活动(ISIC 2级)划分的正式部门外就业份额。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过重新打包以便于机器学习使用。

This dataset contains 2,576 observations of the informal economy from 3 European countries spanning the period 2006 to 2025. It covers one unique indicator, specifically the share of employment outside the formal sector, disaggregated by gender and economic activity at the ISIC Level 2 classification. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), and has been repackaged for streamlined use in machine learning workflows.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-ec2-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库整合了各国劳动力调查、家庭收入调查及行政记录等多源微观数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化调和。该数据集通过ILOSTAT的REST API接口直接提取指标EMP_PIFL_SEX_EC2_RT的原始观测值,按欧洲ISO3国家代码筛选后,由Electric Sheep Europe重新打包为HuggingFace数据集,并保留源标签以确保可追溯性。
特点
数据集涵盖2006至2025年间波斯尼亚和黑塞哥维那、北马其顿及塞尔维亚三个欧洲国家的2576条观测记录,聚焦非正规部门就业份额这一非正规经济核心指标。数据以性别和ISIC第2级经济活动分类进行双重 disaggregation,提供年度频率的定量观测值及其状态标记,并附带指标注释和源注释字段,便于识别方法论断点或数据可靠性等级。
使用方法
研究者可通过HuggingFace的datasets库以load_dataset()函数直接加载数据并转换为Pandas DataFrame,进而执行国别筛选、时间序列分析或构建国家×年份矩阵等操作。该数据集适用于表格分类、回归及时间序列预测任务,使用时应遵循CC-BY-4.0许可协议,并同时引用国际劳工组织原始来源与Electric Sheep Europe的再包装工作。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与可比性。非正规经济就业测算作为其核心关切,直接关系到体面劳动议程与可持续发展目标(SDG 8)的监测。此数据集由Electric Sheep Europe于2025年重新封装,源自ILOSTAT的EMP_PIFL_SEX_EC2_RT指标,涵盖波斯尼亚和黑塞哥维那、北马其顿、塞尔维亚三国2006至2025年的2576条观测,以ISIC二级经济活动分类和性别为维度,刻画了正规部门之外就业份额的演变。该数据为转型经济体非正规就业的结构性研究提供了关键量化基础,亦为劳动经济学与区域发展政策的交叉分析构建了可靠面板。
当前挑战
非正规就业的测度本身构成劳动统计领域的长久难题:ILO基于国际劳工统计学家会议(ICLS)定义进行协调,但各国劳动力调查的问卷设计、抽样框与执行能力差异显著,导致跨国比较存在系统性偏误。此数据集仅覆盖三个西巴尔干国家,样本量有限且时间序列不均衡(如塞尔维亚止于2019年),难以支撑稳健的因果推断。数据中obs_status标记的“不可靠”观测及note_indicator提示的“序列断裂”,进一步增加了时序建模的复杂性。如何在有限观测下实现缺失值插补、处理断点并控制来源异质性,构成当前分析与应用的核心挑战。
常用场景
经典使用场景
在非正规经济与劳动力市场结构的研究中,该数据集常被用于刻画欧洲部分国家非正规部门就业份额的时序演变。研究者以性别和ISIC二级经济活动分类为维度,借助面板回归、时间序列分解或聚类分析,揭示不同行业非正规就业的性别差异与周期性特征。其年度频率和统一指标口径也为跨国比较提供了便利,成为分析非正规就业动态的基准数据源之一。
解决学术问题
该数据集回应了非正规就业测量中概念界定与跨源可比性的难题。基于国际劳工组织对国际劳工统计学家会议定义的协调,它提供了统一口径的非正规部门就业份额估计,缓解了以往研究因调查方法差异导致的偏误。其存在使得学者能够检验非正规就业与经济发展、性别平等及行业结构之间的理论假设,为劳动经济学和发展经济学中的非正规部门理论提供可复现的经验证据,并推动了对转型经济体劳动力市场二元结构的量化讨论。
衍生相关工作
围绕该数据集,衍生出若干有关非正规就业与性别差距的实证研究,部分工作将其与ILOSTAT其他指标整合,构建多维劳动力市场脆弱性指数。也有学者以此为基础,结合微观调查数据开展方法学比较,检验宏观非正规就业份额与个体就业状态的一致性。此外,该数据集被用于训练和验证时间序列预测模型,以及作为欧洲非正规经济空间格局分析的输入,推动了开放劳工统计数据在机器学习与政策评估中的再利用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务