遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-ste-nb-informal-employment-by-sex-and-status-in-employmen

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲34个国家从2003年至2025年关于非正规就业的统计数据,共有12,996条观测记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并经过筛选,仅包含欧洲国家。核心指标为EMP_NIFL_SEX_STE_NB,即按性别和就业状况划分的非正规就业人数(以千人为单位)。数据集提供了详细的字段结构,包括国家代码和名称、数据来源代码和标签、指标代码和标签、性别分类(总计、男性、女性)、观测年份、观测数值、数据状态标志以及相关注释。数据按性别维度进行细分,并包含数据质量说明,例如数据为年度频率,当同一国家同年份有多个数据来源时,采用ILO选择的最佳来源。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究欧洲劳动力市场、非正规经济提供机器学习就绪的数据支持。

This dataset contains 12,996 observations of informal employment data across 34 European countries, spanning the years 2003–2025. It is sourced from ILOSTAT, the International Labour Organizations central statistics database, specifically via the REST API for the indicator EMP_NIFL_SEX_STE_NB (Informal employment by sex and status in employment, in thousands). The data is filtered to European ISO3 country codes and includes detailed columns such as country codes and labels, source codes and labels, indicator codes and labels, sex disaggregation (total, male, female), observation year, observed values, observation status flags, and related notes. The dataset is disaggregated by sex and includes caveats on data quality, such as annual frequency and the use of ILO-selected best source when multiple sources exist. It is repackaged by Electric Sheep Europe for machine learning readiness and supports tasks like tabular classification, regression, and time-series forecasting related to labor market and informal economy analysis in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-ste-nb-informal-employment-by-sex-and-status-in-employmen 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接提取指标EMP_NIFL_SEX_STE_NB的原始记录,并依据ISO3国家代码筛选出34个欧洲国家。原始调查微数据经ICLS(国际劳工统计学家会议)定义进行标准化调和,来源信息在source.label列中标注以保证可追溯性。Electric Sheep Europe对提取的数据进行重新打包,统一模式并发布为Parquet格式,最终形成涵盖2003至2025年、共12,996条观测的表格型数据集。
特点
数据集聚焦于欧洲非正规就业领域,以千人计量单位记录按性别和就业身份分类的非正规就业人数。其核心特点包括:时间跨度长达二十余年,覆盖34个欧洲国家,且包含SEX_T、SEX_M、SEX_F三种性别分类;数据以年度频率发布,每个国家-年份组合可能关联多个就业身份分类;同时附带来源标签、观测状态标志及详尽注释列,便于评估数据质量与追溯方法变更。整体规模适中,适用于劳动经济学与性别就业差异的实证分析。
使用方法
研究者可通过HuggingFace的datasets库调用load_dataset函数加载该数据集,并转换为Pandas数据框进行后续操作。典型用法包括筛选特定国家(如df[df["ref_area"] == "DEU"])以开展国别研究,或对单一指标按时间排序并绘制趋势图以观察非正规就业动态。此外,利用pivot_table方法可将数据重塑为国家×年份矩阵,便于进行面板数据分析或跨国比较。所有操作均基于简洁的API接口,适用于分类、回归及时间序列预测等任务。
背景与挑战
背景概述
非正规就业作为全球劳动力市场的重要构成,其规模与结构深刻反映经济发展的包容性与社会保障覆盖水平。国际劳工组织(ILO)长期致力于劳动统计标准化,ILOSTAT数据库汇聚200余个经济体的劳动力调查数据,为监测非正规经济提供权威基准。本数据集由Electric Sheep Europe于2025年重新封装,源自ILO的EMP_NIFL_SEX_STE_NB指标,涵盖2003至2025年间34个欧洲国家12,996条观测记录,按性别与就业身份细分非正规就业人数(千人)。该数据集为劳动经济学、社会政策评估及可持续发展目标(SDG)中的体面劳动研究提供了精细化的时间序列与横截面数据支持。
当前挑战
非正规就业的测度面临概念界定与跨国可比性的双重困境:ILO依据国际劳工统计学家会议(ICLS)定义协调各国调查,但各国对非正规部门、非正规就业的界定随法律与社会保障体系差异而变动,导致数据序列存在断裂与口径不一致。构建过程中,数据源自不同年份的劳动力调查、家庭收入调查等异构来源,需处理缺失值、来源更替及观测状态标记(如临时性、不可靠),并确保性别与就业身份分类的完整映射。此外,部分国家时间跨度不均衡,早期年份数据稀疏,对趋势分析与跨国比较构成挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集堪称探究欧洲非正规就业性别差异与就业身份分化的经典面板数据资源。其以千人为单位的非正规就业观测值,覆盖三十四国、逾十二年跨度,为研究者提供了按性别与就业身份双重维度解构非正规就业规模与结构的基准素材。经典应用场景包括:构建国别非正规就业率时间序列、开展性别维度的比较分析,以及考察不同就业身份(如自雇、家庭帮工等)在非正规就业中的分布变迁。
实际应用
在政策实践层面,该数据集为国际组织与各国劳工部门监测非正规就业态势、评估体面劳动目标进展提供了量化依据。其年度频率与长时序特征,使之可用于识别非正规就业的周期性波动与结构性趋势,辅助制定针对女性、自雇者等脆弱群体的就业保护政策。此外,该数据集亦被用于构建机器学习预测模型,如时间序列预测与分类任务,以预判非正规就业演变路径,支撑前瞻性政策规划。
衍生相关工作
该数据集衍生了一系列围绕非正规就业测度与性别劳动差异的经典研究。基于ILOSTAT框架,学者们开展了非正规就业与经济增长、贫困及社会保障覆盖的关联分析,并发展出多国比较的非正规就业分类体系。部分工作聚焦于就业身份转变对非正规就业规模的影响,另一些则利用该数据校验非正规就业统计方法的一致性。这些研究共同丰富了非正规经济学的实证文献,并强化了ILO统计标准在全球劳动治理中的参照地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务