遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-edu-nb-employment-outside-the-formal-sector-by-sex-and-ed

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲35个国家2003年至2025年期间按性别和教育划分的非正规部门就业统计数据(单位:千),共9,262个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,涵盖唯一指标EMP_PIFL_SEX_EDU_NB。数据集包含国家代码、国家名称、数据来源、指标代码、性别分类、教育分类、年份、观测值及数据状态等字段,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 9,262 observations of informal economy employment data across 35 European countries from 2003 to 2025, disaggregated by sex and education (in thousands). Sourced from the International Labour Organizations ILOSTAT database via API, it includes the single indicator EMP_PIFL_SEX_EDU_NB. The dataset features fields such as country codes, country names, data sources, indicator codes, sex and education classifications, year, observed values, and data status flags, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-edu-nb-employment-outside-the-formal-sector-by-sex-and-ed 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口直接获取非正规经济部门就业指标(EMP_PIFL_SEX_EDU_NB)的原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,最终由Electric Sheep Europe重新封装为Parquet格式,形成涵盖2003至2025年、35个欧洲国家的9262条观测记录。
特点
数据集聚焦于欧洲地区非正规部门就业状况,按性别与教育程度进行交叉分类,以千人为计量单位。其核心特征包括:时间跨度逾二十年,覆盖35个欧洲国家,提供性别(总计、男性、女性)与教育水平的多维分解;每条记录附带来源标签、观测状态标记及方法学变更注释,确保数据可追溯性;数据结构为表格型,适用于分类、回归及时间序列预测等多类任务。
使用方法
使用者可通过HuggingFace的datasets库以load_dataset函数加载数据集,并转换为Pandas数据框进行后续分析。典型操作包括按国家代码筛选特定国家数据、按指标代码提取单一指标的时间序列、以及构建国家与年份的透视表矩阵。数据支持可视化绘图与统计建模,适用于非正规就业的性别差异、教育维度及跨国比较研究。
背景与挑战
背景概述
非正规部门就业长期以来构成全球劳动力市场的重要组成,其规模与结构深刻反映经济发展的包容性与社会保障的覆盖程度。国际劳工组织(ILO)自二十世纪中叶起持续推动非正规就业统计的标准化工作,ILOSTAT作为其核心统计数据库,汇聚了二百余个经济体的劳动力调查与家庭收入调查数据。本数据集由Electric Sheep Europe于2025年重新打包发布,覆盖35个欧洲国家2003至2025年间按性别与教育程度分列的非正规部门就业观测值,共计9262条记录。该数据集为劳动经济学、社会政策评估及非正规经济研究提供了可比较的跨国面板基础,对监测体面劳动目标与教育—就业匹配关系具有重要参考价值。
当前挑战
该数据集所回应的领域问题在于非正规就业的性别差异与教育梯度如何随时间和国别演变,其核心挑战源于非正规就业概念本身的多维性与统计口径的异质性。ILOSTAT虽依据国际劳工统计学家会议(ICLS)定义进行协调,但各国劳动力调查在抽样设计、问卷措辞及非正规部门界定上仍存差异,导致跨国比较需审慎对待。构建过程中,数据经REST API抽取后需完成ISO3国家代码映射、分类变量对齐及来源标记追溯,部分观测值被标注为“不可靠”或“序列中断”,加之不同国家年份覆盖不均衡,对时间序列建模与缺失值处理构成实质性困难。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于刻画欧洲各国非正规部门就业的性别与教育梯度及其时序演化。研究者常以国别面板为分析单元,将非正规就业人数按性别与教育程度分层,借助时间序列分解或面板回归模型,揭示不同受教育群体在非正规经济中的分布差异与收敛趋势,从而为劳动力市场分层理论提供跨国证据。
实际应用
在政策实践层面,该数据集为国际组织与各国劳工部门监测非正规就业规模、评估体面劳动目标进展提供了量化依据。社会保障机构可据此识别低教育水平女性等脆弱群体的集中分布,优化就业培训与社会保护资源配置;同时,其国别时序特征亦可用于构建非正规就业预警指标,辅助政策制定者预判经济波动对非正规部门的影响。
衍生相关工作
围绕该数据集,已有研究衍生出多条经典工作脉络。部分学者将其与ILOSTAT其他指标合并,构建欧洲非正规就业综合指数,用于比较分析福利体制差异;亦有研究将其作为因变量,检验教育扩张、产业结构转型与劳动力市场规制对非正规就业的因果效应。此外,该数据集常被用作机器学习模型在表格数据回归与时序预测任务中的基准,促进了劳动统计数据的可计算化与可复现研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务