遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-age-dsb-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲31个国家从2007年至2025年的非正规经济就业数据,共有25,510个观测值,覆盖1个核心指标:按性别、年龄和残疾状况划分的非正规部门就业份额(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤欧洲国家代码,确保数据权威性和一致性。数据集以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、性别分类、年龄和残疾状况分类、观测年份、观测值及其状态标志等列。数据按年度频率提供,并经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)的定义进行协调。数据集适用于表格分类、回归和时间序列预测等机器学习任务,可用于分析欧洲非正规就业的趋势和模式。

This dataset contains 25,510 observations of informal economy employment data across 31 European countries, spanning from 2007 to 2025, covering one key indicator: the share of employment outside the formal sector by sex, age and disability status (%). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, extracted via API and filtered for European country codes, ensuring authority and consistency. The dataset is organized in tabular format, including columns such as country code, country name, data source, indicator code, sex classification, age and disability status classification, observation year, observed value, and status flags. Data is provided at annual frequency and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, enabling analysis of informal employment trends and patterns in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-age-dsb-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,原始数据通过ILOSTAT REST API接口直接获取,并依据欧洲ISO3国家代码进行筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行统一协调,确保跨国可比性。Electric Sheep Europe在此基础上对数据进行重新打包,规范模式并发布为HuggingFace数据集,同时保留来源标签以供追溯。
特点
数据集涵盖2007至2025年间31个欧洲国家的25,510条观测记录,聚焦于非正规部门就业份额这一核心指标。数据按性别、年龄和残疾状况进行多维分解,包含SEX_T、SEX_M、SEX_F三种性别分类以及年龄组和残疾状态分类。每条记录附有来源、指标代码、观测状态及分类注释等元数据,时间跨度为年度频率,支持表格分类、回归及时间序列预测等多种分析任务。
使用方法
研究者可通过HuggingFace的datasets库以load_dataset函数直接加载数据集,并转换为Pandas DataFrame进行后续处理。典型操作包括按国家代码筛选子集、按指标代码提取单指标时间序列、以及透视生成国家与年份的矩阵表格。数据亦支持绘制时间趋势图或构建跨国比较面板,便于开展非正规就业的实证研究与预测建模。
背景与挑战
背景概述
非正规经济就业测算长期构成劳动统计领域的核心议题,国际劳工组织(ILO)依托国际劳工统计学家会议(ICLS)定义框架,通过ILOSTAT平台汇聚各国劳动力调查与家庭收入调查等微观数据,构建跨经济体可比的就业部门归属指标。该数据集由Electric Sheep Europe于2025年从ILOSTAT REST API抽取并重新封装,覆盖31个欧洲国家2007至2025年间25,510条观测,按性别、年龄与残疾状况细分,为非正规就业的跨国比较与时间序列分析提供标准化数据基础,对监测体面劳动目标及非正规经济规模具有重要参考价值。
当前挑战
该数据集所回应的领域难题在于非正规就业界定本身存在显著国别差异,各国调查问卷、抽样设计与残疾判定标准不一,ILO虽经协调处理,仍难以彻底消除跨国不可比性,且残疾维度数据多依赖非标准定义。构建过程中的挑战亦不容忽视,原始API仅提供分散的指标序列,需经国家代码筛选、多源最优来源抉择、分类变量对齐与缺失值甄别等步骤,部分观测带有不可靠或临时性状态标记,高维分类字段的稀疏发布进一步增加了数据清洗与建模前处理的复杂度。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集凭借其覆盖三十一个欧洲国家、时间跨度近二十年的面板结构,成为刻画非正规部门就业演变态势的经典数据来源。研究者常以性别、年龄与残疾状态三个维度为切入点,构建跨国比较分析框架,借助时间序列分解与面板回归等方法,揭示不同人口群体在非正规就业中的分布差异及其动态收敛特征。
解决学术问题
该数据集有效回应了非正规就业测量中长期存在的口径不一致与跨国可比性不足等难题。依托国际劳工组织统一协调的统计定义与来源标注机制,研究者得以在标准化框架下检验性别歧视、年龄分层与残疾排斥等理论假说,进而深化对劳动力市场边缘化机制的理解,为包容性就业政策的实证评估提供了可靠的数据基础。
衍生相关工作
围绕该数据集,学界衍生出一系列聚焦非正规就业决定因素与福利效应的经典研究。相关工作或将其与收入调查、社会保障覆盖数据加以链接,考察非正规就业与贫困脆弱性之间的关联;或运用机器学习方法进行就业状态预测与群体聚类分析。这些衍生研究持续拓展着该数据集在比较劳动制度分析与政策模拟中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务