遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-ocu-edu-rt-informal-employment-rate-by-sex-occupation-and-edu

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含91,074个观测值,覆盖35个欧洲国家,时间跨度为2003年至2025年,主要指标为非正规就业率(按性别、职业和教育程度分类)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集包含详细的列结构,如国家代码、性别分类、教育程度、职业分类、观测年份和观测值等,并提供了数据质量说明和使用示例。

This dataset contains 91,074 observations across 35 Europe countries, spanning from 2003 to 2025, with the main indicator being the informal employment rate by sex, occupation, and education. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, harmonized and packaged for machine learning tasks such as tabular classification, regression, and time-series forecasting. It includes detailed columns like country code, sex disaggregation, education and occupation classifications, observation year, and value, along with data quality notes and usage examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-ocu-edu-rt-informal-employment-rate-by-sex-occupation-and-edu 数据集图片
构建方式
该数据集由Electric Sheep Europe整理并重新打包,源自国际劳工组织(ILO)的ILOSTAT统计数据库,其核心指标为按性别、职业和教育水平划分的非正规就业率(%)。数据通过ILOSTAT的REST API直接获取,并依据ISO 3166-1 alpha-3编码筛选出35个欧洲国家,覆盖2003年至2025年的年度观测值,总计91,074条记录。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行统一协调处理,每个观测值均附有来源标识(source.label),确保数据的可追溯性与方法的合规性。
特点
该数据集具有显著的结构化特征,涵盖性别(总、男、女)、职业技能水平和教育程度等关键分类维度,为多维度的劳动经济分析提供支撑。每条记录包含丰富的元数据,如观测状态(obs_status)和备注(note_indicator),有助于识别数据质量与序列中断等细微情况。数据遵循CC-BY-4.0许可协议,来源权威,且时间跨度长、覆盖国家广泛,为研究欧洲非正规经济的时空演变提供了独特的量化基础,尤其适用于面板数据分析和时间序列建模。
使用方法
该数据集设计为可直接通过HuggingFace Datasets库加载,用户只需调用load_dataset函数即可获取完整的数据框。结合Python生态中的pandas等工具,研究者能便捷地进行数据筛选,例如按国家(如德国)过滤或按指标进行时间序列排序。数据集的宽表结构支持透视操作,可轻松转换为国家×年份的矩阵,进而用于回归分析或预测建模。同时,数据附带的引用信息(BibTeX)和原始来源链接,便于学术研究中的规范引用与数据溯源。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年重新整理并发布于HuggingFace平台,旨在提供欧洲地区非正规就业率按性别、职业和教育水平分类的详细统计数据。数据源自ILOSTAT数据库,涵盖2003至2025年间35个欧洲国家的91,074条观测记录,是研究非正规经济劳动市场动态的重要资源。数据集的核心研究问题在于揭示欧洲各国非正规就业的结构性特征与演变趋势,为劳动经济学、社会政策及可持续发展目标(SDG)的量化分析提供可靠数据支撑。其发布不仅促进了跨国比较研究,还为机器学习模型在时间序列预测和分类任务中的应用提供了标准化、高质量的训练数据,对劳动统计领域的数据共享与开放科学实践具有积极影响。
当前挑战
该数据集面临的挑战主要体现在领域问题与数据构建两方面。在领域层面,非正规就业的界定与国际比较存在复杂性,不同国家由于劳动力调查方法、法律框架和统计口径的差异,导致数据可比性受限;此外,非正规就业率受经济周期、政策干预和社会文化因素影响,其动态变化为预测模型带来难度,需要精细处理时间序列的非平稳性和异常值。在数据构建过程中,数据整合面临多重障碍:数据的多源性与异构性要求对来自各国劳动力调查、住户收入调查及行政记录的数据进行严格清洗与标准化;ILO采纳的最佳来源选择规则可能导致不同年份间的数据断裂,需通过观测状态标记(如'不可靠')和注释信息加以识别;同时,数据的稀疏性——部分国家或年份的细分维度(如特定职业或教育水平)缺失,以及年度频率对更高时间分辨率的限制,均对数据集的完整性和应用范围构成挑战。
常用场景
经典使用场景
该数据集的核心用途在于对欧洲各国非正规就业率进行多维度剖析,涵盖性别、职业及教育水平等关键人口学特征。通过整合国际劳工组织权威统计资料,研究者能够构建面板数据模型,系统评估不同群体在非正规经济中的参与状况,进而揭示劳动力市场中的结构性差异与潜在不均衡现象。此类分析为劳动经济学领域提供了坚实的实证基础。
实际应用
在实际应用层面,该数据集的巨大价值体现在为政策制定者提供精准的决策依据。基于此,可分析各国非正规就业的演变趋势与群体特征,评估现有就业政策及社会保障制度的覆盖效果,有助于识别需要重点扶持的弱势群体,从而制定更具针对性的劳动力市场政策,促进体面就业目标的实现。
衍生相关工作
该数据集激发了多项延伸工作,如构建欧洲非正规就业的预测模型,探索其与宏观经济指标、移民流动及教育回报之间的关联。基于此数据,已有研究进一步开发了可交互的可视化分析工具,便于直观展示非正规就业的时空格局演变。此外,它也常被用作衡量可持续发展目标(SDG)中体面工作相关指标的关键数据源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务