遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-age-ocu-rt-informal-employment-rate-by-sex-age-and-occupation

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲34个国家从2003年至2025年的166,663个观测值,专注于非正规经济领域,具体指标为按性别、年龄和职业划分的非正规就业率(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过筛选以覆盖欧洲国家。数据集采用表格形式,包含多个列,如国家代码(ref_area)、国家名称(ref_area.label)、来源代码(source)、来源标签(source.label)、指标代码(indicator)、指标标签(indicator.label)、性别分类(sex)、性别标签(sex.label)、第一分类变量(classif1)、第一分类标签(classif1.label)、第二分类变量(classif2)、第二分类标签(classif2.label)、年份(time)、观测值(obs_value)、观测状态(obs_status)等。数据按性别(总计、男性、女性)进行细分,并可能包含年龄和职业等其他分类维度。数据质量方面,为年度频率,ILO在多个来源中选择最佳来源以确保一致性。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究人员和开发者提供机器学习就绪的欧洲劳动力统计数据。数据集由Electric Sheep Europe重新打包,遵循CC-BY-4.0许可。

This dataset contains 166,663 observations of informal economy data across 34 European countries, spanning from 2003 to 2025, with a focus on the indicator Informal employment rate by sex, age and occupation (%). The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, retrieved via its REST API and filtered to European country codes. It is presented in tabular format with columns including country code (ref_area), country name (ref_area.label), source code (source), source label (source.label), indicator code (indicator), indicator label (indicator.label), sex disaggregation (sex), sex label (sex.label), first classification variable (classif1), first classification label (classif1.label), second classification variable (classif2), second classification label (classif2.label), year (time), observed value (obs_value), observation status (obs_status), among others. The data is disaggregated by sex (total, male, female) and may include other dimensions like age and occupation. In terms of data quality, it is annual frequency, and the ILO-selected best source is used when multiple sources exist for the same country and year. This dataset is suitable for tasks such as tabular classification, regression, and time-series forecasting, designed to provide machine learning-ready labor statistics for Europe. It is repackaged by Electric Sheep Europe and released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-age-ocu-rt-informal-employment-rate-by-sex-age-and-occupation 数据集图片
构建方式
该数据集的数据源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过其REST API接口直接获取指标代码为EMP_NIFL_SEX_AGE_OCU_RT的原始数据,并依据ISO3国家代码筛选出欧洲国家样本。原始调查微观数据经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行标准化调和,每个观测值均标注来源以保障可追溯性。Electric Sheep Europe对获取的数据进行重新打包与模式规范化,最终形成结构化的Parquet格式数据集。
特点
数据集涵盖2003年至2025年间34个欧洲国家的166,663条观测记录,以性别、年龄和职业三个维度细分非正规就业率。数据包含国家代码、来源标识、指标代码、性别分类、年龄分类、职业分类、年份及观测值等字段,并提供详细的观测状态标志与注释信息。其时间跨度长、地理覆盖广、分类维度丰富,且为单语言英语呈现,适用于表格分类、回归及时间序列预测等多重任务。
使用方法
研究者可通过Hugging Face的datasets库以load_dataset函数直接加载数据集,并利用to_pandas方法转换为数据框以便分析。典型操作包括按国家代码筛选特定国家数据、按指标代码提取单一指标的时间序列、或通过透视表构建国家与年份的矩阵视图。数据集亦提供完整的引用信息与遵循CC-BY-4.0许可的使用条款,确保学术使用的规范性与合法性。
背景与挑战
背景概述
非正规就业作为全球劳动力市场结构性议题,长期困扰社会保障体系与劳动者权益保障。国际劳工组织(ILO)依托其中央统计数据库ILOSTAT,于2003年起系统采集按性别、年龄与职业分类的非正规就业率数据,覆盖34个欧洲国家,累计166,663条观测记录。Electric Sheep Europe于2025年将该数据集重新封装发布,旨在为机器学习与计量研究提供标准化、可复现的数据基础。该数据集回应了非正规就业测度长期缺乏跨国可比性的核心问题,为劳动经济学、社会政策评估及可持续发展目标(SDG)中体面劳动指标的追踪提供了关键经验支撑。
当前挑战
所解决的领域问题面临多重挑战:非正规就业定义在不同国家间存在制度性差异,ILO虽以国际劳工统计学家会议(ICLS)标准进行协调,但各国劳动力调查、家庭收入调查与行政记录的测量口径仍难以完全统一,导致跨国比较存在系统性偏差。构建过程中亦面临显著困难:部分国家数据缺失或年份不连续,同一国家×年份存在多源数据需依据ILO最优来源准则筛选,且序列中断、非标准年龄分组、数据可靠性标记等问题普遍存在。此外,职业分类维度的稀疏性与性别、年龄交叉分层后的样本量缩减,进一步增加了统计建模与预测的复杂性。
常用场景
经典使用场景
在劳动经济学与非正规就业研究的广袤领域中,该数据集凭借其精细的性别、年龄与职业三维度交叉分类,成为刻画欧洲非正规就业率时空演变的经典工具。研究者常利用其面板结构,构建国家—年份—人口群体的多层模型,以揭示非正规就业的异质性分布规律。例如,通过对比青年与成年劳动者在低技能职业中的非正规就业比例,可精准识别脆弱就业的集聚地带。
实际应用
在政策制定与劳动力市场监测的实务场景中,该数据集为欧盟及各国劳工部门提供了动态追踪非正规就业风险群体的基础信息。社会保障机构可据此识别需要扩大覆盖的行业与人群,职业培训机构可针对高非正规率的职业类别设计技能升级方案。同时,咨询机构与国际组织亦借助其时间序列特征,评估危机时期非正规就业的弹性与脆弱性。
衍生相关工作
围绕该数据集,一系列衍生研究相继涌现。比较政治经济学文献利用其构建非正规就业的制度决定因素模型,发展经济学研究则将其与微观家户调查匹配,探讨非正规就业与贫困代际传递的关联。此外,机器学习社区以其为基准,开发了针对高维分类变量的缺失值插补与预测算法,推动了表格数据建模方法在社会科学中的落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务