遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-ind-nb-informal-employment-by-ilo-sector-and-sex-thousand

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲非正规就业的统计数据集,数据来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集覆盖3个欧洲国家(北马其顿、波斯尼亚和黑塞哥维那、塞尔维亚),时间跨度为2011年至2025年,包含1,924个观测值。核心指标为EMP_NIFL_SEX_IND_NB,表示按ILO部门和性别分类的非正规就业人数(单位为千)。数据按年度频率提供,并包含性别分类(总计、男性、女性)以及数据来源、观测状态等详细信息。数据集经过标准化处理,适用于表格分类、回归和时间序列预测等任务。

This is a statistical dataset focused on informal employment in Europe, sourced from the ILOSTAT database of the International Labour Organization (ILO). The dataset covers three European countries: North Macedonia, Bosnia and Herzegovina, and Serbia, with a time span from 2011 to 2025, containing 1,924 observations. The core indicator is EMP_NIFL_SEX_IND_NB, which represents the number of informal employment personnel classified by ILO sectors and gender, with the unit being thousand. The data is provided at annual frequency, and includes detailed information such as gender classification (total, male, female), data source, observation status, etc. The dataset has been standardized, and is applicable to tasks such as tabular classification, regression, and time series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-ind-nb-informal-employment-by-ilo-sector-and-sex-thousand 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口(https://rplumber.ilo.org/data/indicator?id=EMP_NIFL_SEX_IND_NB)直接拉取原始数据,并依据欧洲国家ISO3代码进行地理范围过滤。ILOSTAT基于国际劳工统计学家会议(ICLS)定义,对各国劳动力调查、住户收入调查及行政记录等微观数据进行标准化处理,确保数据来源的可追溯性。Electric Sheep Europe团队对数据进行了重封装与整理,以Parquet格式呈现,便于机器学习与时间序列分析领域的直接使用。
特点
数据集收录了2011年至2025年间3个欧洲国家(北马其顿、波黑、塞尔维亚)共计1924条观测记录,聚焦于按ILO行业与性别划分的非正规就业人数(单位:千)。数据具备多维细分特性,涵盖性别(总、男、女)及行业分类变量,并包含观测值标识与注释信息(如系列中断、方法修订等),为研究者提供严格的元数据支持。其时间跨度长达15年,适合进行跨年度趋势分析与面板数据建模。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数快速调用该数据,并转换为Pandas DataFrame进行后续操作。典型应用包括按国家或性别筛选子集、绘制特定指标的时序折线图(如`obs_value`随时间变化),以及利用`pivot_table`构建国家×年份的观测值矩阵。数据中的`time`字段为整型年份,`obs_value`为浮点数,适合直接用于回归分析与时间序列预测任务。此外,分类变量(如`ref_area`、`sex`)可用于分组统计与可视化探索。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,依托其核心数据库ILOSTAT,于2025年由Electric Sheep Europe重新打包发布,聚焦欧洲地区非正式就业的统计测量。数据集涵盖2011至2025年间北马其顿、波斯尼亚和黑塞哥维那以及塞尔维亚三个国家的1,924条观测记录,核心研究问题在于通过ILO部门与性别维度解构非正式就业的规模与结构。作为全球劳动统计的权威来源,ILOSTAT的数据为政策制定者与研究者提供了评估劳动力市场非正规化程度、追踪可持续发展目标中体面工作进展的关键依据,尤其在欧洲转型经济体的劳动政策设计中具有重要影响力。
当前挑战
该数据集应对的领域核心挑战在于非正式就业的统计标准不统一与跨国可比性不足——不同国家对“非正规部门”的定义差异(如是否纳入农业或家庭帮工)导致国别数据难以直接对比。构建过程中的挑战包括:数据来源多元化(劳动力调查、行政记录等)带来的方法衔接问题,同一国家不同年份因调查方法变更产生的序列断裂(如数据集中的break in series标记);以及ILO因数据可靠性标志(如‘U’表示不可靠)的存在,反映了原始调查在覆盖小规模非正规经济主体时的样本代表性难题。
常用场景
经典使用场景
该数据集最为经典的使用场景在于对欧洲地区非正规就业的时空演化规律进行系统性建模。基于国际劳工组织(ILO)统一的行业与性别分类标准,研究者能够利用涵盖2011至2025年间、来自北马其顿、波黑和塞尔维亚三国共计1924条观测值的时间序列数据,探究非正规就业规模在不同经济部门和性别维度的分布特征与动态趋势。通过将观测值按年份与国家进行面板数据重构,学者可以运用固定效应模型或面板向量自回归方法,揭示非正规就业在宏观劳动力市场中的结构性变迁。
解决学术问题
该数据集核心解决了欧洲转型经济体非正规就业测度中存在的跨国可比性不足与长时序数据缺失这两大学术难题。借助ILOSTAT严谨的方法论框架与ICLS国际劳工统计学家会议标准定义,数据实现了跨国家、跨年份的规范化整合,为研究非正规就业与劳动力市场制度、宏观经济周期、产业结构升级等变量之间的因果关系提供了可靠的数据基础。其意义在于突破了此前单一国家案例研究的局限性,使学术界能够在区域层面系统评估非正规就业的发展态势,进而为劳动力市场理论的本土化修正提供经验证据。
衍生相关工作
该数据集衍生出的相关工作主要集中在三个方向:一是基于面板数据计量方法探讨非正规就业与全球价值链嵌入程度之间的互动机制,二是利用自然语言处理技术对ILOSTAT源数据中的调查方法修订注释进行文本挖掘,以量化统计口径变化对就业指标一致性的影响,三是构建结合宏观经济变量的非正规就业长短期预测模型。这些研究成果不仅推动了劳动经济学与计算社会科学的交叉融合,还催生了诸如劳动力统计数据库质量评估框架和跨国就业指标动态校准方法等工具性创新。数据集由Electric Sheep Europe进行重打包与标准化处理,进一步降低了研究者获取和预处理跨国劳动统计数据的门槛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务