遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-eco-edu-nb-employment-outside-the-formal-sector-by-sex-econom

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲35个国家从2003年至2025年的非正式经济就业数据,共有141,870个观察值,覆盖1个主要指标:按性别、经济活动和教育划分的正式部门外就业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过协调处理以符合国际劳工统计学家会议(ICLS)的定义。数据集采用表格格式,包含国家代码、国家名称、来源代码、指标代码、性别分类、经济活动和教育分类、观测年份、观测值及其状态标志等列。数据为年度频率,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Europe重新打包,以提供统一的、适合机器学习使用的欧洲数据层。

This dataset contains informal economy employment data for 35 European countries spanning from 2003 to 2025, with 141,870 observations covering one main indicator: Employment outside the formal sector by sex, economic activity and education (thousands). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions. It is structured in tabular format, including columns for country codes, country names, source codes, indicator codes, sex disaggregation, economic activity and education classifications, observation year, observed values, and status flags. The data is annual frequency and suitable for tabular classification, regression, and time-series forecasting tasks. The dataset is repackaged by Electric Sheep Europe to provide a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-eco-edu-nb-employment-outside-the-formal-sector-by-sex-econom 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT中央统计数据库构建,通过REST API接口直接提取非正规经济部门就业指标(EMP_PIFL_SEX_ECO_EDU_NB),并依据ISO3国家代码筛选欧洲地区数据。原始数据源自各国劳动力调查、家庭收入调查及行政记录,由ILO统计局依据国际劳工统计学家会议(ICLS)定义进行标准化调和,每条记录均标注来源标签以确保可追溯性,最终由Electric Sheep Europe完成模式规范化与Parquet格式封装。
特点
数据集涵盖2003至2025年间35个欧洲国家的141,870条观测记录,以千人为单位量化非正规部门就业规模。数据按性别(总计、男性、女性)、经济活动部门和教育程度三个维度进行交叉分类,包含国家代码、指标代码、观测值及质量状态标志等完整字段。其突出特点在于时间跨度长、地理覆盖广、 disaggregation维度丰富,且每条记录附带来源注释与统计可靠性标记,便于研究者评估数据质量。
使用方法
研究者可通过HuggingFace datasets库以load_dataset()函数直接加载数据并转换为Pandas数据框,进而执行多维分析。典型操作包括按国家代码筛选特定经济体、按指标代码提取时间序列进行趋势可视化、或通过透视表将数据重组为国家×年份矩阵以支持面板回归与预测建模。数据亦可直接应用于表格分类、回归及时间序列预测等机器学习任务,为非正规经济研究提供结构化输入。
背景与挑战
背景概述
非正规部门就业的统计测度始终是全球劳动治理中的关键议题,国际劳工组织长期致力于推动非正规经济概念框架的标准化。本数据集由国际劳工组织统计部门(ILOSTAT)编纂,经Electric Sheep Europe于2026年重新封装发布,涵盖2003至2025年间35个欧洲国家共计141,870条观测记录,聚焦按性别、经济活动及教育程度分列的非正规部门外就业规模。该数据集根植于国际劳工统计学家会议(ICLS)的统一定义体系,通过整合各国劳动力调查与家庭收入调查等微观数据源实现跨国可比性,为探究欧洲非正规就业的结构性差异、性别鸿沟及教育回报异质性提供了坚实的数据基础。
当前挑战
在领域问题层面,非正规部门就业的界定与度量长期面临概念模糊、国别定义分歧以及测度口径不统一的困境,尤其当经济活动分类与教育维度交叉细分时,观测稀疏与统计功效不足的问题尤为突出。在构建过程中,数据集面临多重挑战:各国调查工具与抽样设计的异质性导致跨国可比性受损;部分观测因样本量不足或方法修订而被标记为不可靠或序列断裂;多个数据源并存时须依赖ILO的'最佳来源'选择机制,可能引入选择性偏误;此外,分类变量仅在指标发布相应细分时才非空,造成数据结构上的非平衡性,增加了建模与推断的复杂性。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最为经典的使用场景在于刻画欧洲各国非正规部门就业的性别差异与结构性演变。研究者依托覆盖35国、2003至2025年逾十四万条观测记录,以性别、经济活动部门与教育程度三重维度对非正规就业进行解构,进而构建跨国面板数据,用以检验非正规就业规模随经济发展阶段与教育水平提升而收敛的假说,并揭示不同性别在非正规劳动力市场中的差异化处境。
解决学术问题
该数据集有效回应了非正规就业测量中长期存在的口径不一与跨国可比性不足问题。借助国际劳工组织依据国际劳工统计学家会议定义所进行的标准化协调,研究者得以在统一框架下考察性别、教育与经济活动部门之间的交互效应,弥补了既往研究多囿于单一国家或短时序的局限。其意义在于为比较劳动制度理论提供了可靠的实证基础,并推动非正规经济研究从描述性统计向因果推断转型。
衍生相关工作
围绕该数据集,学界相继衍生出若干经典研究脉络。其一,基于跨国面板的非正规就业收敛性检验与制度决定因素分析;其二,将性别与教育维度引入非正规就业的分解研究,探讨性别不平等在非正规部门中的再生产机制;其三,结合时间序列方法开展非正规就业的预测与周期波动研究。这些工作共同拓展了国际劳工统计数据库在比较政治经济学与计量劳动经济学中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务