遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-ocu-dsb-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了欧洲31个国家从2007年至2025年间关于非正规经济就业比例的13,732个观测数据。具体指标为按性别、职业和残疾状况划分的非正规部门就业比例(%)(ILOSTAT指标代码:EMP_PIFL_SEX_OCU_DSB_RT)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API获取并过滤为欧洲国家。数据集提供了详细的分类维度,包括性别(总计、男性、女性)、职业(按技能水平分类)和残疾状况。数据结构包含国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、职业分类、残疾状况分类、观测年份、观测值、观测状态标志以及相关注释等信息。该数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,旨在为研究欧洲非正规经济就业模式提供标准化的、机器学习就绪的数据。

This dataset contains 13,732 observations of informal economy employment data across 31 European countries from 2007 to 2025. The specific indicator is Share of employment outside the formal sector by sex, occupation and disability status (%) (ILOSTAT indicator code: EMP_PIFL_SEX_OCU_DSB_RT). Data is sourced from the International Labour Organizations ILOSTAT database, retrieved via its REST API and filtered to European countries. The dataset provides detailed disaggregation dimensions including sex (total, male, female), occupation (by skill level), and disability status. The data structure includes country codes, country names, data sources, indicator codes, indicator names, sex classification, occupation classification, disability status classification, observation year, observed values, observation status flags, and relevant notes. This dataset is suitable for machine learning tasks such as tabular classification, tabular regression, and time-series forecasting, aiming to provide standardized, ML-ready data for studying informal economy employment patterns in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-ocu-dsb-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集以国际劳工组织(ILO)的ILOSTAT中央统计数据库为数据源,通过REST API接口直接提取指标EMP_PIFL_SEX_OCU_DSB_RT的原始记录,并依据ISO3国家代码筛选出欧洲地区31个国家的观测数据。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行统一协调,每个观测均标注来源代码以保障可追溯性。Electric Sheep Europe对原始数据实施标准化重封装,生成机器学习就绪的Parquet格式数据集,涵盖2007至2025年间的13732条记录。
特点
该数据集聚焦于非正规部门就业份额的性别、职业与残疾状况三维分解,时间跨度逾十八年,覆盖欧洲31国,观测频度为年度。数据以表格结构组织,包含国家代码、来源标识、指标编码、性别分类、职业分类、残疾状况分类及观测值等字段,分类维度非空时方提供细分数据。数据集附带观测状态标志与多层级注释信息,如非标准残疾定义提示,为分析数据可靠性与定义差异提供依据。其体量介于一万至十万行之间,适用于表格分类、回归及时间序列预测任务。
使用方法
使用者可通过HuggingFace的datasets库以load_dataset函数加载数据集,并转换为Pandas数据框进行后续分析。典型操作包括按ref_area字段筛选特定国家(如DEU),或按indicator字段提取单一指标并依时间排序以绘制时间序列图。亦可利用pivot_table函数将数据重塑为国家与年份的矩阵形式,便于跨国比较或面板数据分析。数据集支持直接接入机器学习流水线,适用于非正规就业领域的探索性分析与预测建模。
背景与挑战
背景概述
国际劳工组织长期致力于全球劳动力市场统计监测,其ILOSTAT数据库为比较劳动经济学研究提供了权威基准。在此脉络下,Electric Sheep Europe将ILO按性别、职业与残疾状况分列的非正规部门外就业占比指标重新整合,形成覆盖31个欧洲国家、2007至2025年共13732条观测的数据集。该数据集回应了非正规就业测度标准化不足的问题,为探究弱势群体在正规部门边缘化的结构性成因、评估体面劳动目标进展提供了跨国可比的基础数据资源。
当前挑战
非正规就业界定本身依赖各国劳动统计口径,残疾状况的操作化定义在成员国间差异显著,部分国家数据缺失或仅偶发采集,导致跨国比较面临测量等价性威胁。数据中大量观测状态标注为不可靠或临时性,英国等国家时间序列于2018年中断,削弱了面板分析的连续性。数据集虽提供来源标签与注释字段,但用户仍需审慎处理定义不一致、样本量稀疏与指标口径变迁等固有局限,方可避免推断偏误。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于刻画欧洲各国非正规部门就业份额的时空演变格局。研究者借助其覆盖三十一国、跨越近二十年的面板结构,按性别、职业与残疾状态等维度对非正规就业进行精细化分解,进而识别不同社会群体在正规劳动力市场边缘化程度上的异质性,为跨国比较分析提供了坚实的数据基础。
解决学术问题
该数据集有效回应了非正规就业测量中长期存在的口径不一与可比性不足问题。通过ILOSTAT统一的国际劳工统计学家会议定义进行标准化调和,它为学界探究非正规就业与性别差距、职业分层及残疾状况之间的关联机制提供了可靠依据,推动了非正规经济规模估算、劳动力市场二元结构检验等议题的实证进展,具有重要的方法论与政策参考意义。
衍生相关工作
围绕该数据集,衍生出一系列关于欧洲非正规经济规模测度、非正规就业性别差异以及残疾群体劳动力市场排斥的实证研究。相关经典工作借助其面板结构开展国别比较与时间序列建模,并与ILO其他劳动力市场指标数据集交叉验证,逐步形成了非正规就业统计分析与政策评估的方法论积累。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务