遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-edu-dsb-nb-employment-outside-the-formal-sector-by-sex-educat

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲31个国家从2007年至2025年的非正规经济就业统计数据,具体指标为按性别、教育程度和残疾状况划分的非正规部门就业(千人)。数据集共有14,268个观测值,涵盖1个主要指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并筛选至欧洲国家。数据集提供了详细的结构化字段,包括国家代码、指标代码、性别分类、教育程度分类、残疾状况分类、年份、观测值及数据状态等。数据经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集以CC-BY-4.0许可证发布,适用于研究和机器学习应用。

This dataset contains 14,268 observations of informal economy employment data across 31 Europe countries, spanning 2007–2025, covering the indicator Employment outside the formal sector by sex, education and disability status (thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to European countries. It includes structured columns such as country codes, indicator codes, sex disaggregation, education classification, disability status classification, year, observed values, and data status flags. The data is harmonized using ILO standards and is suitable for tabular classification, regression, and time-series forecasting tasks. The dataset is released under the CC-BY-4.0 license and is intended for research and machine learning applications.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-edu-dsb-nb-employment-outside-the-formal-sector-by-sex-educat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,原始数据通过ILOSTAT REST API接口按指标代码EMP_PIFL_SEX_EDU_DSB_NB直接提取,并依据ISO3国家代码筛选出欧洲区域记录。ILO统计部门采用国际劳工统计学家会议(ICLS)标准定义对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行统一协调与标准化处理,确保跨国可比性。Electric Sheep Europe在此基础上对Schema进行规范化重排,以Parquet格式封装发布,并通过source.label列标注数据来源以保障可追溯性。
特点
数据集涵盖2007至2025年间31个欧洲国家的14,268条观测记录,聚焦于非正规部门就业按性别、教育程度及残疾状况的交叉分类统计。数据以年度频率呈现,包含ref_area、sex、classif1、classif2等多维分类变量,其中性别维度提供总计、男性与女性三类取值,教育程度与残疾状态则依据指标发布情况动态填充。每条记录附带观测状态标志及分类注释,便于识别临时性、不可靠或非标准定义的数据点,为劳动力市场边缘化群体的量化研究提供精细化信息支撑。
使用方法
研究者可借助HuggingFace datasets库以load_dataset()函数直接加载该数据集,并转换为Pandas数据框进行后续分析。针对特定国家,可通过ref_area列筛选目标国家的子集;针对时间序列分析,可按indicator列过滤后对time字段排序并绘制趋势图;若需构建国别—年份矩阵,则可利用pivot_table方法将ref_area设为列、time设为索引、obs_value设为值进行重塑。该数据集适用于表格分类、回归及时间序列预测等机器学习任务,亦可服务于非正规经济领域的探索性统计分析。
背景与挑战
背景概述
国际劳工组织长期致力于全球劳动力市场统计的标准化与可比性建设,其维护的ILOSTAT数据库是劳动统计领域的权威跨国数据源。在此框架下,本数据集由Electric Sheep Europe于2025年从ILOSTAT REST API系统性提取并重新打包,聚焦欧洲31国2007至2025年间正规部门以外就业的规模与结构。数据集以性别、教育程度及残疾状况为多维 disaggregation 维度,共收录14,268条观测记录,为探究非正规经济中的劳动力分层与边缘化议题提供了跨国面板基础,亦为劳动经济学、社会政策评估及可持续发展目标中体面劳动指标的监测提供了关键的经验素材。
当前挑战
该数据集所回应的核心领域问题在于非正规就业的量化测度与跨国可比性,其难点源于非正规经济活动本身难以被常规劳动力调查完整捕捉,各国对非正规部门的界定与非标准就业的统计口径亦存在显著异质性。在构建层面,ILOSTAT虽经国际劳工统计学家会议定义框架进行harmonisation,但原始微观数据来源多样,涵盖劳动力调查、住户收入调查及行政记录,导致源标注复杂且部分观测值附有可靠性存疑或临时性状态标记。残疾状况分类在各国操作化定义上的差异,以及部分国家时间序列的断档,进一步增加了跨国比较与纵向分析的复杂性,要求研究者在建模时审慎处理缺失机制与分类不一致带来的偏误风险。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的运用场景在于刻画欧洲各国非正规部门就业的性别差异与教育梯度。研究者借助14,268条年度观测记录,可系统比较2007至2025年间31个欧洲国家不同性别、不同受教育程度及不同残疾状况群体在非正规部门中的就业规模与结构演变。此类分析常以面板数据回归或时间序列分解为方法,揭示非正规就业在性别与教育维度上的分布特征,进而讨论劳动力市场分割与教育回报的异质性。
衍生相关工作
围绕该数据集,已衍生出一系列聚焦欧洲非正规就业格局的经典研究。部分文献利用其长时段覆盖优势,构建性别与教育维度的非正规就业指数,用以分析金融危机与疫情冲击下非正规部门的弹性差异;另有研究将其与欧洲社会调查等微观数据链接,探讨残疾状况对非正规就业概率的独立影响。这些工作共同丰富了非正规经济学的实证积累,并为后续跨国追踪研究奠定了数据基础。
数据集最近研究
最新研究方向
在全球非正规经济持续扩张的背景下,该数据集为剖析欧洲非正规部门就业的结构性差异提供了关键量化基础。近期研究聚焦于性别、教育与残疾状况的多维交互如何塑造非正规就业的分布格局,尤其在2008年金融危机与新冠疫情的双重冲击下,非正规就业的周期性波动与脆弱性成为劳动经济学的前沿议题。研究者利用这一覆盖31国、逾1.4万条观测值的面板数据,结合机器学习与因果推断方法,探究教育禀赋对残疾群体非正规就业概率的调节效应,以及性别差距在南欧与北欧国家间的异质性。相关成果为国际劳工组织实现体面劳动目标、欧盟推进社会权利支柱提供实证依据,对完善弱势群体就业保障政策具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务