遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-geo-mts-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于非正规经济的统计信息,具体指标为按性别、城乡地区和婚姻状况划分的非正规部门就业比例。数据涵盖31个欧洲国家,时间跨度为2003年至2025年,共包含32,634个观测值。数据集来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API提取并过滤为欧洲国家数据,数据以年度频率提供,并包含国家代码、性别分类、观测值等字段。数据集旨在支持表格分类、回归和时间序列预测等任务,适用于劳动经济学和非正规经济研究。

This dataset contains statistical information on the informal economy, specifically the indicator Share of employment outside the formal sector by sex, rural/urban areas, and marital status. It covers 31 European countries from 2003 to 2025, with 32,634 observations. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), extracted via API and filtered for European countries. It provides annual frequency data and includes fields such as country codes, gender classifications, and observed values. The dataset is designed for tasks like tabular classification, regression, and time-series forecasting, and is suitable for research in labor economics and the informal economy.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-geo-mts-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT中央统计数据库构建,原始数据经由ILOSTAT REST API接口提取,并依据欧洲ISO3国家代码进行筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等原始微观数据进行统一协调,数据来源以source.label字段标注以保证可追溯性。Electric Sheep Europe在此基础上对模式进行规范化重组,以Parquet格式封装发布,形成面向机器学习应用的即用型数据集。
特点
数据集涵盖31个欧洲国家、2003至2025年间共计32,634条观测记录,聚焦非正规部门就业占比这一非正规经济核心指标。数据按性别、城乡区域及婚姻状况等多维度进行分解,包含国家代码、指标代码、性别分类、区域类型及婚姻状况等结构化字段,并附有观测状态标志与指标注释信息,兼具面板数据的时间序列特征与横截面分类属性,适用于表格分类、回归及时间序列预测等多种分析任务。
使用方法
研究者可通过HuggingFace datasets库以load_dataset函数直接加载该数据集,并转换为Pandas数据框进行操作。典型用法包括按ref_area字段筛选特定国家子集、针对单一指标按时间排序绘制时序趋势图,以及通过pivot_table将数据重塑为国家与年份交叉矩阵以便跨国比较分析。观测值字段obs_value配合指示器定义可直接用于建模,分类变量可用于分组聚合或特征工程,从而支撑非正规就业的实证研究与政策评估。
背景与挑战
背景概述
非正规部门就业长期以来是全球劳动力市场治理的核心议题,其规模与结构直接关乎劳动者社会保障覆盖、税收基础及经济脆弱性评估。国际劳工组织(ILO)依托国际劳工统计学家会议(ICLS)确立的统一定义,自2003年起系统采集并协调各国劳动力调查与家庭收入调查微数据,形成ILOSTAT这一全球权威劳动统计数据库。该数据集由Electric Sheep Europe于2025年从ILOSTAT REST API抽取并重新封装,覆盖31个欧洲国家、2003至2025年间32,634条观测,以性别、城乡区域及婚姻状况为维度刻画正规部门之外就业占比,为比较劳动制度转型、非正规经济持续性与社会保护缺口提供了标准化、可直接用于机器学习建模的跨国面板资源。
当前挑战
非正规就业测算在概念界定与跨国可比性上存在固有困难,ICLS定义在各国的操作化程度不一,调查口径、抽样设计与参考期差异导致同一指标在异质性经济体间可能缺乏严格可比性;部分国家数据仅覆盖特定年份或特定人口群体,且城乡与婚姻状况的交叉分类常因样本量不足而产生缺失。数据中若干观测带有“不可靠”或“临时性”状态标记,提示估计精度有限,而不同来源(劳动力调查、家庭收入调查、行政记录)的拼接可能引入方法学断裂。此外,时间序列在2007年前后覆盖国家数量骤增,结构性断点与指标定义调整对趋势分析与预测建模构成挑战,使用者需审慎处理缺失机制、来源异质性及样本代表性不足等问题。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集凭借对性别、城乡地域及婚姻状况的细致区分,成为刻画欧洲非正规部门就业形态的经典面板数据资源。研究者惯常将其用于构建跨国别、跨年度的比较分析框架,通过时间序列建模与横截面回归,揭示非正规就业比例的演变轨迹及其在不同人口群体间的分布差异,进而为劳动力市场分层理论与非正规经济周期假说提供实证检验基础。
实际应用
在政策实践层面,该数据集为欧洲各国劳动监察部门、社会保障机构及国际发展组织提供了量化监测工具。通过追踪非正规就业份额的时序变化,决策者可识别脆弱群体集聚的重点区域与人群,据此设计差异化的正规化激励措施、社会保护扩展方案及农村就业促进项目,亦可评估既有劳动法规改革在抑制非正规就业方面的实际成效。
衍生相关工作
围绕该数据集已衍生出若干具有影响力的研究工作,包括非正规就业与性别收入差距的关联分析、城乡劳动力市场分割的跨国比较研究,以及非正规经济规模与宏观经济增长波动之间动态关系的计量检验。这些后续成果不仅拓展了数据集在劳动社会学与发展经济学交叉领域的应用边界,亦推动了非正规部门统计方法论的持续精进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务