遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-geo-dsb-nb-employment-outside-the-formal-sector-by-sex-rural

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于非正规经济的9,649个观测值,覆盖29个欧洲国家,时间跨度为2007年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并过滤为欧洲国家代码。数据集主要指标为“按性别、城乡地区和残疾状况划分的非正规部门就业(千人)”(ILOSTAT代码:EMP_PIFL_SEX_GEO_DSB_NB)。数据以年度频率发布,经过ILO harmonization处理,使用国际劳工统计学家会议(ICLS)定义。数据集包含多维度分类,如性别(总计、男性、女性)、地区类型和残疾状况,并提供了观测值、状态标志和注释列。数据质量方面,ILO选择最佳来源,且分类列仅在指标发布细分数据时非空。数据集适用于表格分类、回归和时间序列预测任务,由Electric Sheep Europe重新打包,以促进机器学习使用。

This dataset contains 9,649 observations related to the informal economy, covering 29 European countries across the 2007 to 2025 time period. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API, and filtered to retain only European country codes. The primary indicator of this dataset is "Employment in the informal sector by sex, urban/rural area and disability status (thousands)" (ILOSTAT code: EMP_PIFL_SEX_GEO_DSB_NB). Issued at an annual frequency, the data has been harmonized by the ILO in accordance with definitions established by the International Conference of Labour Statisticians (ICLS). The dataset features multi-dimensional categorizations including sex (total, male, female), area type, and disability status, alongside columns for observation counts, status flags, and annotations. Regarding data quality, the ILO selects the most reliable available sources, and categorical columns only contain non-null values when disaggregated data for the target indicator is published. This dataset is applicable to tabular classification, regression, and time series forecasting tasks, and was repackaged by Electric Sheep Europe to support its utilization in machine learning applications.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-geo-dsb-nb-employment-outside-the-formal-sector-by-sex-rural 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,由Electric Sheep Europe通过ILOSTAT的REST API接口直接抽取原始数据,并依据欧洲ISO3国家代码进行筛选与重打包。ILOSTAT本身采用国际劳工统计学家会议(ICLS)的定义体系,对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,确保跨国可比性。数据提取后以Parquet格式封装,保留来源标签与注释字段,最终形成涵盖29个欧洲国家、2007至2025年间9649条观测记录的结构化数据集。
特点
数据集聚焦于非正规部门就业议题,按性别、城乡区域及残疾状况等多重维度进行交叉 disaggregation,提供三个性别分类值及多个分类变量标签。时间跨度自2007年延续至2025年,覆盖29个欧洲国家,尤以葡萄牙、波兰、斯洛伐克等国观测密度较高。每一记录包含指标代码、来源标识、观测状态及注释信息,兼具时间序列分析与横截面比较的潜力。数据以年度频率发布,部分观测带有可靠性标记,为研究者提供了透明度较高的统计基础。
使用方法
研究人员可通过HuggingFace的datasets库以load_dataset函数直接加载该数据集,并借助to_pandas方法转换为数据框进行后续分析。典型操作包括按国家代码筛选子集、依据指标代码提取单一时序数据、或利用pivot_table将数据重塑为国家与年份的矩阵格式。数据集适用于表格分类、回归及时间序列预测等任务类型,亦可服务于非正规经济、性别就业差距、城乡差异等劳动经济学主题的实证研究。
背景与挑战
背景概述
国际劳工组织长期致力于全球劳动力市场统计监测,其ILOSTAT数据库为研究非正规经济提供了权威数据支撑。该数据集由Electric Sheep Europe于2025年基于ILOSTAT REST API重新封装,涵盖2007至2025年间29个欧洲国家在非正规部门就业的9649条观测记录,并按性别、城乡及残疾状况进行多维分解。其核心研究问题在于揭示欧洲非正规就业的性别差异与地域异质性,为评估体面劳动目标实现程度提供量化基础。该数据集对劳动经济学、社会政策及可持续发展研究具有重要参考价值,推动了非正规就业统计的标准化与可比性。
当前挑战
非正规就业的界定涉及国际劳工统计学家会议标准的动态演进,跨国家调查工具与抽样设计的差异导致数据可比性受限。数据集构建面临源数据缺失与报告偏误的挑战,部分国家在特定年份的观测值被标记为不可靠,残疾状况等分类变量的非标准化定义进一步增加了横向比较的复杂性。此外,非正规部门就业本身具有高度异质性与隐蔽性,自雇、家庭帮工等形态难以通过传统劳动调查完整捕捉,城乡与性别维度的交叉分析亦受制于样本量不足,这些因素共同制约了非正规就业规模与结构的精确测度。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最为经典的使用场景在于刻画欧洲各国非正规部门就业的性别差异与城乡空间分异。研究者常以之构建面板数据模型,将非正规就业规模分解为性别、城乡与残障状态等多维交互项,进而检验非正规就业的性别鸿沟是否随城市化进程而收敛,以及残障群体在非正规部门中的边缘化程度是否存在跨国异质性。2007至2025年的连续时间序列亦使其成为追踪欧洲劳动力市场非正规化长期趋势的基准数据源。
衍生相关工作
围绕该数据集已衍生出若干经典研究脉络。其一是跨国非正规就业决定因素的比较分析,利用其面板结构检验制度质量、农业占比与女性劳动参与率对非正规就业的异质性影响。其二是残障与非正规就业交叉性研究,探讨残障状态如何与性别、城乡属性叠加形成多重劣势。其三是时间序列预测方法的应用,以该数据为基准评估指数平滑、ARIMA及机器学习模型对非正规就业趋势的预测效能。
数据集最近研究
最新研究方向
在全球非正规经济治理与体面劳动议程纵深推进的背景下,该数据集所承载的按性别、城乡地域及残疾状况三维交叉分组的非正规部门外就业统计,正成为劳动经济学与发展研究交汇地带的前沿议题。既有研究多聚焦于非正规就业的总量测度与性别差异,而残障群体在非正规劳动市场中的系统性边缘化长期缺乏可比跨国数据支撑,该数据集覆盖29个欧洲国家、逾九千条观测值、时间跨度近二十年的面板结构,为刻画残障与非残障劳动者在城乡空间中的就业分化提供了稀缺的量化基础。当前研究前沿正朝向多维脆弱性叠加分析、残障就业政策效应评估以及城乡非正规经济结构转型等方向延展,其成果对欧洲社会政策协调、ILO体面劳动目标监测以及包容性劳动力市场制度设计具有重要的实证参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务