遇见数据集

electricsheepeurope/europe-ilo-emp-pifl-sex-age-geo-nb-employment-outside-the-formal-sector-by-sex-age-an

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲31个国家从2003年至2025年的非正规经济就业统计数据,共有65,278个观测值。核心指标为EMP_PIFL_SEX_AGE_GEO_NB,即按性别、年龄和城乡地区划分的非正规部门就业人数(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,涵盖国家代码、来源、指标、性别细分(总计、男性、女性)、年龄分类、城乡地区分类、年份和观测值等字段。数据集适用于表格分类、回归和时间序列预测等任务,旨在提供欧洲非正规劳动力市场的详细视角。

This dataset contains 65,278 observations of informal economy employment data across 31 European countries from 2003 to 2025, focusing on the indicator EMP_PIFL_SEX_AGE_GEO_NB—Employment outside the formal sector by sex, age and rural/urban areas (in thousands). Sourced from the ILOSTAT database of the International Labour Organization (ILO), the data is retrieved via API and harmonized, including fields such as country codes, source, indicator, sex disaggregation (total, male, female), age classification, rural/urban classification, year, and observed values. It is suitable for tabular classification, regression, and time-series forecasting tasks, providing a detailed view of Europes informal labor market.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-pifl-sex-age-geo-nb-employment-outside-the-formal-sector-by-sex-age-an 数据集图片
构建方式
该数据集依托国际劳工组织ILOSTAT中央统计数据库,通过REST API接口直接提取指标EMP_PIFL_SEX_AGE_GEO_NB的原始记录,并筛选欧洲ISO3国家代码,形成覆盖31个欧洲国家的非正规部门外就业观测数据。原始调查微观数据经国际劳工统计学家会议定义体系协调处理,数据来源在source.label列中予以标注,以确保统计口径的一致性与可追溯性。Electric Sheep Europe对提取结果进行规范化重封装,输出为ML-ready的Parquet格式,并配以统一模式卡片,最终形成65,278条观测、时间跨度2003至2025年的结构化数据集。
特点
该数据集聚焦于非正规经济领域的就业测量,以性别、年龄及城乡地理维度为核心分层变量,涵盖31个欧洲国家逾六万条年度观测,兼具表格分类、回归与时间序列预测等多重任务适配性。数据以标准化Schema组织,包含国家代码、来源标识、指标编码、性别分类、年龄分类、城乡分类、年份与观测值等字段,并附有观测状态标志与注释标签,用于标识暂定值、不可靠估计及序列断裂等质量信息。数据集的时间跨度长、地理覆盖广,为剖析欧洲非正规就业的性别差异与城乡异质性提供了精细化的量化基础。
使用方法
研究者可借助HuggingFace datasets库以load_dataset函数直接加载该数据集,并将其转换为Pandas数据框进行后续分析。具体操作中,可通过ref_area字段筛选特定国家,利用indicator字段提取目标指标,或借助pivot_table方法将数据重塑为国家与年份的交叉矩阵,进而绘制时间序列趋势图或开展跨国比较研究。数据集亦适用于非正规就业规模的回归建模与预测任务,使用时需留意obs_status与note系列字段所承载的数据质量提示,并在成果中依循CC-BY-4.0许可要求引用国际劳工组织与Electric Sheep Europe的原始出处。
背景与挑战
背景概述
在全球劳动力市场结构性转型与非正规经济持续扩张的宏观图景下,国际劳工组织(ILO)长期致力于构建跨国家、跨时间的可比劳动统计体系。该数据集由ILO统计部门基于国际劳工统计学家会议(ICLS)标准,整合各国劳动力调查、住户收入调查及行政记录,经Electric Sheep Europe于2025年重新封装发布,涵盖2003至2025年间31个欧洲国家65,278条观测,聚焦非正规部门就业按性别、年龄及城乡区域的分布。其核心研究问题在于揭示非正规就业的性别差异、年龄分层与空间异质性,为监测体面劳动目标、评估非正规经济规模及制定包容性劳动力市场政策提供关键数据基础设施,对劳动经济学、发展研究及社会政策评估具有重要影响力。
当前挑战
非正规就业测度本身即面临概念界定模糊、跨国操作化差异显著的方法论困境,不同国家对非正规部门与非正规就业的统计边界迥异,导致跨国可比性受损。数据集构建过程中,ILO需依赖各国零散且异质的调查工具与行政记录,部分国家观测缺失或仅覆盖特定年份,观测状态标志揭示部分数据具有临时性或可靠性不足的特征。序列断裂问题亦不容忽视,方法学修订与来源更替造成时间序列不连续。此外,性别、年龄与城乡维度的交叉分类导致部分单元格样本稀疏,增加统计推断的不确定性。如何在保持数据原始性的同时提升跨国与跨期可比性,仍是该数据集应用中的核心挑战。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最经典的使用场景在于刻画欧洲各国非正规部门就业的规模演变与结构差异。研究者依托其涵盖三十一国、逾六万条观测的时空面板,按性别、年龄组及城乡分类维度进行交叉分析,进而识别非正规就业在性别差距、青年与成年群体分化以及城乡二元结构中的分布特征。时间序列建模与面板回归构成其主流分析范式,用以揭示非正规就业随经济周期与制度变迁的动态轨迹。
解决学术问题
该数据集有效回应了非正规就业测算中长期存在的可比性难题。通过ILOSTAT依据国际劳工统计学家会议定义所进行的标准化调和,其缓解了各国劳动调查口径不一所致的跨国比较偏误,并借由来源标签与观测状态标注保障了数据溯源与质量甄别。这一特性使研究者得以在统一框架下检验非正规就业与贫困、社会保障缺位及劳动力市场分割之间的理论假说,为比较政治经济学与劳动治理研究提供了可靠的经验基础。
衍生相关工作
围绕该数据集及其母体ILOSTAT体系,已衍生出诸多经典研究脉络。学界依托此类数据构建了非正规就业的多国比较分析框架,探讨非正规性与经济增长、制度质量之间的关联;国际劳工组织定期发布的《世界非正规就业报告》亦以该指标为核心证据来源。此外,Electric Sheep Europe的标准化封装促进了机器学习社区对劳动统计数据的再利用,催生了面板预测与跨国聚类等交叉方向的应用探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务