遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-ind-rt-informal-employment-rate-by-ilo-sector-and-sex

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲地区非正规就业率统计数据,具体指标为按ILO部门和性别划分的非正规就业率(%)。数据集涵盖3个欧洲国家(北马其顿、波黑、塞尔维亚),时间跨度为2011年至2025年(部分国家数据年份可能不全),共包含1,900个观测值。数据按性别维度(总计、男性、女性)进行细分,并包含国家代码、国家名称、数据来源(如劳动力调查)、指标代码、观测年份、观测值、数据状态标志(如不可靠)以及方法说明注释等详细字段。数据经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化处理,旨在提供机器学习就绪的欧洲统一数据层。

This dataset contains informal employment rate statistics for Europe from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Informal employment rate by ILO sector and sex (%). It covers 3 European countries (North Macedonia, Bosnia and Herzegovina, Serbia) spanning the years 2011 to 2025 (with some variations in coverage per country), comprising 1,900 observations. Data is disaggregated by sex (total, male, female) and includes detailed fields such as country code, country name, data source (e.g., Labour Force Survey), indicator code, observation year, observed value, observation status flags (e.g., unreliable), and methodological notes. The data is harmonized by the ILO based on International Conference of Labour Statisticians (ICLS) definitions and is packaged as part of a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-ind-rt-informal-employment-rate-by-ilo-sector-and-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接获取指标ID为EMP_NIFL_SEX_IND_RT的原始数据,并依据欧洲ISO3国家代码进行地理过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收支调查及行政记录等微观数据进行协调处理,确保跨国可比性。Electric Sheep Europe团队将筛选后的数据重新打包为标准化Parquet格式,并附以一致的元数据结构,最终发布于HuggingFace平台。数据集共包含1,900条观测记录,时间跨度为2011年至2025年,覆盖北马其顿、波斯尼亚和黑塞哥维那、塞尔维亚三个欧洲国家。
特点
此数据集聚焦于按ILO行业和性别分类的非正规就业率(百分比),却仅包含单一指标EMP_NIFL_SEX_IND_RT,呈现高度专题性。其特色在于细致的维度拆解:性别维度涵盖总计、男性与女性三类;同时通过classif1字段提供ILO行业分类信息。此外,每条记录均标记数据来源(如劳动力调查)、观测状态(如不可靠)以及序列中断等注释,便于用户进行数据质量评估。年度频率的设定符合非正规就业指标的典型统计周期,而'最佳来源'选择机制则确保了国家-年份交叉的单一权威值,避免了多源冲突。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,仅需一行代码`load_dataset()`即可获取。加载后的数据可轻松转换为pandas DataFrame,便于后续分析。典型应用场景包括:按国家代码过滤数据以研究特定国家的非正规就业趋势;针对单一指标进行时间序列的可视化与建模;利用透视表功能构建国家-年份矩阵,以比较区域间的结构性差异。数据集中sex与classif1等分类字段支持灵活的分组与聚合操作,而obs_status与note_indicator等注释字段则为研究者在解读异常值或序列中断时提供了关键背景信息,适用于严谨的劳动经济学实证研究。
背景与挑战
背景概述
非正规就业是全球劳动力市场研究中的核心议题,其测算与跨国比较长期面临统计口径不一、数据可得性有限等困境。国际劳工组织(ILO)统计司依托ILOSTAT数据库,依据国际劳工统计学家会议(ICLS)定义协调各国劳动力调查数据,构建了涵盖200余个经济体的劳动统计指标体系。在此背景下,Electric Sheep Europe团队于2025年对ILOSTAT中欧洲三国(北马其顿、波黑、塞尔维亚)2011至2025年的非正规就业率数据进行重新打包,形成本数据集。该数据集聚焦于按ILO行业与性别划分的非正规就业率(EMP_NIFL_SEX_IND_RT),包含1900条观测值,为欧洲区域非正规就业的时空演化规律、跨国异质性分析及性别差异研究提供了标准化、可复现的机器学习就绪数据资源,有力推动了劳动经济学与数据科学的交叉研究。
当前挑战
该数据集所解决的领域问题核心在于非正规就业的量化与比较困境:不同国家对非正规就业的定义与统计方法差异显著,导致跨国基准研究缺乏可靠、统一的底层数据;同时,非正规就业常因隐蔽性强、劳动力调查覆盖不足而面临低估风险,制约了政策制定与可持续发展目标(SDGs)中体面工作的监测。在构建过程中,挑战主要体现在三方面:其一,数据整合层面的来源异构性,原始数据涉及多国劳动力调查与行政记录,需通过ILO来源标记(source.label)与断点标记(note_indicator)来保障时序数据的可追溯性;其二,数据稀疏性问题,部分国家-年份组合仅具备特定性别或行业分类的观测,需在保持维度完整性的前提下进行缺失处理;其三,数据质量标注的复杂性,观测值状态(如不可靠标记“U”)与修订序列提示需被准确保留,以避免误导下游建模时对指标稳定性的假设。
常用场景
经典使用场景
该数据集收录了2011至2025年间欧洲三国(北马其顿、波斯尼亚和黑塞哥维那、塞尔维亚)按国际劳工组织行业与性别分列的非正规就业率年度观测值,共计1900条记录。在劳动经济学与时序分析领域,研究者通常将其用于构建面板数据模型,以探究非正规就业的演变趋势及其与宏观经济变量的关联。通过按性别与行业维度进行交叉分析,该数据集支持精细化的劳动力市场结构研究,例如识别女性或特定行业在非正规就业中的脆弱性,从而为政策干预提供量化依据。
解决学术问题
非正规就业的测度与驱动机制是发展经济学与劳动经济学中的核心议题。该数据集通过提供经ILOSTAT标准化处理的官方统计数据,有效解决了跨国家、跨时段非正规就业率可比性不足的学术难题。研究者可借助它检验制度质量、经济增长、性别平等政策等因素对非正规就业规模的因果影响,或评估经济危机、劳动力市场改革等外生冲击的短期与长期效应。其细分维度还支撑了对非正规就业中性别差异形成机制的深入探讨,有助于完善关于劳动力市场二元结构的理论框架。
衍生相关工作
该数据集衍生出多条重要的研究脉络。基于其父级ILOSTAT数据库,劳动经济学家构建了非正规就业的动态面板模型,揭示了制度环境与产业结构对非正规化的交互影响;性别经济学领域则利用其性别细分数据,量化了家务劳动分工与劳动市场歧视对女性非正规就业概率的贡献。此外,该数据集的标准化格式催生了若干开源工具与可视化仪表盘,例如将ILOSTAT数据与世界经济论坛的全球性别差距指数联动的分析平台,以及融合自然语言处理技术从政策文本中提取非正规就业治理措施的跨学科研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务