遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-ocu-ins-rt-informal-employment-rate-by-sex-occupation-and-pub

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、职业和公共/私营部门划分的非正规就业率(%)| 欧洲(ILOSTAT),是一个关于欧洲非正规就业的统计数据集。它包含7,201个观测值,覆盖4个欧洲国家(波黑、摩尔多瓦、北马其顿、塞尔维亚),时间跨度为2003年至2025年。核心指标为EMP_NIFL_SEX_OCU_INS_RT,即按性别、职业和公共/私营部门划分的非正规就业率(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并由Electric Sheep Europe重新打包为机器学习就绪格式。数据集支持表格分类、回归和时间序列预测任务,包含国家代码、指标代码、性别分类(总计、男性、女性)、年份、观测值及其状态标志等列。数据为年度频率,经过ILO harmonization处理,使用国际劳工统计学家会议(ICLS)定义,并注明数据来源以确保可追溯性。

This dataset is named Informal employment rate by sex, occupation and public/private sector (%) | Europe (ILOSTAT). It contains 7,201 observations of informal economy data across 4 Europe countries (BIH, MDA, MKD, SRB), spanning from 2003 to 2025. The core indicator is EMP_NIFL_SEX_OCU_INS_RT — Informal employment rate by sex, occupation and public/private sector (%). Data is sourced from the International Labour Organization (ILO) ILOSTAT database via its REST API and repackaged by Electric Sheep Europe for machine learning readiness. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks. It includes columns such as country code, indicator code, sex disaggregation (total, male, female), year, observed value, and status flags. Data is annual frequency, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions, with source flags for traceability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-ocu-ins-rt-informal-employment-rate-by-sex-occupation-and-pub 数据集图片
构建方式
在经济全球化与劳动力市场非正规化并行演进的背景下,非正规就业统计成为监测体面劳动实现进度的关键环节。该数据集由Electric Sheep Europe基于国际劳工组织ILOSTAT的官方API接口获取原始数据并重新封装,具体取自EMP_NIFL_SEX_OCU_INS_RT指标端点,随后依照欧洲ISO3国家代码进行地理筛选,最终汇集四个欧洲国家自2003年至2025年的7210条年度观测记录。ILOSTAT运用国际劳工统计学家会议(ICLS)确立的定义框架对各国劳动力调查、家庭收入调查及行政记录等多元来源进行协调与标准化处理,并在source.label字段中对数据来源予以标注,以保障数据可追溯性。
特点
该数据集的核心特征体现在多维度的分层结构设计,涵盖性别、职业分类与公共私营部门三重解聚变量,其中性别维度包含总计、男性与女性三类取值。数据以表格形式组织,字段体系完备,囊括参考地区、来源标识、指标代码与标签、分类变量及其标签、观测年份与数值、观测状态标志以及来源注释等元数据列,为数据质量评估提供充分依据。观测状态标志可标识临时性或不可靠估计值,注释字段则记录方法论修订等序列断裂信息。数据以年度频率发布,部分指标兼具月度或季度序列,但此数据集仅收录年度数据。
使用方法
研究者可借助HuggingFace datasets库以load_dataset函数直接加载该数据集,并通过to_pandas方法转换为数据框以便进一步分析。针对特定国家的研究需求,可利用ref_area字段进行条件筛选,例如提取某一国家的全部观测记录。构建时间序列分析时,可依据指标代码筛选并按时间字段排序后绘制趋势图,以观察非正规就业率的历时演变。若需开展跨国比较研究,则可运用透视表功能将数据重塑为国家与年份的交叉矩阵,直观呈现不同国家在观测期内的指标变化格局。
背景与挑战
背景概述
非正规就业作为全球劳动力市场的重要议题,长期缺乏跨国可比数据。国际劳工组织(ILO)依托其统计部门,通过整合各国劳动力调查与住户收入调查等微观数据,构建了ILOSTAT这一权威劳工统计数据库。本数据集由Electric Sheep Europe于2025年重新封装,聚焦欧洲四国(波黑、摩尔多瓦、北马其顿、塞尔维亚)2003至2025年间非正规就业率,按性别、职业及公私部门分类,共计7,201条观测。该数据集为探究后社会主义转型经济体的非正规经济动态、性别差异及职业结构变迁提供了宝贵的量化基础,对劳动经济学与政策评估具有重要参考价值。
当前挑战
非正规就业的测度本身面临概念界定与跨国可比性难题,国际劳工组织虽以国际劳工统计学家会议定义进行协调,但各国调查工具、抽样框架及数据收集频率的差异仍导致序列断裂与缺失。数据集涵盖的四个国家均处于经济转型期,非正规部门规模庞大且形式多样,准确捕捉其按职业与部门分类的分布尤为困难。此外,部分观测值标记为“不可靠”或“序列断裂”,数据质量参差不齐,时间跨度内方法论修订亦影响趋势分析。如何在有限且异质的观测中构建稳健的机器学习模型,以预测非正规就业率并解析其驱动因素,构成该数据集应用的核心挑战。
常用场景
经典使用场景
在国际劳动统计学的视野下,非正规就业历来是透视劳动力市场结构性失衡的关键棱镜。该数据集最经典的使用场景在于,依托国际劳工组织标准化后的性别、职业与公私部门三维交叉分类框架,对欧洲四国2003至2025年间非正规就业率的时序演变进行精细化刻画。研究者可据此构建面板数据模型,横向比较波斯尼亚和黑塞哥维那、摩尔多瓦、北马其顿与塞尔维亚的就业正规化进程,亦可将性别维度与职业技能层级嵌套,揭示非正规就业中的性别隔离与职业分层现象。
解决学术问题
长期以来,非正规就业的跨国可比性受制于各国调查口径与分类标准的异质性,构成学术研究的固有障碍。此数据集依托国际劳工统计学家会议定义,对原始劳动力调查微数据进行统一协调,并标注来源与断点信息,从而有效化解了跨国比较中测量误差与序列断裂的难题。它为探究非正规就业的性别差异、职业分布及公私部门分化提供了可靠的经验基础,亦有助于检验非正规就业与经济发展、社会保障覆盖之间的理论假说,推动了劳动经济学与发展经济学在该领域的实证积累。
衍生相关工作
围绕该数据集,后续研究衍生出一系列具有影响力的工作。若干比较政治经济学研究将其与福利国家类型学结合,探讨非正规就业率与社保去 Commodification 之间的关联;劳动社会学领域则利用职业分类变量,分析技能层级与非正规就业风险的梯度关系。此外,有学者将其与欧洲劳动力调查微观数据链接,开展非正规就业的分解分析,区分构成效应与费率效应。这些工作不仅拓展了该数据集的应用边界,也反哺了国际劳工统计方法论的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务