遇见数据集

electricsheepeurope/europe-ilo-emp-nifl-sex-ocu-geo-nb-informal-employment-by-sex-occupation-and-rural-ur

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了欧洲31个国家从2003年至2025年期间关于非正规就业的52,622条观测数据,核心指标为按性别、职业和城乡地区划分的非正规就业(千人)(ILOSTAT指标代码:EMP_NIFL_SEX_OCU_GEO_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,通过协调各国劳动力调查、家庭收入调查、机构调查和行政记录等数据编制而成。数据集涵盖了按性别(总计、男性、女性)、职业技能水平(分类1)和地区类型(如全国范围,分类2)等多个维度对非正规就业人数的年度统计。数据结构包括国家代码和名称、数据来源代码和标签、指标代码和标签、性别分类、两个分类变量、观测年份、观测值(单位:千人)、观测状态标志以及相关注释等列。数据经过Electric Sheep Europe重新打包和标准化,以方便机器学习研究使用,采用CC BY 4.0许可协议。

This dataset contains 52,622 observations on informal employment across 31 European countries from 2003 to 2025, with the core indicator being Informal employment by sex, occupation and rural / urban areas (thousands) (ILOSTAT code: EMP_NIFL_SEX_OCU_GEO_NB). The data is sourced from the International Labour Organizations ILOSTAT database, a leading global source for labour statistics that harmonizes raw survey microdata from national labour force surveys, household income surveys, establishment surveys, and administrative records based on International Conference of Labour Statisticians definitions. The dataset provides annual statistics on informal employment disaggregated by sex (total, male, female), occupation skill level (classification 1), and area type (e.g., national, classification 2). The schema includes columns for country code and name, source code and label, indicator code and label, sex classification, two classification variables, observation year, observed value (unit: thousands), observation status flags, and related notes. The data has been repackaged and normalized by Electric Sheep Europe for machine learning readiness and is released under the CC BY 4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-nifl-sex-ocu-geo-nb-informal-employment-by-sex-occupation-and-rural-ur 数据集图片
构建方式
该数据集由Electric Sheep Europe从国际劳工组织(ILO)的ILOSTAT中央统计数据库直接提取并重新封装。ILOSTAT作为全球劳动统计的权威来源,通过整合各国劳动力调查、家庭收入调查及行政记录等原始微观数据,依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理。数据获取自ILOSTAT的REST API接口,以非正规就业指标为核心,筛选欧洲ISO3国家代码范围,覆盖2003年至2025年。原始调查来源通过source.label字段保留可追溯性,最终以Parquet格式发布,形成包含52,622条观测值的结构化表格数据集。
使用方法
研究者可通过HuggingFace的datasets库以单行代码加载该数据集,利用Python进行数据分析与建模。典型用法包括筛选特定国家(如df[df['ref_area']=='DEU'])以获取国别时间序列,或按指标代码过滤后以年份排序绘制趋势图。亦可借助pivot_table方法将数据重塑为国家与年份的交叉矩阵,便于比较分析。该数据集适用于表格分类、回归及时间序列预测等任务,为劳动经济学、社会政策及区域发展研究提供标准化、可复现的数据基础。
背景与挑战
背景概述
非正规就业长期构成全球劳动力市场的重要维度,其规模与结构直接关涉社会保障覆盖、劳动权益保障及可持续发展目标中体面劳动的推进。国际劳工组织依托ILOSTAT数据库,系统汇编各国劳动力调查与家庭收入调查等微观数据,并按国际劳工统计学家会议定义进行跨国协调。在此背景下,Electric Sheep Europe于2025年对ILOSTAT原始数据进行再封装,覆盖欧洲31国2003至2025年非正规就业按性别、职业及城乡分组的5.26万条观测记录,为跨国比较与时空分析提供规范化、机器学习就绪的数据基础。
当前挑战
非正规就业的测度本身即面临概念界定与跨国可比性的固有难题,不同国家调查口径、抽样设计及统计能力的差异导致观测值存在缺失、修订与可靠性标记,部分序列因方法调整而出现断点,削弱时间维度上的连续性。数据集构建过程中,还需处理同一国家—年份存在多源数据时的最优源筛选、分类维度非普遍发布所致的稀疏性,以及城乡、职业与性别交叉分组后细粒度单元样本量不足等问题,这些因素共同制约着基于该数据集的建模精度与推断稳健性。
常用场景
经典使用场景
在劳动经济学与非正规经济研究领域,该数据集最为经典的运用场景在于刻画欧洲各国非正规就业的性别分化与职业结构异质性。研究者可借助其按性别、职业技能层级及城乡地域交叉分组的时序观测值,构建面板数据模型,系统比较不同国家非正规就业规模的演变轨迹,进而揭示性别不平等在非正规劳动市场中的嵌入方式与城乡差距的收敛或发散趋势。
解决学术问题
该数据集有效回应了非正规就业测算中长期存在的可比性难题。通过ILOSTAT统一采用国际劳工统计学家会议定义对各国劳动力调查微观数据进行协调,它缓解了因国别统计口径差异导致的跨国比较偏误。其价值在于为探究非正规就业与性别隔离、技能构成及地域发展水平之间的因果关联提供了标准化证据,推动了非正规经济规模估算从碎片化描述向系统性实证的转变。
实际应用
在政策实践层面,该数据集为国际组织与欧洲各国劳动监管部门提供了监测非正规就业风险的量化基准。社会保障机构可据此识别女性、低技能职业及农村地区劳动者中非正规就业高发的重点群体,优化缴费型社会保险的扩面策略。工会与雇主组织亦可利用其时序趋势评估非正规化对劳动条件的影响,为集体谈判与最低工资调整提供经验依据。
数据集最近研究
最新研究方向
在全球非正规就业治理与体面劳动议程持续深化的背景下,该数据集所承载的按性别、职业及城乡维度细分的非正规就业估算,正成为劳动经济学与发展经济学交叉领域的前沿研究素材。近年来,相关研究借助面板数据与时序预测方法,着力揭示非正规就业的性别差异、职业隔离与城乡空间分异之间的交互机制,并尝试评估结构性转型政策对非正规部门规模变动的因果效应。伴随国际劳工组织关于非正规经济统计标准(ICLS)的更新以及可持续发展目标(SDG 8)对体面劳动的监测需求,该数据集为跨国比较与政策仿真提供了稀缺的精细化面板支撑,其影响亦延伸至社会保障扩面与劳动力市场制度设计等热点议题。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务