遇见数据集

electricsheepeurope/europe-ilo-emp-5pif-sex-age-rt-share-of-employment-outside-the-formal-sector-by-s

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲31个国家在2014年至2025年期间,按性别和年龄分组的非正规部门就业比例数据(基于第19届国际劳工统计学家会议定义)。数据集共有2,617个观测值,涵盖1个核心指标(EMP_5PIF_SEX_AGE_RT),该指标表示非正规部门就业占总就业的百分比。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过统一处理,包括国家代码、性别分类(总计、男性、女性)、年龄分类、年份、观测值及其状态标志等字段。数据集适用于表格分类、回归和时间序列预测等任务,专注于劳动力市场中的非正规经济分析。

This dataset contains data on the share of employment outside the formal sector by sex and age (based on the 19th International Conference of Labour Statisticians definition) for 31 European countries from 2014 to 2025. It includes 2,617 observations covering one core indicator (EMP_5PIF_SEX_AGE_RT), which represents the percentage of employment in the informal economy relative to total employment. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, harmonized and includes fields such as country codes, sex disaggregation (total, male, female), age classification, year, observed values, and status flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, focusing on informal economy analysis in labor markets.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-5pif-sex-age-rt-share-of-employment-outside-the-formal-sector-by-s 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲31个国家2014至2025年间非正规部门就业占比的衡量。数据通过ILOSTAT REST API直接获取,原始指标代码为EMP_5PIF_SEX_AGE_RT,并依据第19届国际劳工统计学家会议(ICLS)定义进行统一化处理。经Electric Sheep Europe团队重新封装后,数据集按欧洲ISO3国家代码进行过滤,保留了性别(总、男、女)等关键分类维度,并以结构化表格形式呈现,包含2,617条观测记录,每个观测值均附有来源标签、观测状态及注释信息,确保了数据的可追溯性与标准化程度。
特点
该数据集的核心特点在于其跨国家、跨时段的纵向覆盖能力,涵盖了欧洲31个经济体长达12年的年度数据,为研究非正规就业的时空演变提供了连贯的量化基础。数据不仅包含核心指标观测值,还整合了性别细分、来源类型及质量标志(如不可靠性或方法论变更注释),支持多维度的精准分析。此外,数据集采用统一的ILOSTAT分类体系与ISO国家代码,减少了跨数据源整合的异构性,便于与其它社会经济指标进行关联分析。其简洁的列式架构与高覆盖率样本,使其尤其适用于面板数据建模、时间序列预测及跨国比较研究。
使用方法
该数据集的使用极为便捷,用户可通过HuggingFace的datasets库以一行代码加载:load_dataset('electricsheepeurope/europe-ilo-emp-5pif-sex-age-rt-share-of-employment-outside-the-formal-sector-by-s'),返回的Pandas DataFrame可直接用于分析。常见操作包括按国家代码(ref_area列)过滤以聚焦特定经济体,或以时间列为轴绘制单一指标的变化趋势。对于多国比较,可利用pivot_table将数据重塑为国家×年份的矩阵形式,便于计算面板回归或可视化热力图。数据集中提供了完整的列名与示例,用户可轻松结合性别分类或观测状态标志进行子集筛选,实现高度定制的统计分析流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下ILOSTAT数据库于2025年整理发布,经Electric Sheep Europe重打包处理,聚焦欧洲31个国家在2014至2025年间非正规经济部门的就业比例,按性别与年龄分列观测,共计2617条记录。非正规就业作为劳动市场研究中的关键变量,长期困扰政策制定者与经济学家,因其弹性定义与跨国异质性导致测量难以统一。该数据集以第19届国际劳动统计学家会议(ICLS)定义的标准化口径为基准,通过ILOSTAT API抽取并筛选至欧洲区域,为研究欧洲各国非正规就业的演变趋势、性别差异及代际更迭提供了高质量时序面板数据。其发布显著增强了欧洲劳动经济学与可持续发展目标(SDG)第八项体面工作中关于非正规就业指标的实证基础,尤其在跨国比较与政策评估层面影响深远。
当前挑战
该数据集所解决的领域问题在于非正规就业的跨国可比性与量化困难,因各国定义差异、调查方法不一,传统数据难以实现标准化的时序分析;而构建过程中面临两大挑战:其一,ILOSTAT需从各国劳动调查、收入调查等多元来源整合原始调查微观数据,通过ICLS定义进行协调与清洗,确保数据一致性与可靠性;其二,因指标对应的分类变量(如年龄组、性别)在部分国家或年份缺失,数据需经Source标记与注解(如Breakin series)处理以维持完整性,同时标注观测状态为不可靠或暂定值,以警示使用者潜在的数据间断与质量波动,从而在开放性与严谨性之间取得平衡。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集因其对非正规就业比例的精细刻画而备受青睐。研究者可借助其按性别和年龄层划分的统计指标,构建跨国面板数据,进而分析不同社会经济背景下非正规就业的演变轨迹。其时间跨度涵盖2014至2025年,覆盖31个欧洲国家,为探究非正规就业的长期趋势与周期性波动提供了坚实的数据基石。经典的用法包括利用线性混合模型或固定效应回归,识别影响非正规就业比重的宏观经济因素,或通过聚类分析揭示不同国家在非正规就业模式上的异质性特征。
衍生相关工作
围绕该数据集,学术界已衍生出一系列富有影响力的研究成果。其中,基于该数据构建的跨国非正规就业预测模型,利用时间序列方法预判未来劳动力市场结构变化,尤其关注自动化与平台经济对非正规就业的冲击。另有研究以此为训练数据,开发机器学习分类器,用于识别非正规就业的关键驱动因子,揭示出教育水平、行业管制强度与性别平等指数等变量间的复杂交互效应。在计量方法层面,学者们衍生出处理分类变量与时间固定效应的面板数据技术,以及针对ILOSTAT数据质量标识(如“不可靠”观测值)的稳健性检验框架,进一步提升了劳动统计数据的分析严谨性。
数据集最近研究
最新研究方向
当前,非正规就业的测度与动态追踪成为欧洲劳动经济学的前沿焦点,尤其是在国际劳工组织(ILO)第19届国际劳动统计学家会议(ICLS)定义框架下。该数据集涵盖2014至2025年31个欧洲国家的2,617条观测值,聚焦于按性别和年龄分层的非正规部门就业占比,为评估欧洲劳动力市场的结构性脆弱性、性别差异及代际变迁提供了珍贵的时序证据。随着新冠疫情后非正规就业反弹、移民涌入推高非标准化雇佣,以及欧盟“体面工作议程”对数据需求的激增,研究者可借助该数据集剖析政策干预(如扩大社保覆盖、推动就业正规化)的实际成效。其跨年度、跨国家及性别的细化设计,尤其适合开展面板因果推断与多国比较研究,有助于揭示非正规就业与宏观冲击(如经济衰退、数字平台扩张)之间的深层互动机制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务