遇见数据集

electricsheepeurope/europe-ilo-emp-5nif-sex-eco-rt-informal-employment-rate-by-sex-and-economic-activ

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲32个国家从2014年至2025年的非正规就业率数据,共4,619个观测值,涵盖1个核心指标:按性别和经济活动划分的非正规就业率——第19届国际劳工统计学家会议(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家。数据集提供了详细的列信息,包括国家代码、国家名称、数据来源、指标代码、性别分类、经济活动和观察年份等,并包含数据质量说明和使用示例。数据按年度频率发布,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 4,619 observations of informal employment rate data across 32 European countries, spanning from 2014 to 2025, covering 1 distinct indicator: Informal employment rate by sex and economic activity -- 19th ICLS (%). The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via API and filtered to Europe ISO3 country codes. It provides detailed column information, including country codes, country names, data sources, indicator codes, sex disaggregation, economic activity, and observation years, along with data quality caveats and usage examples. The data is published at annual frequency and is suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-5nif-sex-eco-rt-informal-employment-rate-by-sex-and-economic-activ 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API接口直接提取指标代码为EMP_5NIF_SEX_ECO_RT的非正规就业率数据,并依据欧洲ISO3国家代码进行地理范围筛选。原始数据来自各国劳动力调查、家庭收入调查等官方统计,经ILO统计局依据第19届国际劳动统计学家会议(ICLS)定义进行统一协调与标准化处理。数据集由Electric Sheep Europe团队重新整合打包,以Parquet格式发布,确保研究者能通过HuggingFace的load_dataset()函数快速调用,所有观测值的来源均在source.label列中标注,便于追溯原始调查项目。
特点
该数据集聚焦欧洲32个国家在2014至2025年间非正规就业率的变化,包含4,619条观测记录,涵盖性别(总、男、女)与经济活动的多维交叉分类。数据以年度频率呈现,并附有观测状态标记(如临时性、不可靠)及系列中断注释,提示方法论修订等背景信息。此外,数据集严格采用ILO选定的“最佳来源”处理同一国家年份的多源冲突,确保数据质量。其独特的非正规经济主题为研究欧洲劳动力市场的结构特征、性别差异及政策评估提供了量化基础。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并利用to_pandas()方法转换为DataFrame格式进行后续分析。典型使用场景包括:按国家筛选子集(如df[df['ref_area']=='DEU']提取德国数据)、按指标排序后绘制时间序列图,或通过pivot_table构建以时间为行、国家为列的矩阵,便于横向对比不同国家的非正规就业率演变趋势。数据集中sex与classif1等字段支持性别与经济活动的细分分析,obs_status列则帮助用户识别数据可靠性,从而在建模或统计推断中合理取舍观测值。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过ILOSTAT数据库构建并发布,后经Electric Sheep Europe重新打包托管于HuggingFace平台,聚焦欧洲32个国家在2014至2025年间非正规就业率的多维度演变。非正规就业作为全球劳动力市场的重要议题,长期困扰着政策制定者与研究者——其隐蔽性、统计口径差异及跨国家可比性缺失,使得精确刻画该现象异常困难。该数据集以第19届国际劳工统计学家会议(ICLS)定义为准绳,整合了来自劳动力调查、家计调查等多源微观数据,提供了按性别与经济活动分类的标准化非正规就业率观测值,共计4619条记录。其发布为理解欧洲劳动力市场的结构性问题,如性别差异、行业分布及制度环境对非正规化的影响,提供了坚实的数据基础,成为区域比较研究与政策评估的重要工具。
当前挑战
该数据集所应对的核心挑战在于非正规就业的测量与跨国产出间的一致性。领域层面上,非正规就业常隐匿于官方统计之外,各国对其定义、调查方法及数据采集频率迥异,导致跨国横向比较与时间序列分析极易产生偏差。ILOSTAT通过统一采用ICLS 19th定义与选择最佳来源数据来缓解这一问题,但原始调查目的差异、方法论修订造成的序列断裂(如notes列所标注)仍对分析者构成风险。构建过程中,将分散于200多个经济体的异构微观数据进行清洗、对齐与标记是一项艰巨任务;数据集的4619条记录虽已尽力标准化,却仍面临性别细分不足、部分年份观测稀疏及数据质量标记(如“不可靠”状态)等挑战,要求用户在建模前审慎处理缺失值与异质性来源。
常用场景
经典使用场景
作为国际劳工组织(ILO)权威统计数据库ILOSTAT的欧洲子集,该数据集聚焦于非正规就业率这一核心劳工指标,按性别与经济活动的交叉维度进行细致划分,覆盖32个欧洲国家2014至2025年的年度观测值。其最经典的使用场景在于时间序列分析与面板数据建模,研究人员可通过国家维度与性别维度的组合,追踪欧洲各国非正规就业率的演变轨迹,揭示金融危机后劳动力市场的结构性变迁。同时,该数据集天然适用于表格分类与回归任务,例如基于经济部门特征预测非正规就业水平,或构建跨国家的横向比较模型。
衍生相关工作
围绕该数据集已衍生出一系列标志性学术工作,突出体现为基于ILOSTAT面板数据的劳动经济学实证研究。经典工作包括利用固定效应模型或工具变量法,分析非正规就业率与GDP增长、贸易开放度、制度质量之间的互动关系;亦有学者结合该数据集与欧洲家庭收入调查(EU-SILC),探讨非正规就业对收入不平等和贫困脆弱性的传导机制。在机器学习领域,研究者将其作为时间序列预测任务中的基准数据集,开发了基于LSTM、Transformer等架构的非正规就业率预模型,推动了经济指标预测方法的前沿发展。
数据集最近研究
最新研究方向
当前,非正规就业率作为衡量劳动力市场包容性与经济韧性的核心指标,正成为欧洲劳动经济学与时序预测领域的前沿焦点。依托国际劳工组织ILOSTAT统一规范的19届ICLS统计架构,该数据集覆盖32个欧洲国家2014至2025年的年度观测,按性别与经济活动精细分层。研究者可借此构建多国面板模型,解析非正规就业在新冠疫情、能源危机及绿色转型等热点冲击下的演化轨迹,并利用其时序特性开发预警系统,为欧盟“体面工作”议程及各国劳动力政策优化提供量化支撑。其标准化的元数据与机器可读格式,也极大促进了跨国比较研究与可复现分析范式的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务