electricsheepeurope/europe-ilo-emp-xtru-sex-age-mts-rt-time-related-underemployment-rate-by-sex-age-and-m
收藏数据链接:
官方服务:
资源简介:
该数据集包含欧洲19个国家从1991年至2025年的时间相关就业不足率数据,共21,700条观测值,涵盖性别、年龄和婚姻状况等分类维度。数据来源于国际劳工组织(ILOSTAT)数据库,通过API获取并经过处理,适用于表格分类、回归和时间序列预测等任务。数据集包括国家代码、指标代码、观测年份、观测值以及数据质量标志等列,可用于分析欧洲劳动力市场中的就业不足趋势。
This dataset contains 21,700 observations of time-related underemployment rate data across 19 European countries from 1991 to 2025, disaggregated by sex, age, and marital status. The data is sourced from the International Labour Organizations ILOSTAT database, retrieved via API and processed for tabular classification, regression, and time-series forecasting tasks. It includes columns such as country codes, indicator codes, observation years, values, and data quality flags, enabling analysis of underemployment trends in European labor markets.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集由Electric Sheep Europe依据国际劳工组织(ILO)的ILOSTAT统计数据库重构而成,聚焦于欧洲19国的时间相关不充分就业率,覆盖1991至2025年的年度观测,总计21,700条记录。构建过程通过ILOSTAT REST API获取原始指标数据,并依据ISO 3166-1 alpha-3国家代码筛选出欧洲国家。数据集严格遵循国际劳工统计学家会议(ICLS)的定义对调查微观数据进行统一处理,确保跨国可比性,并保留来源标识以保障数据的可追溯性。每个观测记录包含国家、性别、年龄、婚姻状况、时间等关键维度,以结构化表格形式呈现,为劳动经济学研究提供了精细化的数据基础。
特点
该数据集的核心特征在于其多维度的分类架构和精细的时间序列粒度。在性别维度上涵盖总体、男性和女性三类,年龄与婚姻状况亦作为附加分类变量,使得用户能够从多角度剖析不充分就业率的变动规律。数据集的时间跨度长达35年,覆盖19个欧洲国家,样本量达到21,700个观测值,为长期趋势分析和跨国比较研究提供了充足的统计效力。此外,每个观测值均附有来源标识和可靠性状态标记,如“不可靠”或“方法论修订”,便于研究者甄别数据质量。数据以年度频率记录,并采用Parquet格式存储,增强了数据读取和处理的效率。
使用方法
该数据集通过HuggingFace的datasets库无缝集成,用户可通过load_dataset()函数快速加载数据并转换为Pandas DataFrame,即刻进行探索性分析。典型的使用路径包括:按国家代码筛选特定国家的数据,进行聚焦研究;针对单一指标进行时间序列分析,观察其随时间的演化趋势;或将数据透视重构为国家×年份的矩阵,便于进行面板数据回归和可视化。数据集结构清晰,列名语义明确,降低了数据预处理的门槛,非常适合劳动经济学家、政策研究者和数据科学家在R或Python环境中直接进行建模和推断。此外,数据集遵循CC-BY-4.0许可,鼓励在附带引用的情况下进行广泛的学术和商业应用。
背景与挑战
背景概述
该数据集由Electric Sheep Europe于2025年重新整理发布,源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于1991至2025年间欧洲19个国家的时间相关就业不足率,按性别、年龄及婚姻状况进行细分,共包含21,700条观测记录。ILOSTAT作为全球劳动统计的权威来源,整合了各国劳动力调查等数据,为研究劳动力市场结构性失衡提供了关键指标。该数据集的创建旨在弥合欧洲区域劳动力统计中细粒度、跨时间比较的空白,为经济学家、政策制定者及机器学习研究人员提供标准化、可直接用于时间序列预测与分类任务的语料库。其影响力体现在促进跨国劳动弹性分析、社会保障政策评估及可持续发展目标(SDG)中体面工作指标的监测,同时作为开源资源(CC-BY-4.0),降低了数据获取门槛,推动了劳动经济学与计算社会科学的交叉研究。
当前挑战
该数据集面临的挑战多维且显著。在领域层面,时间相关就业不足率作为劳动力闲置的隐性指标,其测度依赖于国际劳工统计学家会议(ICLS)定义,不同国家调查方法的异质性导致跨地域可比性受损,且年度频率掩盖了短期经济波动,弱化了时序预测的敏锐性。在构建过程中,数据整合面临多重障碍:原始ILOSTAT API接口的异构性要求复杂的数据清洗与标准化;多源数据的选择需在“最佳来源”与完整性间权衡,如示例中标注的“方法论修订”断点可能引发序列不连续;缺失分类值、观测状态标记(如不可靠)的处理亦需谨慎,以避免引入偏差。此外,覆盖国家仅19个且时间跨度不均,限制了模型的泛化能力,而性别维度仅三分类,无法捕捉非二元性别对劳动参与的影响,这些均对数据使用的稳健性与伦理提出了挑战。
常用场景
经典使用场景
该数据集汇集了1991至2025年间19个欧洲国家按性别、年龄及婚姻状况细分的时间相关不充分就业率年度观测数据,共计21,700条记录,源自国际劳工组织ILOSTAT数据库,经Electric Sheep Europe整理重打包。作为面板或截面数据,其经典用途在于劳动经济学领域的时间序列分析与预测建模,研究者可基于此开展国家间、性别间及年龄组间的比较研究,或运用ARIMA、GARCH、机器学习回归等模型对不充分就业率的动态演变进行拟合与预测,以洞察欧洲劳动力市场结构性特征。
实际应用
在实际应用层面,该数据集为欧洲各国及欧盟层面的劳动力市场监管、社会政策制定与效果评估提供了量化依据。政策制定者能借此精准识别不充分就业的高风险群体(如特定年龄段的女性或已婚人群),进而设计靶向的就业促进与工时调整方案。同时,数据也可服务于企业人力资源管理中的劳动力供给分析,或为经济咨询机构、国际组织及新闻媒体提供欧洲劳动力市场的健康度监测与趋势研判素材,辅助商业决策与公共传播。
衍生相关工作
围绕此数据集,可衍生出一系列前沿研究工作。其一,在方法论层面,可基于其长时段、多国家面板结构,构建或验证新的时间序列预测模型,如基于深度学习的Seq2Seq、Transformer架构在劳动力指标预测中的适用性,并与传统计量模型进行对比评估。其二,在实证层面,可探索婚姻状态、年龄队列效应与性别差异在不充分就业中的交互机制,或构建欧洲不充分就业综合指数。此外,结合其他ILOSTAT指标或宏观经济数据,可开展劳动力市场弹性、政策干预效果分析等交叉研究,推动计算社会科学与劳动经济学的融合发展。
以上内容由遇见数据集搜集并总结生成



