遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-edu-geo-nb-persons-outside-the-labour-force-by-sex-education

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家1987年至2025年间按性别、教育程度和城乡地区划分的非劳动力人口(以千人为单位)的统计数据,共计93,461条观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,属于劳动力未充分利用的其他衡量指标主题。数据集提供了国家代码、年份、指标值、数据来源、性别分类、教育分类、城乡分类以及数据质量注释等多维度信息,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 93,461 observations of Persons outside the labour force by sex, education and rural / urban areas (thousands) data across 39 Europe countries, spanning 1987–2025, covering 1 distinct indicator. The data is sourced from ILOSTAT, the ILOs central statistics database, under the topic Other measures of labour underutilization. It includes multidimensional information such as country codes, years, indicator values, data sources, sex disaggregation, education classification, rural/urban classification, and data quality notes, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-edu-geo-nb-persons-outside-the-labour-force-by-sex-education 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,是劳动统计领域的权威来源。构建过程通过调用ILOSTAT的REST API直接获取原始指标数据,并依据欧洲ISO3国家代码进行地域过滤,确保数据聚焦于39个欧洲国家。ILOSTAT本身对各国劳动力调查的微观数据,依据国际劳工统计学家会议(ICLS)的定义进行标准化处理,以保障跨国可比性。此外,数据集中添加了数据来源标签(source.label),以追踪各条观测值的原始出处,提升数据追溯的透明度。最终,该数据集由Electric Sheep Europe团队重新打包,以统一的Parquet格式和一致的元数据呈现,便于机器学习工作流的直接调用。
特点
本数据集的核心特色在于其精细的劳动力市场分析粒度,提供了按性别、教育水平及城乡地域划分的劳动力市场外围人口数量(以千人为单位)。数据集涵盖了从1987年至2025年的长期时间序列,包含93,461条观测值,覆盖39个欧洲国家,为纵向比较与面板数据分析奠定了坚实基础。数据解构维度丰富,包括性别(总、男、女)、教育水平(聚合层级)及地域类型(全国、城市、农村),能够支持多维度的交叉分析。此外,数据集还附带了观测值状态标志(如可靠性、中断序列标注),便于用户评估数据质量,进行严谨的经济学或社会学研究。
使用方法
该数据集的设计充分考虑了科研与工程实践的便捷性,用户可通过Hugging Face的`datasets`库使用一行代码完成加载:`load_dataset("electricsheepeurope/europe-ilo-eip-teip-sex-edu-geo-nb-persons-outside-the-labour-force-by-sex-education")`。加载后,可直接转换为Pandas DataFrame进行数据处理。典型的使用方法包括按国家代码(如`ref_area`)过滤以获取特定国家的时间序列,或对单一指标按时间排序以绘制趋势图。此外,用户还可以利用数据表透视功能,构建以时间为行、国家为列的矩阵,从而便捷地进行跨国比较与计量建模。所有操作均基于标准化的列名设计,降低了数据清洗的复杂度。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,经Electric Sheep Europe于2025年重新打包发布,聚焦欧洲39个国家1987至2025年间脱离劳动力人口(即非劳动力人口)的性别、教育程度及城乡分布情况。作为ILOSTAT全球劳动力统计数据库的核心子集,该数据旨在揭示劳动力未充分利用的隐性维度,为理解欧洲劳动力市场的结构性问题提供关键定量依据。其研究核心在于通过93,461条观测记录,系统刻画非劳动力人口在时间序列与地域间的异质性模式,支撑关于就业政策、社会包容性及教育投资回报的实证分析。该数据集因整合了国际劳工组织统一规范化的人口调查与行政记录数据,成为研究欧洲经济一体化进程中劳动力边缘化现象的重要基石,对劳动力经济学、公共政策评估及社会分层研究具有显著影响力。
当前挑战
该数据集所解决的领域问题主要集中于劳动力未充分利用的测度困境,即传统失业率指标无法涵盖因丧失就业信心、家庭责任或教育参与等原因而完全退出劳动力市场的人群,从而难以全面反映实际就业短缺与社会资源错配。构建过程中的挑战包括:多源调查数据(如劳动力调查与家庭收支调查)在方法定义与采集频率上的不一致性,需通过国际劳工统计学家会议(ICLS)标准进行跨国家、跨时期的协调统一;年度数据频次与月度或季度指标的混同处理,以及因方法论修订(如`note_indicator.label`标识)导致的时间序列断点校正。此外,分类维度(性别、教育与地理)的精细程度受限于各国原始数据提供的颗粒度,而城市与农村区域的划分标准分歧进一步增加了跨地域可比性的维护难度,这些技术障碍在高维类别缺失值的处理与信度标记(如`obs_status`中的不可靠标签)中尤为突出。
常用场景
经典使用场景
该数据集以国际劳工组织ILOSTAT数据库为基石,系统汇集了1987年至2025年间39个欧洲国家中未进入劳动力市场人群的性别、教育程度及城乡分布数据。其经典使用场景聚焦于劳动经济学领域中的时间序列分析与面板数据建模,研究者可通过此数据追踪不同群体在劳动力市场边缘状态下的长期变动趋势,结合性别与教育维度解构劳动力闲置的结构性特征,为理解欧洲各国劳动力参与率的动态演变提供量化支撑。
解决学术问题
该数据集在学术层面主要回应了劳动力市场研究中关于隐性失业与非充分就业的度量难题。传统失业率指标往往忽略因灰心丧气、家庭责任或教育投资而退出劳动力市场的庞大群体,而本数据通过细化性别、教育程度和城乡划分,揭示了边缘群体在劳动力资源配置中的结构性错位。它为验证人力资本理论、性别不平等机制以及城乡二元结构对劳动参与率的影响提供了实证基础,推动了关于劳动力市场弹性与社会政策效应的跨国家比较研究。
衍生相关工作
围绕这一数据资源,学术界已衍生出多项经典工作。在计量方法上,研究者常将其用于构建面板数据回归模型以估计教育回报率与性别工资差距,或结合时间序列分解技术预测劳动力结构性变化。在应用方向,已有工作基于该数据探讨移民浪潮对本土劳动力退出率的影响,以及自动化技术对低技能群体就业意愿的冲击。此外,该数据也常与其他ILOSTAT指标(如就业率、失业率)融合,形成多维劳动力市场效率评价体系,助力宏观经济学与劳动力社会学交叉领域的研究深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务