遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-mts-dsb-nb-persons-outside-the-labour-force-by-sex-marital-st

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲32个国家2002年至2025年间按性别、婚姻状况和残疾状况划分的非劳动力人口统计信息(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖46,892个观测值,具体指标为“EIP_TEIP_SEX_MTS_DSB_NB”。数据集提供了国家代码、数据来源、指标分类、时间、观测值及数据质量标注等字段,适用于劳动力市场分析、时间序列预测和表格分类等任务。

This dataset contains statistics on persons outside the labour force by sex, marital status, and disability status (in thousands) for 32 European countries from 2002 to 2025. Sourced from the International Labour Organizations (ILO) ILOSTAT database, it includes 46,892 observations with the indicator EIP_TEIP_SEX_MTS_DSB_NB. The dataset provides fields such as country codes, data sources, indicator classifications, time, observed values, and data quality flags, suitable for labour market analysis, time-series forecasting, and tabular classification tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-mts-dsb-nb-persons-outside-the-labour-force-by-sex-marital-st 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于劳动力市场中的劳动利用不足问题。其构建过程严谨而系统化:通过ILOSTAT的REST API接口直接获取原始数据,并依据欧洲ISO3国家代码进行地理过滤,从而精准提取出32个欧洲国家的相关观测记录。ILO统计部门依据国际劳工统计学家会议(ICLS)的统一定义,对各国劳动力调查、家庭收入调查等微观数据进行了标准化处理与协调,确保了数据口径的一致性。最终形成的表格包含46,892条观测,时间跨度从2002年至2025年,涵盖了按性别、婚姻状况及残疾状况划分的劳动力市场外人群规模(单位:千人)这一核心指标。
特点
该数据集最显著的特点是具备多维度的精细分层结构。除了核心的观测值(obs_value)外,其分类变量(classif1与classif2)能够揭示不同婚姻状况与残疾状况的细分,而性别(sex)变量则涵盖了总、男、女三个维度。这种多层次交叉分类的设计,使得研究者能够深入剖析不同社会群体在劳动力市场边缘的状态差异。此外,数据集中附带了详尽的元数据标注,包括数据来源(source.label)、观测状态标志(obs_status)以及各类笔记(note_classif、note_indicator),这些信息为评估数据质量、识别统计口径变化(如方法修订导致的序列断裂)提供了宝贵线索,体现了高度的透明度和学术严谨性。
使用方法
数据集的访问极为便捷,研究人员可通过HuggingFace的`load_dataset()`函数直接加载,随后使用`to_pandas()`方法将其转换为Pandas DataFrame,以便利用Python生态进行深入分析。用户可以根据ISO国家代码(ref_area)轻松筛选特定国家的数据,开展国别研究。对于时间序列分析,可按指示器代码(indicator)进行过滤并依据年份(time)排序,从而绘制趋势图。更进一步,通过数据透视表(pivot_table)操作,可以方便地将数据重塑为国家与年份的矩阵形式,为面板数据建模和比较研究奠定坚实基础。其简洁的列结构和标准化的Schema设计,极大地降低了数据清洗的复杂度。
背景与挑战
背景概述
劳动力市场边缘群体,尤其是因性别、婚姻状况与残疾状态而处于劳动大军之外的人群,一直是劳动经济学与社会政策研究关注的焦点。国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库系统收集了覆盖200多个经济体的劳动力指标,为跨国比较提供了坚实基础。该数据集由Electric Sheep Europe于2025年重新整理并发布,聚焦欧洲32个国家在2002至2025年间关于‘劳动力未充分利用的其他衡量指标’,核心研究问题在于量化并解析性别、婚姻状况与残疾状态如何交互影响个体退出劳动力市场的概率。通过提供46,892条经统一规范的观测值,该数据集填补了欧洲层面高分辨率、多维度劳动力边缘群体数据的空白,对劳动经济学、社会分层研究以及包容性政策的评估产生了重要推进作用。
当前挑战
该数据集所解决的核心领域问题在于,传统的劳动力统计往往仅关注失业率,而忽视了因残疾或家庭责任等原因彻底退出劳动力市场的庞大群体,这使得针对边缘人群的政策制定缺乏数据支撑。构建过程中面临多重挑战:首先,ILOSTAT原始数据源自各国不同的劳动力调查、家庭收支调查及行政记录,需依据国际劳工统计学家会议(ICLS)定义进行复杂的方法论调和与标准化;其次,32个国家的数据覆盖时间跨度长达24年,期间各国统计口径、调查问卷及残疾定义(如‘残疾的非标准定义’注释所揭示)存在频繁修订,导致时间序列存在断裂点;最后,数据以‘最佳来源’原则筛选多重来源,且观测值附带可靠性标记(如‘不可靠’状态),如何在保证跨国产出可比较性的同时如实反映原始数据的质量波动,是确保模型训练与政策推断可靠性的重大挑战。
常用场景
经典使用场景
在劳动经济学与社会保障研究领域,该数据集最经典的运用场景是对欧洲非劳动力人口的结构性刻画。通过整合32个国家2002至2025年间按性别、婚姻状况与残疾状态细分的数据,研究者能够精准量化不同社会群体退出劳动力市场的规模与特征。这一高粒度面板数据为跨国家、跨时段的比较分析提供了坚实基础,尤其在探讨残疾人群体的经济参与障碍、婚姻状态与就业决策的交互效应时,展现出不可替代的方法论价值。
实际应用
在实际应用层面,该数据集为欧洲各国劳动政策制定与社会保障体系优化提供了量化支撑。政策分析师可利用其时间序列特征,监测特定群体(如已婚残疾女性)退出劳动力市场的长期趋势,评估社会保障改革或残疾包容政策的实施效果。国际组织如国际劳工组织与欧盟委员会可基于此数据构建早期预警指标,识别因结构性因素导致劳动力参与率下降的区域,从而制定更具靶向性的就业促进与再培训计划。
衍生相关工作
围绕该数据集,已涌现出若干具有影响力的衍生研究工作。诸多学者基于此类ILOSTAT非劳动力人口数据,开发了劳动力市场边缘群体的多维分类框架,并利用面板回归或动态时间序列模型探究老龄化、技术进步与性别平等政策对劳动力退出的调节效应。此外,该数据也常与宏观经济指标数据库联合使用,为构建劳动力市场脆弱性指数、设计基于婚姻与残疾状态的劳动参与预测模型提供了实验基础,推动了劳动经济学方法论向更精细化的社会分层研究演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务