遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-edu-dsb-nb-persons-outside-the-labour-force-by-sex-education

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含关于按性别、教育程度和残疾状况划分的非劳动力人口(千人)的27,652个观测值,覆盖32个欧洲国家,时间跨度为2002年至2025年,涉及1个独特指标(EIP_TEIP_SEX_EDU_DSB_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接获取并过滤为欧洲国家数据。数据集采用表格形式,包含国家代码、性别分类(总计、男性、女性)、教育程度、残疾状况、年份、观测值及其状态标志等列。数据已由Electric Sheep Europe重新打包为标准化格式,便于机器学习任务使用,如表格分类、回归和时间序列预测。数据遵循CC-BY-4.0许可协议。

This dataset contains 27,652 observations of Persons outside the labour force by sex, education and disability status (thousands) across 32 Europe countries, spanning 2002–2025, covering 1 distinct indicator (EIP_TEIP_SEX_EDU_DSB_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled directly via REST API and filtered to European ISO3 country codes. It is presented in tabular format with columns including country codes, sex disaggregation (total, male, female), education, disability status, year, observed value, and status flags. The dataset has been repackaged by Electric Sheep Europe into a normalized schema for machine learning readiness, suitable for tasks such as tabular classification, regression, and time-series forecasting. It is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-edu-dsb-nb-persons-outside-the-labour-force-by-sex-education 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接提取指标编码为EIP_TEIP_SEX_EDU_DSB_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。数据集囊括了2002年至2025年间32个欧洲国家的27,652条观测记录。在数据整合过程中,ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查的微观数据进行标准化处理,并标注数据来源(source.label列)以确保可追溯性。最终,数据由Electric Sheep Europe团队进行重新打包,形成可直接用于机器学习的表格格式。
特点
该数据集的核心特点在于其精细的多维度分类结构。除了常见的性别(sex)与时间(time)维度外,还特别引入了教育水平(classif1)和残疾状况(classif2)两个分类变量,能够支持对劳动力市场边缘群体进行深度交叉分析。数据指标关注的是非劳动力人口(Persons outside the labour force),为衡量劳动力未充分利用提供了补充视角。此外,数据集标注了观测状态(obs_status)及各类注释(note_classif, note_indicator, note_source),便于用户识别数据质量波动,如由于方法修订导致的序列中断或不可靠数据。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集:使用`load_dataset("electricsheepeurope/europe-ilo-eip-teip-sex-edu-dsb-nb-persons-outside-the-labour-force-by-sex-education")`即可获取训练集并转换为pandas DataFrame。加载后,用户可按国家(ref_area)进行筛选以聚焦单一国家的时间序列,或对特定指标(indicator)进行排序和可视化。数据集的表格结构也支持通过pivot_table方法构建国家×年份的矩阵,便于进行面板数据分析、时间序列预测或分类回归建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年基于ILOSTAT数据库创建,经Electric Sheep Europe重新整理后发布,聚焦欧洲32个国家2002至2025年间劳动力市场边缘群体。核心研究问题在于量化分析因性别、受教育程度与残疾状态而游离于劳动力市场之外的人口规模,为劳动力未充分利用的多维测度提供精细化的数据支撑。作为ILOSTAT体系的重要子集,该数据填补了欧洲层面在弱势劳动群体交叉分类领域的结构性空白,为劳动经济学、社会保障政策及可持续发展目标(SDG)的相关实证研究奠定了跨时空可比的基础框架。
当前挑战
在领域问题层面,劳动力未充分利用的统计口径长期以失业率为主导,难以捕捉因残疾、教育水平低下或家庭责任而被迫退出市场的隐性群体,该数据集试图通过交叉分类揭示这些被传统指标掩盖的结构性困境。构建过程中面临的显著挑战包括:各国劳动力调查的抽样设计与时间周期存在差异,ILO需通过ICLS标准定义进行数据协调以降低异质性;部分国家因调查方法或残疾定义变更导致序列中断,需依赖注记字段进行溯源;同时,因同一国家可能出现多个数据源,ILO择优选取的策略可能引入潜在的选择性偏差,影响时序分析的稳健性。
常用场景
经典使用场景
该数据集以ILOSTAT官方统计数据为基础,汇聚了2002年至2025年间32个欧洲国家中,依据性别、教育程度与残疾状况划分的劳动力市场以外人口数量(以千计)。其经典使用场景聚焦于劳动力市场边缘群体的结构性分析,研究者可借助该数据集纵向描绘跨年代、跨国界的非劳动力人口演变趋势,横向比较不同性别、教育层次与残疾状态人群在就业参与上的差异性,从而揭示社会排斥与劳动参与障碍的多重维度。
解决学术问题
该数据集有效回应了劳动经济学、人口社会学与公共政策研究中的核心关切——劳动力边缘化群体的构成与演变机制。它帮助学术界破解性别不平等与教育分层在劳动参与中的交互效应,量化残疾个体面临的系统性就业壁垒,并为欧洲各国劳动力市场政策的微观评估提供跨年度的可比证据。其意义在于为构建包容性劳动力市场政策、监测可持续发展目标中的体面劳动指标提供了坚实的数据基础。
衍生相关工作
该数据集催生了一系列围绕ILOSTAT数据再包装、标准化与机器学习就绪化的经典工作,其中Electric Sheep Europe团队构建的欧洲统一数据层是代表性成果。其衍生的研究路径包括:基于时间序列模型预测非劳动力人口对宏观政策变动的响应,利用分类与回归算法推断教育程度与残疾状态对劳动参与概率的非线性影响,以及借助面板数据分析识别国家间劳动排斥模式的聚类特征。这些工作显著提升了官方统计数据在计算社会科学中的二次利用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务