遇见数据集

electricsheepeurope/europe-ilo-eip-dwap-sex-dsb-rt-inactivity-rate-by-sex-and-disability-status

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和残疾状况划分的不活动率(%)| 欧洲(ILOSTAT),由Electric Sheep Europe重新打包。它包含5,433个观测值,覆盖33个欧洲国家,时间跨度为2002年至2025年,专注于其他劳动力利用不足的衡量指标主题。具体指标是EIP_DWAP_SEX_DSB_RT,即按性别和残疾状况划分的不活动率(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源,整合了就业、失业、工资等多个领域的指标。数据集通过ILOSTAT REST API获取,并过滤为欧洲国家代码,确保数据经过ILO的标准化处理。模式包括国家代码、指标、性别分类、时间、观测值等列,并提供了数据质量说明,如年度频率、最佳来源选择等。数据集适用于表格分类、回归和时间序列预测等任务,旨在为欧洲提供统一的、机器学习就绪的数据层。

This dataset is named Inactivity rate by sex and disability status (%) | Europe (ILOSTAT) and is repackaged by Electric Sheep Europe. It contains 5,433 observations across 33 European countries, spanning the years 2002 to 2025, focusing on the topic of Other measures of labour underutilization. The specific indicator is EIP_DWAP_SEX_DSB_RT, which represents the inactivity rate by sex and disability status (%). The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, a leading global source for labour statistics that compiles indicators across employment, unemployment, wages, and more. The dataset is pulled directly from the ILOSTAT REST API and filtered to Europe ISO3 country codes, ensuring harmonization using ICLS definitions. The schema includes columns such as country code, indicator, sex classification, time, and observed value, along with data quality caveats like annual frequency and best-source selection. It is suitable for tabular classification, regression, and time-series forecasting tasks, aiming to provide a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-dwap-sex-dsb-rt-inactivity-rate-by-sex-and-disability-status 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计领域最权威的数据来源之一。数据通过ILOSTAT REST API直接抽取,具体调用了标识符为'EIP_DWAP_SEX_DSB_RT'的接口,并依据欧洲ISO3国家代码进行地理范围过滤。ILOSTAT采用国际劳工统计学家会议(ICLS)定义的标准,对原始调查微观数据进行统一清洗与标准化,从而确保跨国可比性。数据经Electric Sheep Europe团队重新封装,以Parquet格式存储于HuggingFace平台,便于机器学习场景下的高效加载。
特点
该数据集涵盖2002年至2025年间33个欧洲国家的5,433条观测记录,聚焦于'劳动利用不足的其他衡量指标'中的非经济活动率维度,并按性别与残疾状态进行细致划分。数据集包含丰富的元数据列,如'obs_status'标记数据可靠性(如序列中断)、'note_classif'与'note_indicator'提供定义差异与方法论变更的追溯信息,为数据质量控制提供了透明框架。此外,数据以年频呈现,并优先选用ILO认定的'最佳来源',有效降低了多源数据不一致的风险。
使用方法
研究者可通过HuggingFace Datasets库中的load_dataset()函数一键加载该数据集,并将其转换为Pandas DataFrame进行分析。使用时可按国别筛选,例如选取'ref_area'为'DEU'的子集;也可针对特定指标进行时间序列可视化,如对'EIP_DWAP_SEX_DSB_RT'按时间排序并绘图。此外,借助pivot_table方法可将数据重构为国家×年份的矩阵形式,便于面板数据分析或后续的回归建模。数据使用需遵循CC-BY-4.0许可协议,并建议同时引用ILO原始来源与Electric Sheep Europe的封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)创建,并由Electric Sheep Europe于2025年重新打包发布至HuggingFace平台。其核心研究问题聚焦于欧洲33个国家2002至2025年间按性别与残疾状况划分的经济不活跃率,旨在揭示劳动力市场中被传统失业指标忽略的隐性闲置群体。作为ILO推动的“劳动力利用不足其他指标”体系的一部分,该数据集为评估包容性社会政策及《2030年可持续发展议程》中体面劳动目标提供了关键量化工具。其在劳动力统计学与残障研究交叉领域的影响力日益凸显,尤其在欧洲政策制定者追踪残障人群就业壁垒的纵向趋势中具有不可替代的价值。
当前挑战
该领域面临的核心挑战在于跨国家劳动力调查方法论的非一致性:各国对“残疾”的操作化定义差异显著(如自我报告、医学诊断或功能性限制标准),导致跨国可比性受到质疑。数据构建过程中,ILOSTAT虽采用国际劳工统计学家会议(ICLS)统一规范进行微观数据调和,但严重依赖各国调查的原始质量与问卷设计差异。此外,时间序列中频繁出现的“序列断裂”(obs_status字段标记)源于方法论修订或源数据更迭,可能引入结构性偏移。样本量有限(5433条记录)且来源单一(主要依赖劳动力调查),削弱了细分群体(如特定残疾等级或交叉性人口分组)的统计推断效力,制约了高级时间序列模型与因果推断方法的适用性。
常用场景
经典使用场景
该数据集收录了2002年至2025年间33个欧洲国家的非经济活动率按性别与残疾状态划分的年度观测值,共计5437条记录。在劳动经济学与包容性发展研究中,它常被用作评估残疾人口劳动参与障碍的基准数据源。研究场景涵盖了跨国比较面板分析、时间序列预测以及分类与回归建模,学者可借助该数据解析不同性别与残疾状态群体在劳动力市场边缘化的长期趋势,进而为政策干预提供定量依据。
解决学术问题
该数据集精准回应了劳动经济学中关于残疾人群劳动边缘化的测量难题。传统失业率常低估结构性就业障碍,而此数据通过捕捉非经济活动率——即不参与求职也无就业意愿的人群比例——揭示了被市场忽视的无声困境。它使得分析残疾状态、性别与劳动参与之间的交叉性影响成为可能,推动了包容性增长指标体系的构建,并为检验社会保障政策对弱势群体的实际效果提供了实证基础。
衍生相关工作
基于此数据集,研究者衍生了一系列标志性工作。在计量经济学领域,它被用于构建残疾相关的劳动非活动率预测模型及贝叶斯时序推断框架;在社会政策研究中,催生了多篇探讨欧洲各国残疾就业配额制度有效性的比较研究。国际劳工组织本身的数据治理标准(如ICLS定义)经由该数据集在开源社区的复现,推动了ILOSTAT API数据产品在机器学习社区中的标准化应用,进而促进了劳动统计与数据科学交叉领域的繁荣。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务