遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-dsb-nb-employees-by-sex-and-disability-status-thousands

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和残疾状况划分的雇员数量(千)| 欧洲(ILOSTAT),是一个表格型数据集,适用于分类、回归和时间序列预测任务。它包含5,408个观测值,覆盖32个欧洲国家,时间跨度为2002年至2025年,专注于一个特定指标:按性别和残疾状况划分的雇员数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家代码。数据集提供了详细的模式,包括国家代码、指标、性别分类、时间、观测值等列,并包含数据质量说明和使用示例。数据以CC-BY-4.0许可证发布,由Electric Sheep Europe重新打包,旨在为欧洲提供统一的、机器学习就绪的数据层。

This dataset is named Employees by sex and disability status (thousands) | Europe (ILOSTAT) and is a tabular dataset suitable for classification, regression, and time-series forecasting tasks. It contains 5,408 observations across 32 European countries, spanning from 2002 to 2025, focusing on a single indicator: employees by sex and disability status in thousands. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to European country codes. The dataset includes a detailed schema with columns such as country code, indicator, sex classification, time, observed value, and more, along with data quality notes and usage examples. It is released under the CC-BY-4.0 license and repackaged by Electric Sheep Europe, aiming to provide a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-dsb-nb-employees-by-sex-and-disability-status-thousands 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接提取指标EES_TEES_SEX_DSB_NB的原始记录,并依据欧洲ISO3国家代码进行筛选。原始调查微观数据经ILO统计局按照国际劳工统计学家会议(ICLS)定义进行统一协调,数据来源在source.label列中标注以确保可追溯性。最终由Electric Sheep Europe重新打包为Parquet格式,发布于HuggingFace平台。
特点
数据集覆盖32个欧洲国家,时间跨度为2002年至2025年,包含5408条观测记录。核心指标为按性别和残疾状况分类的雇员人数(千人),并以性别维度(总计、男性、女性)进行分解。每条记录附带来源、指标、分类、注释及观测状态等元数据,便于评估数据质量与定义差异。数据频率为年度,采用CC-BY-4.0许可协议。
使用方法
研究者可通过HuggingFace的datasets库加载数据集,并转换为Pandas数据框进行后续分析。典型操作包括按国家代码筛选特定国家数据、针对单一指标构建时间序列、以及将数据透视为国家×年份矩阵以观察跨国趋势。该数据集适用于表格分类、回归及时间序列预测等任务,使用时需注意部分观测值存在可靠性标记或定义非标准等提示信息。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计的标准化与可比性建设,其核心数据库ILOSTAT汇集了涵盖就业、失业、工资及弱势群体就业等多维度指标,为政策制定与学术研究提供权威数据支撑。在此背景下,Electric Sheep Europe于2026年对ILOSTAT原始数据进行再封装,发布了欧洲地区按性别与残疾状况分列的雇员人数数据集(单位:千人),覆盖32个欧洲国家、2002至2025年的5408条观测记录。该数据集的核心研究问题在于揭示残疾状态与性别双重维度下欧洲雇员分布的异质性,为评估劳动力市场包容性政策、追踪弱势群体就业趋势提供了量化基础,对劳动经济学、社会政策分析及可持续发展目标(SDG)中体面工作议题的实证研究具有重要参考价值。
当前挑战
该数据集所回应的领域问题在于残疾状况与性别交互作用下的就业统计长期面临数据稀疏与口径不一的困境,传统劳动力调查往往难以提供兼具时间连续性与跨国可比性的细分指标。在构建过程中,数据集面临多重挑战:一是残疾定义的非标准化,不同国家采用各异的概念框架与测量工具,导致横向比较存在偏差,数据中标注的非标准定义与序列断裂提示了此类问题;二是原始调查数据的可靠性参差,部分观测值带有不可靠或临时性状态标记,影响统计推断的稳健性;三是样本覆盖不均衡,部分国家仅间歇性报告或缺失关键年份,加剧了时间序列建模与缺失值处理的复杂度;四是分类维度非空性缺失,当指标未发布特定细分时相应字段为空,要求使用者在分析前进行审慎的预处理与口径统一。
常用场景
经典使用场景
在劳动经济学与残障就业研究的交汇地带,该数据集构成了刻画欧洲劳动力市场包容性演进的典型面板素材。其经典用法依托32国2002至2025年的年度序列,按性别与残障状态对雇员人数进行分层比较,既可绘制跨国残障就业规模的时间趋势,亦能支撑性别差距与残障差距的双重分解,常被用于构建国家×年份×性别×残障状态的四维分析框架。
衍生相关工作
围绕这一数据资源,后续研究衍生出多条经典工作脉络。一类工作将其与ILOSTAT其他指标如失业率、工作时长和部门结构进行联结,考察残障就业的多维决定因素;另一类工作发展出跨国残障就业差距的分解方法,区分构成效应与结构效应;还有研究以此为基础构建残障包容指数,用于跨国比较与长期追踪,形成了一批可复用的衍生指标与分析工具。
数据集最近研究
最新研究方向
在劳动力市场统计与残疾包容性研究领域,该数据集揭示了前沿研究对残疾状况与性别交叉维度的精细化分析趋势。相关研究聚焦于利用跨国面板数据评估残疾雇员在就业率、职业隔离及薪酬差距方面的动态演变,并结合ILO残疾包容性政策框架,探讨性别与残疾双重弱势群体的就业脆弱性。区域热点包括欧盟残疾就业战略(2021-2030)及SDG8目标下的包容性就业监测,推动了基于该数据集的计量建模与机器学习预测。其影响在于为政策制定者提供性别敏感型残疾就业基准,促进跨国比较研究及循证干预,对实现公平劳动市场具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务