遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-edu-dsb-nb-employees-by-sex-education-and-disability-status-t

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、教育和残疾状况划分的雇员数(千)| 欧洲(ILOSTAT)”,是一个表格型数据集,专注于时间序列预测和分类回归任务。它包含24,041个观测值,覆盖32个欧洲国家,时间跨度为2002年至2025年,涉及1个核心指标:EES_TEES_SEX_EDU_DSB_NB,即按性别、教育和残疾状况划分的雇员数(单位:千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码。数据集包括多个列,如国家代码、国家名称、数据源、指标代码、性别分解(总计、男性、女性)、教育分类、残疾状况分类、年份、观测值、观测状态标志以及相关注释。数据质量方面,为年度频率,ILO选择最佳数据源,分解列仅在指标发布时非空。该数据集由Electric Sheep Europe重新打包,旨在为欧洲提供统一的、机器学习就绪的数据层,便于研究人员和开发者使用HuggingFace的load_dataset()快速加载和分析数据。许可证为CC-BY-4.0,使用时需引用原始源和重新打包方。

This dataset, named Employees by sex, education and disability status (thousands) | Europe (ILOSTAT), is a tabular dataset focused on time-series forecasting and classification/regression tasks. It contains 24,041 observations across 32 European countries, spanning from 2002 to 2025, with 1 core indicator: EES_TEES_SEX_EDU_DSB_NB, which represents employees by sex, education, and disability status (in thousands). The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, retrieved via REST API and filtered to European country codes. The dataset includes columns such as country code, country name, data source, indicator code, sex disaggregation (total, male, female), education classification, disability status classification, year, observed value, observation status flags, and related notes. In terms of data quality, it is annual frequency, with ILO selecting the best source for each country-year, and disaggregation columns are non-null only when published. Repackaged by Electric Sheep Europe, it aims to provide a unified, ML-ready data layer for Europe, enabling researchers and developers to quickly load and analyze data using HuggingFaces load_dataset(). Licensed under CC-BY-4.0, users must cite both the original source and the repackaging when using the dataset.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-edu-dsb-nb-employees-by-sex-education-and-disability-status-t 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,由Electric Sheep Europe通过ILOSTAT REST API直接抽取指标EES_TEES_SEX_EDU_DSB_NB的原始记录,并以欧洲ISO3国家代码为条件进行筛选与重整。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一调和,来源信息通过source.label字段标注以保障可追溯性。
特点
数据集涵盖2002至2025年间32个欧洲国家的24,041条年度观测,聚焦按性别、教育程度与残疾状况分组的雇员人数(千人)。变量体系包含ref_area、source、indicator、sex、classif1、classif2、time、obs_value及多类注释字段,其中性别维度提供总计、男性与女性三类取值,注释列则记录非标准定义、序列断裂等质量信息,支持表格分类、回归与时间序列预测等多类任务。
使用方法
研究者和开发者可通过HuggingFace的datasets库调用load_dataset接口加载该数据集,并转换为Pandas数据框进行后续分析。典型操作包括按ref_area筛选特定国家、按indicator与time排序以提取单指标时间序列、利用pivot_table将数据重塑为国家×年份矩阵,从而服务于跨国比较、趋势分析与计量建模等应用场景。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与可比性建设,其ILOSTAT数据库汇聚了200余个经济体的劳动力调查与行政记录,成为劳动经济学与就业政策研究的权威基石。在此背景下,ILO统计司于2025年通过REST API公开发布了涵盖32个欧洲国家、2002至2025年间24,041条观测记录的雇员数据,并由Electric Sheep Europe重新封装为机器学习就绪格式。该数据集以性别、教育程度与残疾状况三重维度刻画雇员规模,填补了欧洲残疾就业与教育分层交叉统计的空白,为包容性劳动力市场政策评估提供了关键实证基础。
当前挑战
该数据集所应对的领域难题在于,跨国劳动统计长期面临残疾定义非标准化、教育分类体系异质以及抽样调查口径不一致等固有障碍,致使跨年度与跨国家的可比性严重受限。构建过程中,原始微数据经ICLS定义调和后仍存在序列断裂、来源不统一与观测状态标记为不可靠等情形,部分国家缺失特定性别与残疾状态的交叉分类值,且时间序列在方法论修订节点上缺乏连续性。上述数据稀疏与异质性问题对建模中的缺失值插补、分类偏倚校正及时序平稳性假设提出了实质性挑战。
常用场景
经典使用场景
在国际劳动经济学与残障就业研究的交汇领域,该数据集最经典的使用场景在于构建跨国别、长时段的性别—教育—残障三重交互的就业分层面板模型。研究者凭借2002至2025年间32个欧洲国家逾两万条观测记录,得以在统一分类框架下考察不同教育禀赋与残障状态下男性和女性雇员规模的动态演化,进而识别欧洲劳动力市场中残障群体就业的结构性特征与收敛趋势,为比较制度分析提供精细化的量化基底。
衍生相关工作
依托该数据集,一系列围绕残障就业差距分解、教育回报异质性及性别交互效应的实证研究相继涌现。部分工作将其与欧洲社会调查、欧盟劳动力调查微观数据链接,以检验宏观统计与个体感知之间的一致性;另有研究运用时间序列方法探测金融危机与公共卫生事件对残障雇员规模的冲击弹性。这些衍生成果不仅拓展了ILOSTAT数据的学术应用边界,亦推动了残障就业统计方法论的持续精进。
数据集最近研究
最新研究方向
在全球劳动力市场日益关注包容性增长的背景下,基于ILOSTAT权威数据的性别、教育与残疾状态交叉分析正成为劳动经济学的前沿议题。该数据集覆盖32个欧洲国家2002至2025年的24,041条观测记录,为揭示残疾劳动者在教育回报与就业机会上的性别差异提供了独特的面板数据支撑。近期研究聚焦于利用机器学习与因果推断方法,探究教育水平如何调节残疾对就业参与的影响,并识别不同福利体制国家间的异质性模式。这一方向不仅呼应了联合国可持续发展目标中“体面工作与经济增长”及“减少不平等”的核心议程,也为欧洲残疾就业政策的精准评估与优化提供了实证基础,具有显著的政策意义与学术价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务