遇见数据集

electricsheepeurope/europe-ilo-ees-tees-sex-age-dsb-nb-employees-by-sex-age-and-disability-status-thousan

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格数据集,包含欧洲32个国家从2002年至2025年的员工数据,按性别、年龄和残疾状况分类(以千为单位)。数据集共有43,704个观测值,涵盖一个核心指标:EES_TEES_SEX_AGE_DSB_NB(按性别、年龄和残疾状况分类的员工数,单位:千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过过滤处理,以确保覆盖欧洲地区。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、残疾状况分类、观测年份、观测值、数据状态标志以及相关注释。数据以年度频率发布,并经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)的定义进行协调。该数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为机器学习和研究提供欧洲劳动力市场的标准化数据。

This dataset is a tabular dataset containing employee data for 32 European countries from 2002 to 2025, disaggregated by sex, age, and disability status (in thousands). It includes 43,704 observations and covers one core indicator: EES_TEES_SEX_AGE_DSB_NB (Employees by sex, age and disability status, in thousands). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via API and filtered to cover European countries. The dataset provides a detailed schema with columns for country codes, country names, data sources, indicator codes, sex disaggregation, age classification, disability status classification, observation year, observed values, data status flags, and related notes. The data is published at an annual frequency and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. It is suitable for tasks such as tabular classification, tabular regression, and time-series forecasting, aiming to provide standardized data on Europes labor market for machine learning and research purposes.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-tees-sex-age-dsb-nb-employees-by-sex-age-and-disability-status-thousan 数据集图片
构建方式
国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库汇集了来自各国劳动力调查、家庭收入调查、机构调查及行政记录的多源数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化调和。本数据集由Electric Sheep Europe通过ILOSTAT REST API直接提取指标EES_TEES_SEX_AGE_DSB_NB,筛选欧洲ISO3国家代码后重新封装为HuggingFace数据集,涵盖2002至2025年间32个欧洲国家的43,704条观测记录,每条记录均标注来源标签以确保可追溯性。
特点
该数据集以表格形式呈现欧洲地区按性别、年龄及残疾状况分组的雇员人数(千人),时间跨度为2002至2025年,覆盖32个国家,包含超过4.3万条观测。数据以年度频率发布,提供性别(总计、男性、女性)、年龄组别及残疾状态等多维分类变量,并附带来源、指标、注释等元数据列,便于用户追溯统计口径与数据质量。部分观测带有状态标记(如临时性、不可靠),且当同一国家同年份存在多源数据时,采用ILO优选的最佳来源。
使用方法
该数据集可通过HuggingFace的datasets库以load_dataset函数直接加载,返回训练集并转换为Pandas DataFrame进行后续分析。用户可依据ref_area列筛选特定国家(如DEU代表德国),或依据indicator列提取单一指标并排序以生成时间序列图。进一步地,可利用pivot_table将数据重塑为国家×年份矩阵,便于开展跨国比较或趋势分析。数据集适用于表格分类、回归及时间序列预测等机器学习任务,同时为劳动经济学研究提供便捷的数据支撑。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与传播,其ILOSTAT数据库汇聚了200余个经济体的劳动力调查数据,成为劳动经济学与社会科学研究的基石。在此背景下,Electric Sheep Europe于2025年对ILOSTAT中“按性别、年龄与残疾状况分类的雇员数据”进行重新打包,覆盖32个欧洲国家、2002至2025年间共计43,704条观测,旨在为机器学习社区提供即用型表格数据。该数据集回应了残障人士就业歧视与劳动力市场不平等这一核心议题,为探究性别、年龄与残疾三重交叉边缘化提供了量化基础,对推动包容性就业政策具有重要参考价值。
当前挑战
该数据集所直面的领域难题在于,残疾状况的劳动统计长期面临定义模糊与测量异质性的困扰,各国对残疾的界定标准不一,导致国际可比性受限。构建过程中,ILOSTAT虽经由国际劳工统计学家会议(ICLS)定义进行协调,但原始数据源自多样的劳动力调查与家庭收入调查,观测状态常标注为“不可靠”或“序列中断”,且部分国家年份缺失频仍。此外,分类变量仅当指标发布细分时才非空,致使数据矩阵稀疏;同时,残疾身份在调查中多依赖自我报告,易受社会污名影响而产生系统性瞒报,这些因素共同构成了对数据质量与建模稳健性的严峻考验。
常用场景
经典使用场景
在劳动经济学与残疾人就业研究的交汇处,该数据集构成了分析欧洲劳动力市场包容性的基础性资源。其经典使用场景聚焦于按性别、年龄组和残疾状况三维交叉的雇员数量,为探究不同人口群体在就业规模上的结构性差异提供了精细化的观测窗口。研究者可借助2002至2025年的纵向序列,考察残疾雇员在整体就业中的占比演变,并比较性别与年龄分层下的异质性轨迹,从而揭示欧洲各国在促进残疾人融合就业方面的进展与落差。
解决学术问题
该数据集有效回应了残疾就业统计中可比性不足与细分维度欠缺的学术困境。以往跨国研究常受限于定义差异与样本稀疏,难以在统一框架下评估残疾状况对就业参与的影响。依托ILO基于国际劳工统计学家会议标准的协调方法,该数据集解决了残疾身份与年龄、性别交互效应难以分离的问题,使学者能够控制国别与时间效应,识别特定群体的就业脆弱性。其意义在于为包容性劳动力市场政策提供了可复现的实证依据,并推动了残疾就业测量方法的标准化讨论。
衍生相关工作
围绕该数据集,后续研究衍生出若干经典工作方向。一部分学者将其与教育程度、行业分类等ILOSTAT指标合并,构建多维就业脆弱性指数;另一部分则利用其时间序列特性,开发残疾就业差距的预测模型与政策情景模拟。此外,该数据集常被用作基准,验证机器学习方法在稀疏分组数据上的插补与分类性能,并催生了针对残疾就业统计质量评估的方法学论文,持续拓展劳动统计数据的学术应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务