遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-dsb-nb-average-monthly-earnings-of-employees-by-sex-and-d

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲32个国家从2004年至2025年的员工平均月收入数据,按性别和残疾状况进行细分,以本地货币为单位。数据集共有5,363个观测值,涵盖一个核心指标(EAR_EMTA_SEX_DSB_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过处理,确保覆盖欧洲地区。数据集以表格形式组织,包括国家代码、年份、指标值、性别分类(总计、男性、女性)、残疾状况分类等列,并包含数据来源、质量标志和注释信息。它适用于表格分类、回归和时间序列预测任务,旨在为研究欧洲劳动力市场、收入不平等和残疾包容性提供机器学习就绪的数据支持。

This dataset contains average monthly earnings of employees in 32 European countries from 2004 to 2025, disaggregated by sex and disability status in local currency. It includes 5,363 observations covering one core indicator (EAR_EMTA_SEX_DSB_NB), sourced from the International Labour Organization (ILO) ILOSTAT database via API and processed for European coverage. The data is structured in tabular format with columns such as country code, year, indicator value, sex classification (total, male, female), disability status classification, along with source, quality flags, and notes. It is suitable for tabular classification, regression, and time-series forecasting tasks, designed to provide machine learning-ready data for studying European labor markets, income inequality, and disability inclusion.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-dsb-nb-average-monthly-earnings-of-employees-by-sex-and-d 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接抽取标识符为EAR_EMTA_SEX_DSB_NB的指标数据,并依据欧洲ISO3国家代码进行过滤整合。数据经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行 harmonised 处理,原始调查微观数据来自劳动力调查、家庭收入调查及行政记录等多种来源,并在source.label列中加以标注追踪。整份数据以Parquet格式封装,由Electric Sheep Europe团队重新打包,确保机器学习就绪。
特点
数据集涵盖32个欧洲国家从2004年至2025年间的5,363条观测记录,聚焦于员工按月平均薪资在性别与残疾状态维度上的细分情况。核心特色在于其多维度拆解能力,提供性别(总、男、女)及残疾状态等分类变量,且每个观测值均附有数据质量标志及来源注释。数据频率为年频,ILO从多个来源中自动选取每个国家-年份组合的“最佳来源”以保证数据质量,列结构清晰,便于时间序列与面板数据分析。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,返回的格式为pandas DataFrame,便于后续分析。典型用法包括按国家代码过滤子集、对单一指标进行时间序列可视化,以及利用透视表构建国家×年份的矩阵。数据集中包含int64类型的年份列和float64类型的观测值列,支持直接进行回归、分类或时间序列预测建模。API调用示例明确,研究人员可在数秒内完成数据加载与初步探索。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,其统计数据库ILOSTAT作为全球劳动统计的权威来源,致力于整合各国劳动力调查数据。数据集聚焦于欧洲32个国家2004至2025年间按性别和残疾状况划分的员工平均月收入(以当地货币计),包含5363条观测记录,覆盖了欧洲多样化的劳动力市场结构。这一数据集的创建为劳动经济学、社会政策评估以及可持续发展目标(SDG)中体面工作指标的监测提供了关键实证基础,尤其有助于揭示残疾人群体的薪酬不平等问题。通过Electric Sheep Europe的二次封装,数据以标准化格式呈现,降低了研究者的使用门槛,推动了跨国家、跨时段的劳动收入比较研究。
当前挑战
该数据集面临的核心挑战包括:其一,所解决的领域问题——劳动收入与残疾状况的交叉分析——长期受限于细粒度数据的匮乏,多数统计体系未系统收集按残疾状态分层的薪酬信息,导致政策制定者难以精确评估就业包容性政策的实际效果。其二,构建过程中的障碍:不同欧洲国家对‘残疾’的定义差异显著,ILOSTAT需通过注释字段(如note_classif.label)标注非标准定义,但数据可比性仍受削弱;数据来源多元(劳动力调查、行政记录等),部分观测被标记为‘不可靠’(obs_status为U),需用户自行筛选;此外,数据仅提供年度频率,缺失季度或月度波动信息,限制了时序分析中短期冲击的识别能力。
常用场景
经典使用场景
该数据集收录了2004年至2025年间欧洲32个国家的员工月均收入数据,并按照性别与残疾状态进行精细划分,为劳动经济学与收入分配研究提供了至关重要的面板数据。其最经典的应用场景在于构建多元回归模型,探究性别、残疾状态对员工收入水平的独立效应与交互影响,同时控制国家与年度固定效应,从而剥离出劳动力市场中歧视性或结构性因素的真实作用。研究者亦可利用时间序列分析法,描绘不同社会群体在近二十年间收入演变的长周期趋势。
衍生相关工作
围绕该数据集已衍生出一系列重要的学术与实践工作。研究者基于其面板结构开发了收入不平等分解模型,将总体差距拆解为解释性组成(如教育、职业隔离)与非解释性组成(即市场歧视成分)。此外,利用该数据训练的机器学习模型可预测不同特征群体的收入轨迹,为劳动经济学中的因果推断与反事实分析提供了数据支撑。在开放数据生态中,该数据集还被整合进区域性劳动市场知识图谱,服务于更广泛的就业质量与包容性增长研究。
数据集最近研究
最新研究方向
当前,基于ILOSTAT数据的europe-ilo-ear-emta-sex-dsb-nb-average-monthly-earnings-of-employees-by-sex-and-d数据集在劳动经济学与残障包容性政策评估领域展现出重要价值。随着欧盟《2030年残障平等战略》的深入推进,该数据集对视障、听障及肢体障碍等不同残障状态下雇员按月平均收入的性别差异提供了高精度时序观测,覆盖2004至2025年间32个欧洲国家的5363条记录。前沿研究正借助这一资源,运用面板数据回归与时间序列分解方法,量化残障群体在劳动力市场中的工资溢价或惩罚现象,并评估各国反歧视法案与就业配额制对薪酬差距的调控效果。特别地,通过性别与残障状态的交叉分类,学者能够洞察在强调社会公正与包容性增长的宏观背景下,残障女性面临的“双重劣势”是否在减缓,为欧盟及各国调整最低工资标准、完善社会保障体系提供了关键实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务