遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-nb-average-monthly-earnings-of-employees-by-sex-local

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲36个国家从1991年至2025年的2,043个观察值,专注于“按性别划分的员工月平均收入(本地货币)”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家。数据集提供了详细的表格结构,包括国家代码、国家名称、数据来源、指标代码、指标名称、性别细分(总计、男性、女性)、观察年份、观察值、观察状态和相关注释等字段。数据以年度频率发布,并经过ILO的标准化处理,确保与国际劳工统计会议定义一致。数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为研究者和开发者提供机器学习就绪的欧洲劳动力市场数据。

This dataset contains 2,043 observations of Average monthly earnings of employees by sex (local currency) across 36 Europe countries, spanning from 1991 to 2025, with 1 distinct indicator. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to European countries. It provides a detailed tabular schema including columns such as country code, country name, data source, indicator code, indicator name, sex disaggregation (total, male, female), observation year, observed value, observation status, and related notes. The data is published at annual frequency and harmonized by ILO based on International Conference of Labour Statisticians definitions. It is suitable for tasks like tabular classification, tabular regression, and time-series forecasting, designed to offer ML-ready labor market data for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-nb-average-monthly-earnings-of-employees-by-sex-local 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接获取指标EAR_EMTA_SEX_NB(按性别划分的员工平均月收入,本地货币)的原始数据,并依据欧洲ISO3国家代码进行地理筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源在source.label字段中明确标注以确保可追溯性。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于机器学习应用,共收录2,043条观测值,覆盖36个欧洲国家,时间跨度为1991年至2025年。
特点
该数据集的核心特征在于其专注于单一关键劳动经济指标——员工平均月收入,并按性别进行细粒度分解,包含总、男、女三个类别,支持性别差异分析。数据结构规范,提供ISO国家代码、观测值、观测状态及详细来源注释等字段,便于用户追溯数据质量。此外,数据集具备时间序列特性,覆盖长达35年的年度数据,适合进行跨时空的趋势比较与面板数据分析。值得注意的是,当同一国家与年份存在多个数据来源时,数据集采用ILO筛选的“最佳来源”,确保数据权威性。
使用方法
用户可通过HuggingFace的datasets库轻松加载该数据集,使用load_dataset函数即可获取训练集格式的数据,并转换为pandas DataFrame进行灵活操作。典型用法包括:按国家代码过滤特定国家的数据,例如德国(DEU);按时间字段排序并可视化单一指标的时间序列趋势;或通过透视表构建国家×年份的矩阵,便于进行横向比较与计量分析。数据集中包含了sex等分类维度,用户可利用这些字段进行分组统计与回归建模,特别适用于性别收入差距与劳动力市场动态研究。
背景与挑战
背景概述
在劳动经济学与社会科学研究领域,性别收入差距一直是衡量社会公平与经济发展质量的核心议题。由国际劳工组织(ILO)统计部门维护的ILOSTAT数据库,是当今全球劳动统计领域最权威的数据源之一,其整合了来自200多个经济体的劳动力调查、家庭收支调查及行政记录数据。2025年,Electric Sheep Europe团队基于ILOSTAT的REST API,系统性地提取并重构了欧洲36个国家自1991年至2025年间按性别分列的雇员平均月收入数据(本地货币计值),形成了本数据集。该数据集共包含2043条观测记录,覆盖了欧盟及欧洲经济区的广泛地理范围,为研究欧洲内部性别工资差异的时空演变、政策干预效果评估以及跨国比较分析提供了标准化、机器可读的高质量基础资源。
当前挑战
当前,围绕该数据集的研究与实践面临多重挑战。首先,从所解决的领域问题来看,劳动收入数据通常来自不同国家的调查体系与行政记录源,各国在调查设计、指标定义、货币单位及时间频率上存在显著异质性,这为跨国的性别工资差距比较带来了方法论上的困难。其次,在数据集构建过程中,ILOSTAT本身需要对原始调查微观数据进行国际劳工统计学家会议(ICLS)定义的统一化处理,但数据中仍存在因统计口径调整或调查更替导致的序列中断(如obs_status字段标记的'Break in series'),这对时间序列分析的连续性构成了制约。此外,部分国家的年度数据频次与可能存在的月度或季度高频数据未纳入当前版本,限制了更细粒度波动分析的可能性,多元数据源的溯源与最佳来源选择机制也增加了数据质量评估的复杂性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中欧洲36个国家自1991年至2025年间按性别划分的雇员平均月薪数据(以当地货币计),共计2043条观测记录。作为结构化面板数据,其最经典的用法是服务于跨国家、跨时间的薪酬差异分析,研究者可借此构建时间序列模型,追踪特定国家内男性与女性薪资的长期演变轨迹;亦可利用其国家与年份的交叉维度,通过面板数据回归分析探讨性别工资差距的宏观决定因素,如经济发展水平、劳动政策变迁与产业结构调整如何交互影响薪酬平等。
衍生相关工作
围绕该数据集衍生了一系列具有影响力的学术与实务工作。在计量方法层面,研究者利用其面板结构开发了针对性别工资差距的动态分解模型,将不可观测的异质性与选择偏差纳入分析框架。在主题拓展上,部分工作将该数据集与欧洲其他劳动力市场指标(如行业构成、兼职比例、教育程度)进行融合,构建了多维度的薪酬公平指数。数据工程领域则出现了基于该数据集的标准化特征工程流水线,以及用于预测各国性别工资差距演进趋势的时序预测模型,使得数据驱动的决策支持更加系统化与可复现。
数据集最近研究
最新研究方向
在性别薪酬差距与劳动力市场不平等这一全球性议题中,该数据集提供了1991年至2025年间覆盖36个欧洲国家的雇员月均收入分性别统计,为时序预测与面板数据分析提供了标准化基础。当前前沿研究聚焦于利用机器学习和计量模型,结合欧盟同工同酬指令及国际劳工组织体面劳动议程,探究疫情后经济复苏中的性别收入韧性、行业隔离与政策干预效果。该数据与ILOSTAT其他劳动指标联动,可揭示隐性工资歧视的时空演化,其高时间分辨率与国家覆盖度有力支撑了跨国比较与SDG目标8(体面工作)的监测,尤其为欧洲性别平等指数与欧盟委员会薪酬透明度法案的实证评估提供了可信基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务