遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-mts-cur-nb-median-monthly-earnings-of-employees-by-sex-marita

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了欧洲33个国家从1991年至2025年间的17,853条收入观测数据,涵盖1个具体指标:按性别、婚姻状况和货币划分的员工月收入中位数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过筛选仅包含欧洲国家。数据集提供了结构化表格,包含国家代码、国家名称、数据来源、指标代码、指标名称、性别细分、婚姻状况分类、货币类型、观测年份、观测值、观测状态及相关注释等列。数据以年频率发布,经过ILO的标准化处理,确保符合国际劳工统计学家会议(ICLS)的定义。该数据集适用于表格分类、表格回归和时间序列预测等机器学习任务,可用于分析欧洲各国收入趋势、性别差异等社会经济研究。

This dataset contains 17,853 observations of Earnings data across 33 Europe countries, spanning 1991–2025, covering 1 distinct indicators: Median monthly earnings of employees by sex, marital status and currency. It is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API and filtered to European countries. The dataset is structured in tabular format with columns including country code, country name, data source, indicator code, indicator name, sex disaggregation, marital status classification, currency type, observation year, observed value, observation status, and related notes. Data is published at annual frequency and harmonized by ILO following International Conference of Labour Statisticians (ICLS) definitions. It is suitable for machine learning tasks such as tabular classification, tabular regression, and time-series forecasting, and can be used for socio-economic research on income trends and gender disparities across Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-mts-cur-nb-median-monthly-earnings-of-employees-by-sex-marita 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,经由Electric Sheep Europe团队精心重组与封装。构建过程中,数据通过ILOSTAT REST API直接抓取,并针对欧洲33个国家的ISO3国家代码进行严格筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,确保跨国数据的一致性与可比性。数据集涵盖了1991年至2025年间共17,853条观测记录,聚焦于员工按性别、婚姻状况及货币分类的月收入中位数这一核心指标。原始数据来源包括劳动力调查、家庭收入调查及行政记录等,并已在`source.label`列中明确标注以保障可追溯性。
特点
该数据集最显著的特点在于其精细的多维分类结构与丰富的时空覆盖广度。其核心指标`EAR_EMTM_SEX_MTS_CUR_NB`同时提供了按性别(总、男、女)和婚姻状态(合计)的细分维度,为深入分析劳动市场中不同群体的收入差异提供了坚实基础。数据集覆盖了33个欧洲国家、长达35年的时间序列,且观测值超过1.7万条,具有极高的统计严谨性与地域代表性。此外,数据还包含了货币类型(如本币)的分类变量,并附有数据质量状态标记(如不可靠值提示),充分体现了ILOSTAT在数据协调中的专业水准,为研究者进行跨国动态比较分析创造了理想条件。
使用方法
该数据集已集成至HuggingFace Datasets库,用户可通过一行代码`load_dataset()`轻松加载,并将其转换为Pandas DataFrame进行后续分析。典型的使用流程包括:针对单一国家(如德国)进行子集筛选以观察其时间序列趋势;对核心指标进行时序排序与可视化,直观展现收入变化规律;亦可通过透视表将数据重构为国家×年份的矩阵形式,便于横向比较与面板数据分析。数据集结构清晰,包含`ref_area`、`time`、`obs_value`及多个分类列,支持灵活的过滤与聚合操作。建议用户在分析时注意数据质量状态标志(如`obs_status`列),并引用原始ILO数据源以遵循CC-BY-4.0许可协议。
背景与挑战
背景概述
在劳动经济学与社会政策研究领域,薪资结构的性别与婚姻状况差异一直是核心议题。国际劳工组织(ILO)作为全球劳动统计的权威机构,通过其ILOSTAT数据库长期系统性地收集与整合各国劳动力调查数据。该数据集由Electric Sheep Europe于2025年重新打包发布,聚焦于欧洲33国1991年至2025年间雇员月收入中位数,并按性别与婚姻状况进行细分。数据集共包含17,853条观测,涵盖了从北欧福利国家到南欧经济体在内的广泛地域,为跨国家、跨时期的性别薪酬差距与婚姻溢价研究提供了宝贵的标准化数据基础,显著推动了劳动市场中结构性不平等问题的实证分析。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题与构建过程的双重复杂性。领域层面上,薪资的性别与婚姻差异深受各国劳动法、福利制度、行业结构与文化观念的影响,单一指标难以全面捕捉这些多元社会建构因素,容易导致因果推断的偏误。构建过程中,挑战则体现为数据的异质性问题:各国数据来源存在差异(如劳动力调查与行政记录),且ILOSTAT虽采用统一指标框架,但各国统计方法、分类标准及数据质量标记(如观测状态中的“不可靠”标识)仍需谨慎处理。此外,婚姻状况分类的跨文化可比性不强,部分国家数据稀疏,这些都给时序分析与跨国比较带来了显著的技术挑战。
常用场景
经典使用场景
该数据集汇集了1991至2025年间33个欧洲国家按性别和婚姻状况分列的雇员月收入中位数,共计17,853条观测记录。在劳动经济学与社会科学领域,它常被用于构建面板数据模型,以纵向追踪欧洲各国薪资结构的演变趋势。研究者可基于时间序列分析,揭示性别收入差距随婚姻状态变化的动态特征,或结合宏观经济指标,探究劳动力市场制度、社会福利政策对收入分配的影响机制。其标准的ILOSTAT架构与多维度分类变量,为跨国家比较研究提供了坚实的数据基础。
解决学术问题
该数据集有效回应了劳动经济学中若干核心学术议题,例如性别收入差距的异质性成因、婚姻溢价或惩罚的跨国差异,以及货币单位转换对比较研究带来的挑战。通过同时提供按性别和婚姻状态划分的收入中位数,研究者能够剥离单一维度的混淆效应,更为精准地估计婚姻状况对男女收入的差异化影响。此外,覆盖三十余国长达三十余年的观测周期,使得评估欧盟一体化进程、经济危机或政策改革对劳动力市场公平性的长期效应成为可能,推动了包容性增长与体面劳动相关理论的实证检验。
衍生相关工作
围绕该数据集衍生了一系列具有影响力的研究工作。部分学者以其为核心训练时间序列预测模型,尝试对未观测年份或国家的收入中位数进行插值与外推。另有研究将其与ILOSTAT其他指标(如失业率、劳动参与率)关联,构建综合性的欧洲劳动力市场动态模型。在数据科学领域,该数据集常作为教学范例,用于演示面板数据清洗、多索引透视表构建及分类变量编码转化等经典操作流程。其清晰的许可条款与可复现的API采集流程,也促进了开放科学在劳动统计领域的普及。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务