遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-mts-nb-median-monthly-earnings-of-employees-by-sex-and-ma

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别和婚姻状况划分的员工月收入中位数(本地货币)| 欧洲(ILOSTAT)”,包含16,986个观察值,覆盖33个欧洲国家,时间跨度为1991年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖一个独特指标:员工月收入中位数(按性别和婚姻状况划分,以本地货币计)。数据集以表格形式提供,包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、婚姻状况分类、年份、观察值、观察状态等列。数据经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Europe重新打包发布,遵循CC-BY-4.0许可协议。

This dataset is titled Median monthly earnings of employees by sex and marital status (local currency) | Europe (ILOSTAT) and contains 16,986 observations across 33 European countries, spanning from 1991 to 2025. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database and covers one distinct indicator: median monthly earnings of employees by sex and marital status in local currency. The dataset is provided in tabular format, including columns such as country code, country name, data source, indicator code, indicator name, sex classification, marital status classification, year, observed value, and observation status. The data has been harmonized by ILO and is suitable for tasks like tabular classification, regression, and time-series forecasting. It is repackaged by Electric Sheep Europe and released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-mts-nb-median-monthly-earnings-of-employees-by-sex-and-ma 数据集图片
构建方式
本数据集由Electric Sheep Europe团队基于国际劳工组织(ILO)的ILOSTAT数据库重新构建。数据通过ILOSTAT的REST API接口直接获取,筛选出欧洲33个国家的ISO3代码后形成。ILOSTAT数据来源于各国劳动力调查、家庭收入调查、企业调查及行政记录等官方统计资源,并经ILO统计部门基于国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理。最终汇聚为包含16,986条观测值的数据集,覆盖1991至2025年间的年度中位数月收入指标,并纳入性别与婚姻状况的细分维度,以保证数据的可追溯性与可比性。
特点
该数据集的核心特点在于其聚焦于欧洲地区雇员中位数月收入的性别与婚姻状况细分统计,涵盖33个欧洲国家,时间跨度长达35年。每条记录均包含观测值、状态标签及详细的数据来源注释,支持跨年份、跨国别的时间序列分析。数据以标准化表格形式呈现,包含国家代码、性别分类、婚姻状况分类等关键字段,便于进行纵向与横向比较。同时,数据集明确标注了数据质量说明,如年度频率、最佳来源选取规则及细分维度仅在相应指标发布时非空,确保了使用的透明性与可靠性。
使用方法
研究人员可通过HuggingFace的datasets库便捷加载本数据集,使用`load_dataset`函数即可获得可用于分析的pandas DataFrame。针对特定国家的查询,可通过筛选`ref_area`列实现;如需进行时间序列分析,则可按`indicator`和`time`字段排序后直接绘图。此外,支持将数据透视转换为以年份为行、国家为列的矩阵形式,便于进行面板数据分析。数据集遵循CC-BY-4.0许可协议,使用时需同时引用原始ILO数据源及Electric Sheep Europe的重新打包版本,以确保学术规范性。
背景与挑战
背景概述
本数据集由国际劳工组织(ILO)于2025年整理发布,并经由Electric Sheep Europe重新封装,聚焦于1991年至2025年间33个欧洲国家员工的性别与婚姻状况中位数月收入(以本币计)。该数据源自ILOSTAT——国际劳工组织核心统计数据库,作为全球劳动力统计的权威来源,其指标涵盖就业、失业、工资、工作时间等领域,并遵循国际劳工统计学家会议(ICLS)定义进行数据协调。数据集共计16,986条观测,覆盖瑞士、葡萄牙、比利时等国家,核心研究问题在于揭示性别与婚姻状况对劳动收入的影响,为劳动经济学、社会政策评估及性别平等研究提供了标准化的跨国时序数据,显著推动了关于劳动力市场不平等与结构性差异的实证分析。
当前挑战
该数据集面临的挑战体现在多维度:首先在领域问题层面,解决的是劳动力收入中隐性性别与婚姻歧视的量化难题。传统调查数据常因定义不统一、覆盖碎片化而难以比较,本数据集通过标准化指标(中位数而非均值)和跨时间维度,有效捕捉收入差距的演变趋势。构建过程中挑战显著,ILOSTAT需从各国劳动力调查、家户收入调查等异构来源整合数据,并处理指标定义差异、缺失值及多源冲突(如优先选择“最佳来源”)。同时,数据质量标注(如“不可靠”状态)和分类变量的空值处理(如sex、classif1仅在有细分时存在)进一步增加了清洗与对齐的复杂性,使得确保时间序列的连贯性与跨国可比性成为核心难点。
常用场景
经典使用场景
该数据集收录了1991年至2025年间欧洲33个国家的雇员月收入中位数数据,并按性别和婚姻状况进行了细致的分层。其最经典的使用场景在于劳动经济学领域中的收入差异分析,研究者可借此深入剖析不同性别与婚姻状态对劳动者薪酬水平的系统性影响,为揭示劳动力市场中存在的结构性不平等提供坚实的数据基础。
衍生相关工作
该数据集衍生的经典工作主要集中于建构动态面板数据模型与时空分析框架。基于ILOSTAT权威数据源,研究者发展出一系列指标来监测联合国可持续发展目标(SDGs)中关于体面劳动与经济增长的进展。同时,它激发了将机器学习方法应用于传统经济预测的研究,如利用时序模型(如ARIMA、Prophet)预测未来收入趋势,以及结合地理空间分析技术绘制欧洲薪酬不平等地图,为跨学科融合提供了典范。
数据集最近研究
最新研究方向
聚焦于欧洲劳动力市场中的性别收入差异与婚姻状况交叉分析,该数据集基于国际劳工组织(ILO)权威数据库ILOSTAT,涵盖1991至2025年间33个欧洲国家的雇员月收入中位数,按性别与婚姻状态进行细分。在性别平等与可持续发展目标(SDG)议题备受关注的当下,数据集为研究婚姻对职业收入的调节效应、性别工资鸿沟的演化轨迹提供了精细化的时序面板数据。其价值在于支持政策制定者追溯近三十年欧洲各国在消除收入不平等方面的实际进展,并推动利用机器学习方法对收入结构进行归因分析,从而揭示社会经济结构变革与人口特征互动下的深层规律。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务