遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-geo-nb-median-monthly-earnings-of-employees-by-sex-and-ru

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别和城乡地区划分的员工月收入中位数(本地货币)| 欧洲(ILOSTAT)”,包含来自国际劳工组织(ILO)ILOSTAT数据库的5,174个观测值,覆盖欧洲31个国家,时间跨度为2000年至2025年。数据主要指标为EAR_EMTM_SEX_GEO_NB,即按性别(总计、男性、女性)和城乡地区划分的员工月收入中位数,以本地货币计值。数据集由Electric Sheep Europe重新打包,旨在为欧洲提供统一、机器学习就绪的数据层,数据来源包括国家劳动力调查、家庭收入调查等,并经过ILO的统计部门协调处理。数据模式包括国家代码、年份、指标值、性别分类等列,适用于表格分类、回归和时间序列预测任务。

This dataset is titled Median monthly earnings of employees by sex and rural / urban areas (local currency) | Europe (ILOSTAT) and contains 5,174 observations from the ILOSTAT database of the International Labour Organization (ILO), covering 31 European countries from 2000 to 2025. The primary indicator is EAR_EMTM_SEX_GEO_NB, which represents the median monthly earnings of employees disaggregated by sex (total, male, female) and rural/urban areas, in local currency. Repackaged by Electric Sheep Europe, it aims to provide a unified, ML-ready data layer for Europe, with data sourced from national labour force surveys, household income surveys, and other administrative records, harmonized by ILOs Department of Statistics. The schema includes columns such as country code, year, indicator value, and sex classification, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-geo-nb-median-monthly-earnings-of-employees-by-sex-and-ru 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API直接获取原始指标数据,并依据欧洲ISO3国家代码进行区域过滤。ILOSTAT基于国际劳动统计学家会议(ICLS)定义,对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调与标准化处理。数据集由Electric Sheep Europe团队重新整理打包,以Parquet格式存储,确保机器学习的可直接加载性。总计包含5,174条观测记录,覆盖2000年至2025年间31个欧洲国家的月收入中位数信息。
特点
数据集聚焦于按性别和城乡区域划分的员工月收入中位数(本地货币计值),提供单一核心指标EAR_EMTM_SEX_GEO_NB的年度观测值。数据结构包含性别、地理覆盖类型等分类维度,以及观测状态、来源标注等元数据列,便于溯源与质量评估。每个观测值均附有详细标签,如国家名称、指标定义、数据来源与注释,支持细粒度的时间序列分析与横向比较。数据年度频率统一,且采用ILO选定的最佳来源处理多源冲突,确保一致性与可靠性。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,调用load_dataset函数即可获得训练集DataFrame。支持按国家代码筛选特定国家的子集,或针对单一指标进行时间序列排序与可视化。通过pivot_table操作,可轻松构建国家×年份的观测值矩阵,便于面板数据分析。数据集兼容表格分类、回归及时序预测等多种任务,适合运用在劳动经济学、社会政策评估与欧洲劳动力市场研究等领域,使用示例代码可快速完成数据探索与建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT创建,并由Electric Sheep Europe重新封装发布于HuggingFace平台。数据集聚焦于欧洲31个国家在2000至2025年间按性别和城乡区域划分的雇员月收入中位数(以当地货币计),共包含5,174条观测记录。作为劳动经济学与区域不平等研究的关键数据源,该数据集为分析欧洲内部性别工资差距、城乡收入分化以及劳动力市场结构性变迁提供了标准化、可跨国比较的实证基础。其影响力体现在对可持续发展目标(SDG)中体面工作与经济增长指标的量化支撑上,尤其是通过性别和地理维度的交叉分解,揭示了收入不平等在微观层面的动态演化模式。
当前挑战
该数据集所解决的领域核心挑战在于量化与追踪欧洲劳动力市场中的双重不平等维度:一是性别收入差距,二是城乡收入鸿沟。传统劳动统计数据常因方法论不统一而难以跨国比较,ILOSTAT通过采用国际劳工统计学家会议(ICLS)定义进行数据协调,克服了源数据异构性难题。构建过程中面临的主要挑战包括:多国调查数据在收集频率、代币转换(如欧元区与本国货币)和分类标准上的差异;数据质量标注(如序列断裂标记B)需要精细处理以避免时间序列分析偏差;以及从ILOSTAT REST API高频拉取数据时需确保分性别的城乡子样本在样本量和代表性上的平衡,避免小国或特定年份数据稀疏导致的估计偏误。
常用场景
经典使用场景
该数据集在劳动经济学与社会分层研究中被广泛用于分析欧洲各国雇员中位月收入的时空演变规律。通过融合性别与城乡地域双重分类维度,研究者可系统考察男性与女性在城镇、乡村及全国层面上的收入差异,并追踪2000年至2025年间31个欧洲国家的动态变化。典型应用包括构建面板数据模型以探究性别收入差距的收敛或扩大趋势,或利用时间序列方法识别金融危机、政策干预等宏观事件对劳动力市场报酬结构的冲击效应。
解决学术问题
数据集有效解决了欧洲跨国收入比较中数据碎片化与统计口径不一致的学术难题。长期以来,由于各国调查体系差异,跨国性别收入差距的研究常受限于可比性不足。通过ILOSTAT统一采用国际劳工统计学家会议(ICLS)定义进行数据协调,该资源使学者能够聚焦于收入不平等的结构性成因,如制度环境、产业结构与教育回报对性别收入分化的影响,从而为验证社会分层理论、探讨公共政策的分配效应提供了可靠的经验基础。
衍生相关工作
基于该数据集,衍生出一系列聚焦欧洲劳动力市场绩效的基准研究与建模工作。代表性方向包括:构建面向多维收入指标的分类与回归模型,利用西班牙、意大利等南欧国家数据训练预测算法,以推断政策变动下的收入变动;开发时序预测系统对中位月收入进行未来年份的推演,为财政预算与社保规划提供前瞻信息。此外,部分工作将数据与教育、人口普查等其他欧洲统计资源链接,形成多层级的劳动经济学知识图谱,深化对收入决定机制的系统性理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务