遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-geo-cur-nb-median-monthly-earnings-of-employees-by-sex-rural

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲31个国家从2000年至2025年的员工月收入中位数数据,涵盖性别(总计、男性、女性)、城乡地区和货币等维度。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家,包含15,306个观测值和1个主要指标(EAR_EMTM_SEX_GEO_CUR_NB)。数据集以表格形式组织,包括国家代码、年份、观测值、数据来源、分类变量等列,适用于表格分类、回归和时间序列预测等任务。数据经过ILO的统计部门协调,使用国际劳工统计学家会议(ICLS)定义进行标准化,并标注了数据来源和质量状态。

This dataset contains median monthly earnings data for employees across 31 European countries from 2000 to 2025, disaggregated by sex (total, male, female), rural/urban areas, and currency. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via REST API and filtered to European country codes, with 15,306 observations and one main indicator (EAR_EMTM_SEX_GEO_CUR_NB). It is organized in tabular format, including columns for country codes, year, observed values, data sources, classification variables, etc., suitable for tasks such as tabular classification, regression, and time-series forecasting. The data is harmonized by the ILOs Department of Statistics using International Conference of Labour Statisticians (ICLS) definitions, with source and quality status flags for traceability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-geo-cur-nb-median-monthly-earnings-of-employees-by-sex-rural 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接获取指标代码为EAR_EMTM_SEX_GEO_CUR_NB的原始数据,并依据欧洲ISO3国家代码进行地域过滤。数据经国际劳工统计学家会议(ICLS)定义标准进行协调统一,原始调查微观数据来自于各国劳动力调查、家庭收入调查及行政记录等多种来源,并在数据集的source.label列中标注溯源信息。最终整合为包含15,306条观测记录、覆盖31个欧洲国家、时间跨度从2000年至2025年的结构化面板数据。
特点
本数据集聚焦于雇员月收入中位数这一核心劳动经济指标,并特别引入性别与城乡区域两个关键维度进行精细分解。数据集不仅提供了sex、classif1、classif2等分类变量,还完整保留了观测状态标志与详细注释信息,便于用户评估数据质量与潜在结构性断裂。其最大优势在于高覆盖度与标准化格式,支持跨国、跨时间序列的比较分析,为研究欧洲劳动力市场中的性别收入差距与城乡经济分化提供了可靠的数据基础。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数一键加载数据,并利用`to_pandas()`方法快速转换为Pandas DataFrame进行后续分析。典型应用场景包括:按ref_area列筛选特定国家进行深入分析;对EAR_EMTM_SEX_GEO_CUR_NB指标按时序排序,绘制收入变化趋势图;或利用pivot_table函数构建以时间为行、国家为列的矩阵,便于进行跨国对比。数据集支持分类、回归及时间序列预测等多类机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年整理并发布,经Electric Sheep Europe团队重新封装后托管于HuggingFace平台。数据集聚焦于欧洲31个国家2000至2025年间按性别、城乡地域及货币分类的员工月收入中位数这一核心劳动经济指标,共包含15,306条观测记录。其数据源ILOSTAT是全球劳动统计领域的权威数据库,系统整合了来自各国劳动力调查、家庭收入调查和行政记录等多元渠道的微观数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集为研究欧洲劳动力市场中的性别收入差距、城乡经济分化以及跨国的工资结构演变提供了坚实的数据基础,在劳动经济学、社会政策评估及可持续发展目标(SDG)监测等领域具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于劳动收入统计中普遍存在的数据碎片化与口径不统一问题。ILOSTAT虽致力于数据协调,但各国收入调查在抽样框架、问卷设计、工资定义(如是否包含奖金与补贴)和统计频率上仍存在显著差异,直接影响跨国比较的精度。构建过程中,数据汇集面临多重障碍:各国原始数据因隐私法规与统计传统差异而难以标准化;时间序列中常因调查方法更新、货币换算或区域分类调整出现统计断点(如obs_status字段标记的“Break in series”);城乡地域划分标准不一(如classif1字段中GEO_COV_NAT与具体城市/农村编码的混合),增加了空间分析的复杂性。此外,数据质量标识(如provisional或unreliable状态)虽提供了元数据透明度,却也对下游模型在缺失值处理与异质性推断上提出了更高要求。
常用场景
经典使用场景
该数据集汇聚了欧洲31个国家2000至2025年间雇员月收入中位数的官方统计数据,按性别、城乡地域及货币维度进行精细划分,为劳动经济学与区域不平等研究提供了标准化的跨时空观测基础。其最经典的使用场景在于构建面板回归模型,用以量化性别工资差距的演变轨迹、评估城镇化进程对收入分布的影响,或追踪单一欧洲国家内部及其之间的收入收敛或发散趋势。此外,该数据集的年度颗粒度与一致的ILO统计口径,使其成为时间序列预测任务的理想选择,可运用ARIMA、Prophet等经典方法或基于Transformer的时序模型,对缺失年份或未来短期内的收入水平进行合理插值与推断。
衍生相关工作
该数据集直接衍生或滋养了一系列基于ILOSTAT官方统计的计量经济学与机器学习工作。经典工作中,研究者常将其与欧盟统计局(Eurostat)的劳动力调查数据进行融合,构建工资方程的Mincer模型变体,以估计教育回报率或工会化水平的跨国效应。在预测领域,已有研究将其作为基准数据集,对比不同神经网络架构(如LSTM、TCN)在低频宏观经济指标预测中的稳定性与泛化能力。此外,该数据集所蕴含的时空结构也催生了关于空间计量模型(如空间Durbin模型)的创新应用,用以刻画邻国收入水平的空间溢出效应。这些衍生工作不仅验证了ILOSTAT数据的学术价值,也进一步拓展了欧洲劳动市场研究的分析疆域。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲31国2000至2025年间按性别、城乡地域及货币划分的雇员月收入中位数,为劳动经济学与性别薪酬差异研究提供了关键的时间序列支撑。当前前沿方向集中于借助此数据剖析新冠疫情后欧洲劳动力市场的结构性变迁,尤其是远程办公普及对城乡收入差距的调节作用,以及欧盟《同工同酬指令》等政策框架下性别收入鸿沟的动态收敛态势。此外,结合ILOSTAT的官方统计衔接机制,该数据可驱动机器学习模型对非正规就业与区域经济韧性进行预测,为欧洲社会公平政策设计与可持续发展目标(SDG)的量化监测提供可靠的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务