遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-cct-cur-nb-average-monthly-earnings-of-employees-by-sex-citiz

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲15个国家(如瑞士、葡萄牙、法国等)从1991年至2025年的员工月平均收入数据,按性别、公民身份和货币进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖4,092个观测值,核心指标为EAR_EMTA_SEX_CCT_CUR_NB。数据集提供了详细的模式信息,包括国家代码、指标标签、性别分类、观测值和数据质量说明等,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并经过ILO的标准化处理,确保与ICLS定义一致。

This dataset encompasses monthly average employee earnings data spanning 1991 to 2025 for 15 European countries (e.g., Switzerland, Portugal, France, and others), disaggregated by gender, citizenship status, and currency. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), contains a total of 4,092 observations, and its core indicator is EAR_EMTA_SEX_CCT_CUR_NB. The dataset provides comprehensive metadata including country codes, indicator labels, gender classifications, observations, and data quality descriptions, and is suitable for tasks such as tabular classification, regression, and time series forecasting. The data is released annually and has been standardized by the ILO to ensure alignment with the ICLS definition.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-cct-cur-nb-average-monthly-earnings-of-employees-by-sex-citiz 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Europe重新封装后发布至HuggingFace平台。数据通过ILOSTAT REST API接口直接获取,原始指标编码为EAR_EMTA_SEX_CCT_CUR_NB,代表按性别、国籍和货币划分的雇员平均月收入。在获取过程中,研究人员对数据进行了欧洲范围的筛选,仅保留ISO3国家代码属于欧洲区域的观测值。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,并在source.label列中标注了数据来源,确保每一条记录均可追溯至原始劳工调查或行政登记系统。最终数据集包含4,092条观测,覆盖15个欧洲国家,时间跨度为1991年至2025年。
特点
该数据集的核心特点在于其精细的多维度分解结构,包含性别(男性、女性、总计)、国籍(本国公民、外国公民等)以及货币类型(本币)三个关键分类变量,使得研究人员能够深入分析不同社会群体在劳动力市场中的收入差异。数据以年频形式呈现,所有观测均对应同一标准化指标,确保了跨国家和跨时间维度的可比性。此外,数据集提供了丰富的元数据列,如观测状态标志(obs_status)用于标记数据的可靠性(如临时性、不可靠等),以及注释列(note_indicator、note_source)记录数据生产机构与涵盖范围等背景信息,为数据质量评估提供了透明依据。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,返回的格式可直接转换为pandas DataFrame进行后续分析。对于时间序列研究,可依据indicator列筛选特定指标,再按time列排序后绘制观测值变化趋势。若要构建国家间的面板数据,可借助pivot_table方法将数据重塑为国家×年份的矩阵形式。对于聚焦特定国家的研究,可通过ref_area列直接过滤所需国家代码。数据集中所有分类维度(如sex、classif1、classif2)均为标准化编码,配合对应的label列可快速理解各维度含义,便于进行分组聚合与统计建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,经Electric Sheep Europe重新封装后以HuggingFace数据集形式呈现。研究聚焦于欧洲15个国家1991至2025年间按性别、国籍及货币分组的员工月均收入变化,核心问题在于揭示劳动力市场中收入分配的性别与国籍差异。依托ILO对200多个经济体劳动力调查数据的标准化整合,该数据集为跨国比较和时序分析提供了规范化的微观数据基础,对劳动经济学、社会政策及可持续发展目标(SDG)中体面工作的量化研究具有重要支撑价值。
当前挑战
领域问题层面,该数据集试图解决劳动经济学中收入多维异质性难以统一量化的挑战,即如何将性别、国籍及货币因素纳入同一分析框架以揭示结构性不平等的动态演变。构建过程中则面临多重困难:来自15国的原始调查数据在调查口径、货币换算及时间频率上存在显著差异,ILO虽采用ICLS定义进行标准化,但观测状态标记(如“不可靠”)仍暴露了数据一致性的局限;同时,部分分类维度(如sex、classif1)的缺失值限制了细分分析的完整性,且年度数据频率掩盖了月度或季度的短期波动细节。
常用场景
经典使用场景
该数据集汇集了1991年至2025年间15个欧洲国家雇员平均月收入的观测数据,按性别与公民身份进行精细划分,并涵盖本币与外币两种计价单位。在劳动经济学与人口迁移研究中,研究者常利用这些面板数据构建收入决定模型,分析性别工资差距的跨国异质性,或评估公民身份对劳动力市场回报的影响。通过时间序列或回归分析,可揭示欧元区内外劳动者薪酬的动态演变规律,为理解欧洲一体化进程中劳动力流动的经济效应提供实证基础。
解决学术问题
学术界长期关注移民收入融合、性别平等与劳动力市场歧视等议题,但缺少跨国家、跨时段的标准化微观汇总数据。该数据集填补了这一空白,使研究者能够系统检验移民—本地人收入差距的收敛假说,分离出性别与公民身份的交互效应,并控制国家固定效应与时间趋势。其对ILO统一统计口径的遵循,确保了跨国比较的有效性,从而为政策评估与理论建模(如人力资本回报率、劳动市场分割理论)提供了可靠的数据支撑。
衍生相关工作
基于该数据集,已有研究衍生出若干经典工作:一是性别工资差距的分解分析,通过Oaxaca-Blinder方法量化歧视与禀赋差异的贡献;二是移民收入同化曲线估计,揭示移民在接收国收入随居留时间变化的非线性模式;三是构建欧洲劳动市场面板数据库,作为后续机器学习预测模型(如梯度提升机预测收入不平等趋势)的训练集。此外,该数据与ILO其他指标(如失业率、劳动参与率)的联合分析,推动了跨国劳动经济学综合研究框架的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务