遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-ind-nb-average-monthly-earnings-of-employees-by-ilo-secto

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲7个国家(葡萄牙、法国、瑞士、英国、意大利、波黑、希腊)在2008年至2025年期间的6,519个观测值,核心指标为按ILO部门和性别划分的员工月平均收入(本地货币)。数据源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤至欧洲国家,涵盖国家代码、来源、指标、性别分类、年份、观测值及状态等字段。数据集适用于表格分类、回归和时间序列预测任务,以英语提供,采用CC-BY-4.0许可。

This dataset contains 6,519 observations from 7 European countries (Portugal, France, Switzerland, United Kingdom, Italy, Bosnia and Herzegovina, Greece) spanning 2008 to 2025, with the core indicator being Average monthly earnings of employees by ILO sector and sex (local currency). Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to European countries, covering fields such as country code, source, indicator, sex classification, year, observed value, and status. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, provided in English under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-ind-nb-average-monthly-earnings-of-employees-by-ilo-secto 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲地区雇员按ILO行业与性别划分的月均收入指标。数据通过调用ILOSTAT REST API直接获取,并筛选出欧洲ISO3国家代码对应的观测值。ILO团队依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行统一协调,来源信息在`source.label`列中予以标注,确保了数据的可追溯性与标准化程度。最终数据集包含6,519条记录,覆盖7个欧洲国家,时间跨度为2008年至2025年。
特点
数据集的核心特点在于其多维度的可拆分性:按性别(总、男、女)及ILO行业分类进行细分,为用户提供了精细化的分析粒度。所有收入指标均以当地货币计价,并附有数据质量状态标志(如`obs_status`),便于用户甄别不可靠观测值。此外,数据集整合了来自不同国家劳动力调查、企业调查等多元来源的年度数据,ILO自动选用每个国家-年份组合下的“最佳来源”,在保证覆盖广泛的同时维持了数据的一致性。
使用方法
用户可通过HuggingFace Datasets库`load_dataset()`函数一键加载数据,并转换为Pandas DataFrame进行后续分析。典型使用范例包括:按`ref_area`字段过滤特定国家的时间序列;以`indicator`列筛选唯一指标后,利用`time`与`obs_value`绘制折线图;或通过`pivot_table`将数据重塑为国家×年份矩阵,便于横向比较不同国家同一时期的收入水平差异。该设计充分适配了时序预测、面板数据回归及分类模型构建等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT编制,并由Electric Sheep Europe于2025年重新打包发布,聚焦于欧洲七国(2008–2025年)按ILO行业和性别划分的雇员平均月薪(本地货币),共包含6,519条观测。ILOSTAT作为全球劳动统计的权威来源,整合了各国劳动力调查、行政记录等多源数据,遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集的核心研究问题在于揭示欧洲劳动力市场中薪资的行业与性别差异,为劳动经济学、社会政策分析及跨国比较研究提供了微观数据基础,对推动体面劳动目标(SDG 8)的量化评估具有重要影响力。
当前挑战
数据集所解决的领域问题核心在于劳动经济学中薪资不平等的量化度量,尤其是跨行业与性别的系统性差异分析。然而,构建过程中面临多重挑战:首先,数据整合需克服各国调查方法、货币单位及时序差异(如2008–2025年跨度),ILOSTAT虽采用统一指标定义,但原始数据来源的异质性(如劳动力调查与行政记录)可能引入抽样误差;其次,数据标注中观测状态存在“不可靠”(U)等标志,反映了部分国家数据质量参差不齐;此外,地理覆盖仅限七国,其中意大利和希腊数据仅至2020年,限制了长时序比较的完整性,且分类维度匮乏(仅性别与ILO行业),无法深入控制教育、职业等混杂因素,增加了分析中的内生性偏误风险。
常用场景
经典使用场景
该数据集收录了7个欧洲国家2008至2025年间按国际劳工组织行业和性别划分的雇员平均月收入数据(以当地货币计价),共计6519条观测记录。研究者可借助这一结构化表格轻松开展国家间收入水平的横向比较与时间维度的纵向分析,例如绘制特定行业或性别的收入时序曲线,或构建国家与年份的交叉透视矩阵,从而洞察欧洲劳动力市场中薪资演变的宏观趋势与结构性差异。
解决学术问题
该数据集为劳动经济学与社会科学领域的学者提供了高质量、标准化的面板数据,助力破解欧洲薪资不平等、性别收入差距以及行业间薪酬分化等经典学术议题。通过对同一指标在不同性别和行业维度上的精细分层,研究者能够量化分析劳动力市场中的歧视现象与资源配置效率,其研究成果可为国际劳工组织及各国政策制定者优化劳动法规、推动体面工作议程提供扎实的实证依据,具有深远的学术与社会意义。
衍生相关工作
基于该数据集,学者们已开发出多种经典衍生工作,包括利用时间序列模型(如ARIMA、Prophet)预测未来薪资走势,运用面板回归方法识别性别收入差距的驱动因子,以及通过聚类算法对欧洲国家进行劳动力市场类型学划分。此外,该数据被集成至Electric Sheep Europe构建的ML就绪数据湖中,作为训练薪资预测神经网络的标准化输入特征,显著降低了劳动力领域机器学习研究的重复数据清洗成本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务