遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-dsb-nb-median-hourly-earnings-of-employees-by-sex-and-dis

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的统计数据,主题为欧洲国家按性别和残疾状况划分的员工小时收入中位数(以当地货币计)。数据集涵盖2个欧洲国家(英国和摩尔多瓦),时间跨度为2005年至2025年,共包含234个观测值。核心指标为EAR_EHRM_SEX_DSB_NB,即员工小时收入中位数,数据按年份、国家、性别(总计、男性、女性)和残疾状况等维度进行细分。数据通过ILOSTAT REST API获取,由Electric Sheep Europe重新打包为ML就绪格式,适用于表格分类、回归和时间序列预测等任务。数据集包含详细的元数据,如国家代码、数据来源、观测值、状态标志和注释,并遵循CC-BY-4.0许可。

This dataset contains statistical data from the International Labour Organization (ILO) ILOSTAT database on median hourly earnings of employees by sex and disability status (in local currency) for European countries. It covers 2 European countries (the United Kingdom and Moldova) from 2005 to 2025, with 234 observations. The core indicator is EAR_EHRM_SEX_DSB_NB, representing median hourly earnings, disaggregated by year, country, sex (total, male, female), and disability status. Data is sourced via the ILOSTAT REST API and repackaged by Electric Sheep Europe into an ML-ready format, suitable for tabular classification, regression, and time-series forecasting tasks. The dataset includes detailed metadata such as country codes, data sources, observed values, status flags, and notes, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-dsb-nb-median-hourly-earnings-of-employees-by-sex-and-dis 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接提取指标代码为EAR_EHRM_SEX_DSB_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。数据经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行标准化处理,以消除各国调查口径差异。数据集涵盖了2005年至2025年间英国和摩尔多瓦两个欧洲国家的234条观测记录,每条记录包含国家、来源、指标、性别、残疾状态、年份及观测值等结构化字段,并以Parquet格式封装,确保机器学习的便捷加载与高效处理。
特点
本数据集的核心特点在于其精细的维度划分与权威性。它聚焦于雇员按性别和残疾状态划分的每小时收入中位数(以本地货币计),提供了性别(总、男、女)和残疾状态(总计)两个重要分解维度,使研究者能够深入分析劳动力市场中的薪酬差异与包容性。数据来自ILO选定的“最佳来源”,如劳动力调查,并带有观测状态标志以区分临时值或序列中断情况,增强了数据的透明度。此外,数据集覆盖面虽限于两个欧洲国家,但时间跨度长达21年,为纵向趋势分析提供了宝贵资源。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集,只需一行命令`load_dataset("electricsheepeurope/europe-ilo-ear-ehrm-sex-dsb-nb-median-hourly-earnings-of-employees-by-sex-and-dis")`即可获取训练集。加载后,数据可转换为Pandas DataFrame以便进行过滤、聚合与可视化操作。例如,可筛选特定国家或性别进行时间序列分析,也可通过数据透视表构建国家×年份的矩阵,用于面板数据回归或趋势对比。数据集结构清晰,包含`ref_area`、`sex`、`time`和`obs_value`等关键列,适用于表格分类、回归以及时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台。ILOSTAT作为全球劳动统计领域的权威数据源,系统整合了200余个经济体的劳动力调查、家庭收入调查及行政记录数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。本数据集聚焦于欧洲地区,涵盖英国和摩尔多瓦两个国家2005至2025年间按性别和残疾状况分类的雇员小时收入中位数(本地货币),共计234条观测值。该数据为研究欧洲劳动力市场的收入不平等、性别薪酬差异及残疾群体就业质量提供了时间序列上的精细化视角,尤其对推动联合国可持续发展目标中体面工作议题的实证分析具有重要价值,补足了以往区域级微观薪酬数据在交叉维度上的稀缺性。
当前挑战
该数据集所应对的核心领域挑战在于,传统劳动统计框架往往缺乏按残疾状况与性别双重维度交叉细分的薪酬指标,导致政策制定者难以精准识别弱势群体在劳动力市场中的经济排斥程度。从构建层面看,数据收集面临多重困难:首先,不同国家在残疾认定标准、调查工具和薪酬定义上存在显著异质性,ILO虽借助ICLS定义进行协调,但来源字段(如'BA:666')仍暴露出原始调查差异;其次,时间序列的非连续性(如英国数据覆盖2005-2025,摩尔多瓦仅始于2018年)与观测状态标识(如'B'表示序列中断)对纵向分析构成干扰;最后,数据仅涵盖两个欧洲国家,样本量有限,且缺失月度和季度高频观测,限制了跨地区与跨时序的泛化能力。
常用场景
经典使用场景
该数据集聚焦于欧洲地区按性别和残疾状况分层的雇员中位数小时收入,涵盖英国与摩尔多瓦两国、2005至2025年的年度观测数据。其经典使用场景在于刻画劳动力市场中弱势群体的薪酬差异,研究者可借此构建跨国面板数据,分析残疾状态与性别交互作用对收入分配的长期影响。凭借ILOSTAT标准化定义与来源清晰的元数据,该数据集成为劳动经济学中探究收入不平等、就业歧视以及社会保障政策效果的可靠基石。
衍生相关工作
该数据集衍生出多项经典相关工作。基于ILOSTAT的标准化指标,研究者开发了跨国收入差距分解框架,结合性别的差分再分解方法广泛应用于分析残疾收入惩罚。在方法学上,该数据推动了非平衡面板数据填补技术的优化,如多重插补与因果森林在劳动统计中的应用。此外,该数据集常被纳入更广泛的欧洲社会统计集成项目,与教育与职业分类数据关联,为构建多维度劳动力市场不平等预测模型提供了基准测试集。
数据集最近研究
最新研究方向
在劳动经济学与包容性就业的前沿交叉领域,该数据集聚焦于欧洲国家按性别与残疾状态划分的雇员中位数时薪,为探究劳动力市场中多重弱势群体的薪酬平等问题提供了稀缺的纵向证据。当前研究热点之一是利用此类跨年度、跨国家的微观数据,结合时间序列分析与面板回归模型,量化残疾状态与性别对薪资水平的交互效应,并评估《联合国残疾人权利公约》等政策框架在欧洲劳动力市场的实际影响。该数据集的发布填补了ILOSTAT统计体系中残疾细分与工资动态的衔接空白,尤其是在英国与摩尔多瓦长达二十年的覆盖期内,研究者可藉此揭示金融危机、疫情冲击及制度变迁如何重塑不同群体的薪酬结构,其意义在于推动从单一性别平等向交叉性薪酬正义的实证范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务