遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-dsb-cur-nb-median-hourly-earnings-of-employees-by-sex-and-dis

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲国家按性别和残疾状况及货币划分的员工每小时收入中位数的观测数据,由国际劳工组织(ILO)的ILOSTAT数据库提供,并由Electric Sheep Europe重新打包。数据集共有684个观测值,覆盖2个欧洲国家(英国和摩尔多瓦),时间跨度为2005年至2025年,涉及1个核心指标:EAR_EHRM_SEX_DSB_CUR_NB(按性别和残疾状况及货币划分的员工每小时收入中位数)。数据以表格形式存储,包含国家代码、年份、指标值、性别细分、残疾状况分类、货币类型、数据来源和质量标志等列。数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为研究人员和开发者提供欧洲劳动力市场的标准化、ML-ready数据。数据频率为年度,使用CC-BY-4.0许可证发布。

This dataset contains observations of median hourly earnings of employees by sex and disability status and currency for European countries, sourced from the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Europe. It includes 684 observations across 2 European countries (United Kingdom and Moldova), spanning the years 2005 to 2025, with 1 distinct indicator: EAR_EHRM_SEX_DSB_CUR_NB (Median hourly earnings of employees by sex and disability status and currency). The data is in tabular format, featuring columns such as country code, year, indicator value, sex disaggregation, disability status classification, currency type, data source, and quality flags. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, providing a standardized, ML-ready data layer for European labour market analysis. The data is annual and released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-dsb-cur-nb-median-hourly-earnings-of-employees-by-sex-and-dis 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接获取指标`EAR_EHRM_SEX_DSB_CUR_NB`的原始数据,并依据欧洲ISO3国家代码进行地理筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化处理,同时保留`source.label`列以标注数据来源,确保数据的可追溯性。最终数据集包含684条观测记录,覆盖英国与摩尔多瓦两个欧洲国家,时间跨度从2005年至2025年,以Parquet格式封装,便于机器学习场景下的直接加载。
使用方法
用户可通过HuggingFace的`datasets`库一键加载数据集,调用`load_dataset('electricsheepeurope/europe-ilo-ear-ehrm-sex-dsb-cur-nb-median-hourly-earnings-of-employees-by-sex-and-dis')`后得到训练集,并便捷转换为pandas DataFrame进行后续分析。支持按国家筛选、按指标排序绘制时间序列图,以及利用透视表构建国家×年份的矩阵格式,便于跨国的中位数收入比较。数据集兼容表格分类、回归与时间序列预测等任务类型,特别适用于劳动经济学中的收入不平等与就业歧视研究。
背景与挑战
背景概述
在劳动力市场研究中,薪酬公平性一直是社会政策与经济学领域的核心议题,尤其涉及性别与残疾状态的交叉分析。由国际劳工组织(ILO)统计部门发布、Electric Sheep Europe于2025年重新打包的欧洲员工按性别与残疾状态及货币分类的时薪中位数数据集,聚焦于2005至2025年间英国与摩尔多瓦两国的684条观测数据。该数据集源自ILOSTAT这一全球劳动统计权威数据库,旨在通过ILO统一的统计方法论,揭示不同性别及残疾状态员工在时薪中位数上的差异,为政策制定者与研究者提供量化依据。其影响力体现在推动包容性劳动市场监测与可持续发展目标(SDGs)中体面工作指标的评估上,填补了欧洲区域内该交叉维度长时序数据的空白。
当前挑战
该数据集所着力解决的领域问题是劳动力市场中薪酬歧视的量化评估,尤其是将残疾状态纳入性别薪酬差距分析时所面临的维度稀疏性与数据可比性挑战。构建过程中面临的挑战包括:仅覆盖两个欧洲国家导致的地理代表性有限,可能无法泛化至全欧洲;数据来源于不同国家的劳动力调查(如英国的LFS),调查口径与统计年份(2005-2025)存在非对齐问题;部分观测值标记为‘序列中断’或‘临时值’,数据质量需谨慎对待;分类变量如性别与残疾状态组合后的观测值进一步稀释,影响了时间序列分析的统计稳健性。
常用场景
经典使用场景
该数据集的核心应用在于对欧洲国家雇员按性别与残疾状态分层的每小时中位收入进行实证分析。研究者可利用其提供的684条涵盖2005至2025年间的观测记录,开展跨时期、跨国别的劳动力市场收入差异研究。典型用法包括通过性别和残疾状况交叉分组,揭示不同群体在收入分配中的相对位置,并借助时间序列方法追踪收入中位数的演变趋势。数据以年度频率呈现,便于构建面板数据模型,探讨制度变迁、劳动力政策或经济周期对弱势群体收入的影响。
解决学术问题
该数据集有效回应了劳动经济学中关于收入不平等与就业歧视的量化研究难题,特别是针对残疾人群体的收入差异这一长期缺乏可靠数据的领域。它使学者能够系统性地比较不同残疾状态与性别组合下的收入中位数,从而检验现有歧视理论在劳动市场的适用性。此外,通过追踪2005年以来的时间跨度变化,为评估欧洲各国就业平等政策(如残疾包容法案)的实际效果提供了宝贵的纵向证据,推动了关于社会正义与劳动力市场结构转型的学术对话。
实际应用
在实际应用层面,该数据集为国际组织、政府统计部门及非营利机构提供了制定和调整薪酬公平政策的量化基石。例如,欧盟委员会及各国劳动部门可据此监测《欧洲残疾人战略》的实施进展,识别性别与残疾交叉维度下的收入鸿沟,并设计精准的补贴或税收调节方案。企业社会责任团队也能借用这些基准数据进行内部薪酬审计,评估其多元与包容举措相对于国家或行业标准的成效。
数据集最近研究
最新研究方向
基于ILOSTAT数据源的欧洲按性别与残疾状况划分的员工小时工资中位数数据集,为劳动经济学中的薪酬不平等与包容性就业研究提供了关键跨国面板数据。当前前沿方向聚焦于利用该时间序列(2005-2025年,覆盖英国与摩尔多瓦)分析残疾员工与普通员工之间的薪酬差距演变趋势,并结合性别维度交叉考察双重歧视效应。该数据集的高频粒度与ILO标准化的职业分类体系,使得研究者能够构建动态回归模型或时序预测框架,以量化劳动力市场政策(如反歧视法案与最低工资调整)对弱势群体薪酬平等性的实际干预效果。其数据质量标记(如序列中断标志)也为处理非连续面板数据的方法论创新提供了实证场景,欧盟推进的社会包容议程与《残疾人权利公约》实施监测等热点事件,进一步提升了该数据集在政策评估与跨国比较研究中的战略意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务