遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-ocu-nb-median-hourly-earnings-of-employees-by-sex-and-occ

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲8个国家从1991年至2025年的7,652个观察值,涵盖1个特定指标:按性别和职业划分的员工每小时收入中位数(本地货币)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过重新打包为机器学习就绪格式,适用于表格分类、回归和时间序列预测等任务。数据集包括国家代码、年份、性别分类、职业分类、观测值及其状态等列,提供了详细的收入统计信息,用于分析欧洲劳动力市场收入趋势。

This dataset contains 7,652 observations of median hourly earnings of employees by sex and occupation (local currency) across 8 Europe countries, spanning from 1991 to 2025, covering 1 distinct indicator. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), repackaged for machine learning readiness, and suitable for tabular classification, regression, and time-series forecasting tasks. The dataset includes columns such as country code, year, sex disaggregation, occupation classification, observed values, and status flags, providing detailed earnings statistics for analyzing labor market trends in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-ocu-nb-median-hourly-earnings-of-employees-by-sex-and-occ 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接提取指标标识为EAR_EHRM_SEX_OCU_NB的原始数据,并经欧洲ISO3国家代码筛选而构建。数据涵盖了欧洲8个国家自1991年至2025年间共7,652条观测记录。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行标准化整合,并在source.label字段中标注数据来源以实现可追溯性。最终由Electric Sheep Europe团队重新打包为HuggingFace数据集,以Parquet格式存储,便于机器学习场景直接调用。
特点
该数据集以雇员按性别和职业划分的每小时工资中位数(本地货币)为核心指标,呈现了精细化的多维结构。其特色在于包含ref_area、sex、classif1等分类维度,其中sex字段提供总计、男性和女性三种分类,而classif1字段记录了职业技能水平分组。数据以年频率发布,观测值obs_status标记可帮助识别如临时性或不可靠数据,note_indicator等字段则存储了货币单位等注释信息。8个国家的覆盖范围从瑞士的1,742条到希腊的288条不等,时间跨度最长达34年,为纵向比较提供了丰富的时序材料。
使用方法
用户可通过HuggingFace的load_dataset函数一键加载该数据集,返回的DataFrame结构包含20个字段,涵盖国家代码、指标标签、时间、观测值及各类注释。在分析实践中,可依据ref_area字段筛选特定国家进行聚焦研究,或利用indicator固定值对EAR_EHRM_SEX_OCU_NB指标按时间排序绘制折线图以观察趋势。更为灵活的操作是通过pivot_table将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或跨国家对比。使用时建议注意obs_status字段中标记的代用值或不可靠观察,并参考note_indicator中的货币信息以准确理解本地货币单位的差异。
背景与挑战
背景概述
在劳动经济学与不平等研究领域,薪资数据的跨国、跨时间可比性长期制约着政策分析与学术探索的深度。为解决这一瓶颈,国际劳工组织(ILO)通过其核心统计数据库ILOSTAT,整合各国劳动力调查与行政记录,构建了一套覆盖200多个经济体的劳动统计体系。在此框架下,Electric Sheep Europe于2025年将欧洲八国1991至2025年间按性别与职业分类的雇员小时工资中位数数据重新打包,形成了本数据集。该数据集收录7,652条观测,聚焦于揭示薪资结构的性别与职业差异,为研究欧洲劳动力市场中的性别薪酬差距、职业隔离现象及其动态演变提供了标准化、高频率的基础数据资源,对推动劳动经济学实证研究与国际比较具有显著价值。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:薪资中位数虽能反映典型劳动者收入水平,却难以捕捉分布尾部的极端极化现象与非正规就业的隐性薪酬;同时,跨国比较中因各国职业分类标准、数据采集时点及汇率波动引发的口径差异,始终威胁着分析结论的稳健性。在构建过程中,ILOSTAT虽通过国际劳工统计学家会议(ICLS)定义对原始微观数据进行统一清洗,但不同来源的省级或分层抽样数据在质量标签(如“不可靠”标记)上存在显著差异,且部分国家年份的观测缺失导致时间序列不连续;此外,数据仅有年度频率,未能涵盖季度或月度的高频波动,限制了对于短期政策冲击的响应分析能力。
常用场景
经典使用场景
在劳动经济学与收入不平等研究中,该数据集常被用于按性别与职业维度剖析欧洲各国小时工资中位数的演化轨迹。研究者可借助其时间跨度(1991至2025年)与八国覆盖范围,构建面板数据模型,识别不同职业层级与性别间的工资差异动态,并进一步结合国家特征展开跨国比较分析。分类与回归任务均可直接应用其结构化特征,如使用职业分类与性别作为解释变量,预测工资水平的分布规律。
实际应用
在实际场景中,该数据集为欧洲各国政策制定者与国际组织评估劳动市场公平性提供了数据基底。例如,可被用于监测《可持续发展目标》(SDG)中关于体面工作与性别平等的具体指标进展。企业HR部门也可参照行业与国家的工资中位数,优化薪酬结构并评估内部性别平等状况。此外,新闻机构与倡导组织借助该数据制作可视化的收入对比报告,以推动公共讨论与政策倡议。
衍生相关工作
该数据集衍生了若干经典工作,包括基于ILOSTAT数据的跨国性别工资差距时序分解研究、利用机器学习预测职业工资中位数随技能等级变化的工作,以及结合其他劳动指标构建的欧洲就业质量综合评价模型。HuggingFace上的重封装版本也为数据科学家提供了即用的Python加载接口,降低了复制研究成果的门槛。此外,多个学术团队已基于类似数据开发了用于均衡薪酬审计的开源工具包。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务