遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-dsb-cur-nb-median-monthly-earnings-of-employees-by-sex-disabi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含2004年至2025年间32个欧洲国家的15,857个观测值,涉及按性别和残疾状况分类的员工月收入中位数指标,数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库。

This dataset contains 15,857 observations from 32 European countries between 2004 and 2025, covering the monthly median employee earnings indicator categorized by gender and disability status. The data is sourced from the ILOSTAT statistical database of the International Labour Organization (ILO).

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-dsb-cur-nb-median-monthly-earnings-of-employees-by-sex-disabi 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲32个国家2004至2025年间按性别、残疾状况及货币分类的雇员月收入中位数。数据通过ILOSTAT REST API直接抓取,并筛选至欧洲ISO3国家代码范围。ILO统计部门基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,来源类型(如劳动力调查、家庭收入调查)在`source.label`字段中予以标注,以确保数据溯源清晰。最终数据集包含15,857条观测记录,涵盖32个欧洲国家,由Electric Sheep Europe进行标准化重包装。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数一步加载数据,并转换为Pandas DataFrame进行后续操作。典型的使用路径包括:按国家代码(如`ref_area == "DEU"`)筛选特定国家子集;针对单一指标按时间排序后绘制时间序列图;利用`pivot_table`将数据重塑为国家×年份的矩阵形式,便于面板数据分析。数据集包含丰富的分类字段(如`sex`、`classif1`、`classif2`),支持按性别、残疾状况等多维度进行分组聚合与统计分析,适用于劳动经济学中的收入不平等与包容性就业研究。
背景与挑战
背景概述
全球劳动力市场中,残障群体的就业与收入状况长期处于政策研究与数据监测的薄弱环节。为填补这一空白,国际劳工组织(ILO)基于其权威统计数据库ILOSTAT,构建了欧洲雇员按性别、残障状况及货币分类的月收入中位数数据集。该数据集由Electric Sheep Europe于2025年重新打包发布,涵盖了2004至2025年间32个欧洲国家的15,857条观测记录,聚焦于单一核心指标——雇员月收入中位数,并依据性别与残障状况进行交叉分类。这一精细化的数据粒度,为研究残障相关的薪酬差异、性别收入差距及其交互效应提供了前所未有的实证基础,尤其服务于ILO推动的体面劳动目标(SDG 8)与减少不平等(SDG 10)议程。数据集通过ILOSTAT官方REST API获取,并经过国家筛选与标准化处理,研究者可直接调用HuggingFace的load_dataset函数快捷使用,极大降低了劳动经济学与公共政策领域的数据获取门槛。
当前挑战
该数据集所面临的挑战主要集中于三个层面。第一,核心研究问题在于残障歧视导致的薪酬不平等难以量化——残障雇员的收入受就业形式、行业分布、社会保护制度等多重因素混杂影响,单一的中位数指标难以剥离制度性与结构性歧视。第二,数据构建过程中,不同国家对“残障”的定义标准不一(如ILO标注的‘非标准定义’),且来源数据源于各国劳动力调查、家庭收入调查及行政记录,其抽样方法、问卷设计和统计口径差异导致跨国比较的效度受限。第三,数据质量标注显示大量观测值的可靠性存疑(obs_status标注为‘不可靠’),且某些年份或国家的细分维度存在缺失,在时间序列预测或分类任务中可能引入系统性偏差,需额外进行反事实估计或数据插补处理。
常用场景
经典使用场景
该数据集汇集了2004年至2025年间32个欧洲国家雇员月收入中位数的详尽记录,按性别和残疾状况进行了细颗粒度分层。其最经典的用途在于支撑劳动经济学中的薪酬公平性研究,通过对比不同性别及残疾状态群体的收入水平,为量化分析欧洲劳动力市场中存在的收入差距提供了坚实的数据基础。研究者常利用时间序列特性,追踪特定国家或地区内收入中位数的演变趋势,从而评估劳工政策与反歧视法案的长期效能。
解决学术问题
该数据集的核心学术价值在于解决了跨国别、长时序的劳动收入比较难题,特别聚焦于残疾人与健全者之间、男女性别之间的薪酬鸿沟。它使得学者能够突破单一国家或短期数据的局限,精确测量不同社会经济环境下收入不平等程度的结构性差异。这项工作的深远意义在于,它为验证人力资本理论、劳动力市场分割理论以及社会排斥理论提供了跨文化、跨制度背景的实证锚点,从而推动包容性增长与体面工作等全球性议题的量化研究。
实际应用
在实际应用层面,该数据集为政府机构、国际组织及非营利机构制定和评估劳动政策提供了决策支持工具。例如,欧盟委员会可据此监控成员国在《欧洲残疾人战略》框架下的收入目标达成情况,识别出在薪酬公平方面进展滞后的区域并调配资源。企业社会责任(CSR)评估机构也能利用这些数据建立行业薪酬基准,辅助制定内部多元与包容(D&I)指标,确保薪酬管理实践的合理性与透明度。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲32国2004至2025年间雇员月收入中位数的性别与残疾状态交叉分析,为劳动经济学中的就业公平与包容性增长研究提供了关键数据支撑。当前研究前沿正围绕残疾人群体的薪酬差距、性别与残疾双重歧视的叠加效应展开,尤其与欧盟2021年发布的《残疾人权利战略(2021-2030)》及全球可持续发展目标(SDG 8.5)紧密关联。通过高分辨率的时间序列数据,学者可精准追踪政策干预(如强制性薪酬透明化、无障碍就业法案)对弱势群体收入动态的长期影响,推动从描述性统计向因果推断的范式跃迁。该数据集还可与欧盟统计局(Eurostat)的劳动力调查数据融合,揭示宏观经济波动中残疾雇员薪资的脆弱性,并为后疫情时代‘包容性复苏’的量化评估提供实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务