遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-dsb-nb-median-monthly-earnings-of-employees-by-sex-and-di

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲员工按性别和残疾状况分类的月收入中位数数据(以本地货币计),涵盖32个欧洲国家,时间跨度为2004年至2025年,共5,363个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并经过过滤处理,确保覆盖欧洲地区。数据集包括一个核心指标“EAR_EMTM_SEX_DSB_NB”,用于衡量员工月收入中位数,并提供了详细的维度分解,如性别(总计、男性、女性)和残疾状况。数据结构包含国家代码、年份、观测值、数据来源和质量标志等列,适用于表格分类、回归分析和时间序列预测等机器学习任务。数据经过ILO的标准化处理,以确保国际可比性,并附有使用示例和引用指南。

This dataset contains median monthly earnings of employees by sex and disability status (in local currency) across 32 European countries, spanning from 2004 to 2025, with 5,363 observations. The data is sourced from ILOSTAT, the International Labour Organizations (ILO) central statistics database, retrieved via REST API and filtered for European ISO3 country codes. It features a key indicator EAR_EMTM_SEX_DSB_NB that measures median monthly earnings, with disaggregation dimensions such as sex (total, male, female) and disability status. The schema includes columns for country codes, years, observed values, data sources, and quality flags, making it suitable for tabular classification, regression, and time-series forecasting tasks. The data is harmonized using ICLS definitions for international comparability and comes with usage examples and citation guidelines.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-dsb-nb-median-monthly-earnings-of-employees-by-sex-and-di 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Europe团队重新封装后发布于HuggingFace平台。数据通过ILOSTAT REST API直接拉取,原始接口地址为`https://rplumber.ilo.org/data/indicator?id=EAR_EMTM_SEX_DSB_NB`,并依据欧洲ISO3国家代码进行地理范围过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理,数据来源在`source.label`列中明确标注,确保了数据的可追溯性与一致性。最终构建的数据集包含5,363条观测记录,覆盖32个欧洲国家,时间跨度从2004年至2025年。
使用方法
数据集的使用极为便捷,集成于HuggingFace的`datasets`库生态之中,研究人员可通过`load_dataset`函数一键加载,并直接转换为Pandas DataFrame进行后续分析。典型应用场景包括:按国家代码过滤以进行国别研究,例如筛选德国(DEU)数据;对`EAR_EMTM_SEX_DSB_NB`指标按时间排序后绘制时间序列图,以观察趋势变化;以及通过`pivot_table`方法将数据重塑为国家×年份的矩阵形式,便于进行跨国比较或面板数据分析。该数据集的标准化格式与丰富的交互操作示例,显著降低了劳动经济学实证研究的数据预处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT编制,并由Electric Sheep Europe于2025年重新整理发布,聚焦于欧洲32个国家2004至2025年间雇员按性别和残疾状况划分的中位月收入(以当地货币计)。ILOSTAT作为全球劳动统计的权威来源,依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录进行标准化处理,确保了跨国家与跨时间数据的一致性与可比性。这一数据集的构建回应了劳动经济学中关于就业质量与包容性增长的核心研究问题,尤其是残疾人群体的收入差距及其演变趋势。其在社会科学、公共政策及可持续发展目标(SDGs)监测领域具有重要影响力,为评估体面劳动指标、制定残疾人就业政策及推动跨区域比较研究提供了稀缺的实证基础。
当前挑战
该数据集面临的核心挑战在于多维度数据整合与质量控制:首先,各国对‘残疾’的定义差异显著,部分国家采用非标准分类(如标注中提及的‘非标准残疾定义’),导致跨国比较时统计口径的一致性难以保障,直接影响分析结论的可靠性。其次,数据来源涉及劳动力调查、家庭收入调查及行政记录等多种渠道,尽管ILO会筛选‘最佳来源’,但不同来源间存在抽样误差、调查周期差异及数据采集偏差,尤其对于残疾人群这类样本量较小的群体,观测值可能被标记为‘不可靠’(obs_status=U)。此外,时序数据本身存在年度频率与部分国家数据缺失(如2004年部分国家无记录)的局限,加之本地货币计价未统一调整购买力平价,使得跨国横向对比面临汇率波动与物价水平差异的干扰,增加了模型构建与政策推断的复杂性。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集的核心应用在于揭示欧洲各国不同性别与残疾状况雇员的薪酬差异。研究者可基于其高分辨率的分组特征,构建多维度薪酬公平性分析框架,系统评估性别与残疾歧视对劳动力市场回报的影响。数据集覆盖32个欧洲国家、跨越二十余年的年度观测,为纵向比较与跨国面板分析提供了坚实的数据基础,尤其适用于固定效应模型、分位数回归等经典计量方法,以识别薪酬差距的演变趋势及其结构性动因。
解决学术问题
该数据集有效回应了劳动经济学中关于薪酬不平等与弱势群体就业质量的经典学术命题。通过同时纳入性别与残疾状态两个交叉性维度,它突破了以往单一维度研究的局限,使学者能够量化残疾女性在劳动力市场中所面临的“双重歧视”效应。此外,其基于国际劳工组织标准化定义的收入指标,解决了跨国数据可比性难题,为检验最低工资政策、反歧视立法等制度变量的调节作用提供了可信的经验证据,推动了包容性增长理论的实证发展。
实际应用
在实际应用层面,该数据集为欧盟及成员国制定并评估劳动与社会保障政策提供了量化依据。政策制定者可利用其按性别和残疾状态细分的薪酬数据,监测《欧洲残疾人战略》与《性别平等指令》的执行效果,识别薪酬差距突出的行业与地区,从而精准设计薪酬透明化措施、就业配额制度或职业康复补贴方案。非政府组织也可借此数据开展公众倡导,推动企业履行社会责任,促进工作场所的包容性实践。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲32国2004至2025年间按性别与残疾状况划分的员工月收入中位数(本币计值),源自国际劳工组织ILOSTAT数据库,经由Electric Sheep Europe重新封装为机器学习就绪格式。当前前沿研究热点在于利用此时间序列数据开展劳动市场中的薪酬公平性差异分析,尤其关注残疾群体与性别交叉维度的收入鸿沟。与联合国可持续发展目标中体面工作与经济增长议题紧密呼应,该数据集为揭示结构性歧视、评估欧盟包容性就业政策效果提供了可量化依据。其精细化的分类变量(性别、残疾状态)与年度观测频率,使得研究者能够构建面板数据模型,追踪各国内部在劳动力参与、薪酬激励及社会保护体系下的长期收入变动趋势,进而推动基于证据的公共政策制定与劳动经济学前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务