遇见数据集

electricsheepeurope/europe-ilo-ear-cmta-sex-cur-nb-average-monthly-earnings-of-care-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含999个观测值,涉及7个欧洲国家的付费护理工作者数据,时间跨度为1996年至2025年,涵盖按性别和货币划分的护理员工平均月收入指标。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,经过处理和筛选,专注于欧洲地区。数据集包括国家代码、来源、指标、性别分类、时间、观测值等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 999 observations of paid care workers data across 7 Europe countries, spanning 1996–2025, covering the indicator for average monthly earnings of care employees by sex and currency. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), processed and filtered for European coverage, and includes columns such as country codes, sources, indicators, sex disaggregation, time, and observed values, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-cmta-sex-cur-nb-average-monthly-earnings-of-care-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过其REST API直接提取指标为“EAR_CMTA_SEX_CUR_NB”的观测数据,并限定至欧洲范围内的ISO3国家代码。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行标准化处理,数据来源涵盖劳动力调查、家庭收入调查及行政记录,且在source.label列中标注以保障可追溯性。最终数据集包含来自7个欧洲国家(瑞士、法国、英国、波黑、葡萄牙、意大利、希腊)的999条观测,时间跨度覆盖1996年至2025年。
特点
数据集聚焦于按性别和货币分类的护理雇员平均月收入,提供时间序列形式的年度数据,便于纵向比较。其结构设计兼具灵活性与细粒度,包含ref_area、sex、classif1等维度列,涵盖总性别、男性和女性三种性别人群,以及本地货币等分类变量。数据质量方面,对于同一国家与年份的多来源指标,采用ILO选定的最佳来源;同时,观测状态标志(如序列中断)和注释字段的存在进一步提升了数据的透明度和可信度,是欧洲护理劳动力薪酬研究的高质量资源。
使用方法
用户可通过HuggingFace的datasets库轻松加载该数据集,使用load_dataset()函数即可获取,并支持转换为Pandas DataFrame进行后续分析。典型操作包括按单一国家过滤以进行国别研究,或通过时间列排序绘制特定指标的时间序列图。此外,用户可用pivot_table将数据重塑为国家×年份的矩阵形式,从而直观对比多国薪酬演变趋势。数据集覆盖欧洲七国且时间跨度近三十年,适用于面板数据分析、回归建模及时间序列预测等多元统计任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年创建,经Electric Sheep Europe重新整理后发布,聚焦于欧洲地区有偿护理从业者的平均月收入水平,按性别和货币维度进行细分。数据集覆盖瑞士、法国、英国等7个欧洲国家,时间跨度从1996年至2025年,共计999条观测记录,其核心研究问题在于揭示护理行业薪酬的性别差异与跨国异质性。作为ILOSTAT全球劳动统计数据库的衍生产品,该数据集为劳动力经济学、性别平等研究以及社会保障政策分析提供了高粒度的时序数据支撑,对于评估欧洲各国护理行业劳动力市场状况及可持续发展目标中体面工作指标的实现程度具有重要研究价值。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,护理行业作为全球劳动力市场中女性占比极高的部门,其薪酬数据长期存在统计口径不一致、跨国可比性差的问题,而该数据集虽基于ILO统一标准,但不同国家间数据来源(如劳动力调查、行政记录)的差异仍可能导致系统性偏差。其次,在构建过程中,数据集仅涵盖7个欧洲国家,且观测年份分布不均(如瑞士249条而希腊仅54条),同时数据仅保留年度频率而舍弃了更细致的月度或季度序列,这限制了时间序列建模的粒度。此外,部分观测值标注为“序列中断”或“临时性”状态,反映出原始数据采集中的质量和连续性挑战,可能影响模型训练的稳定性与推断可靠性。
常用场景
经典使用场景
在劳动经济学与性别不平等研究领域,该数据集常被用于分析欧洲各国有偿照护工作者(paid care workers)的平均月收入水平及其跨时间变化趋势。研究者通过整合多个欧洲国家自1996年至2025年的年度观测数据,能够构建面板数据模型,探讨照护行业薪酬的国别差异、性别工资差距以及货币单位对收入测量的影响。该数据集特别适合进行时间序列预测任务,通过历史收入轨迹预估未来薪酬走向,为劳动力市场政策制定提供数据支撑。
解决学术问题
该数据集有效回应了照护经济领域一个核心学术难题——如何系统性地量化欧洲范围内有偿照护工作者的薪酬水平及其性别分化。传统研究常因数据零散、跨国可比性差而难以展开全面比较,而该数据集通过ILOSTAT标准化指标与统一分类体系,克服了不同国家统计口径不一致的障碍。它为探索照护劳动的市场估值、性别收入不平等机制以及宏观经济波动对照护行业的影响提供了可靠的数据基础,推动了欧洲福利国家比较研究与性别经济学的发展。
衍生相关工作
该数据集衍生的经典工作包括基于欧洲多国照护员工薪酬面板数据的计量经济学研究,如采用双重差分法评估各国照护政策改革对工资的影响,或运用分位数回归揭示不同收入层级照护员工的性别薪酬差距异质性。另外,有学者结合该数据集与宏观劳动力调查数据,构建了照护行业薪酬预测模型,用以估算劳动力市场供需失衡对工资的冲击。这些工作不仅深化了对照护劳动价值的认识,也为后续研究提供了方法论范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务