electricsheepeurope/europe-ilo-ear-ehrm-sex-mts-cur-nb-median-hourly-earnings-of-employees-by-sex-marital
收藏数据链接:
官方服务:
资源简介:
该数据集包含欧洲7个国家(1991年至2025年)的员工每小时收入中位数数据,按性别、婚姻状况和货币分类,源自国际劳工组织(ILO)的ILOSTAT统计数据库。数据集共有3,741个观测值,涵盖1个核心指标,涉及国家包括瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑和希腊。数据通过ILOSTAT REST API获取,并经过标准化处理,适用于表格分类、回归或时间序列预测任务。
This dataset contains median hourly earnings of employees data for 7 European countries from 1991 to 2025, disaggregated by sex, marital status, and currency, sourced from the ILOSTAT database of the International Labour Organization (ILO). It includes 3,741 observations covering 1 indicator, with countries such as Switzerland, Portugal, France, the UK, Moldova, Bosnia and Herzegovina, and Greece. Data is retrieved via the ILOSTAT REST API and harmonized for use in tabular classification, regression, or time-series forecasting tasks.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接抽取了标识符为EAR_EHRM_SEX_MTS_CUR_NB的指标数据,并依据ISO 3166-1 alpha-3国家代码筛选出欧洲七国的相关记录。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源包括劳动力调查、家庭收入调查及行政记录等,并在source.label列中明确标注了数据溯源信息。数据集共包含3,741条观测记录,涵盖1991年至2025年间的年度时间序列,由Electric Sheep Europe进行重新封装与标准化处理。
特点
本数据集的核心特点在于其精细的维度划分与严谨的数据质量控制。除了基础的国家和时间维度外,数据按性别(男、女、合计)和婚姻状况(合计)进行分组,并提供了本地货币单位下的中位数小时收入数值。每个观测值均附带观测状态标志(如序列中断、临时数据等),以及详细的指标注释和来源注释,便于研究者评估数据可靠性。数据涵盖瑞士、葡萄牙、法国、英国、摩尔多瓦、波斯尼亚和黑塞哥维那及希腊七个欧洲国家,时间跨度长达三十余年,为跨国劳动经济学比较研究提供了珍贵的时序资料。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,将其转换为Pandas DataFrame后即可开展分析。研究者可按国家代码(ref_area)筛选特定国家的子集,或按指标代码提取单一指标的时间序列进行可视化。该数据集特别适用于构建国家×年份的面板数据矩阵,通过pivot_table操作可实现横向比较。数据中的性别分类变量(sex)允许进行性别收入差距的分解分析,而观测状态标志(obs_status)则帮助识别潜在的统计口径变化。建议在使用时关注note_indicator注释列,以理解特定观测值背后的定义差异与数据局限。
背景与挑战
背景概述
在中低收入国家及发达国家,劳动力市场的性别与婚姻状况差异一直是劳动经济学与社会政策研究的重要议题。由国际劳工组织(ILO)统计部维护的ILOSTAT数据库,作为全球劳动统计的核心枢纽,于2025年发布了“欧洲雇员按性别、婚姻状况和货币分类的时薪中位数”数据集。该数据集由Electric Sheep Europe重新封装,覆盖了1991年至2025年间7个欧洲国家的3741条观测值,聚焦于反映劳动力市场结构性不平等的核心指标——时薪中位数。通过按性别与婚姻状况进行细分,该数据集为研究工资差距的异质性演化提供了标准化、机器可读的珍贵素材,推动了跨国的比较劳动经济学与时间序列分析的深入发展。
当前挑战
该数据集依赖各国劳动力调查、住户收入调查等原始数据经ILO统一协调后生成,其核心挑战在于处理因调查方法、定义差异与分类标准不一致导致的统计可比性问题。具体而言,不同国家对婚姻状况的划分、对非正规就业的涵盖范围以及对薪资的市价调整方式存在差异,使得跨国或者跨时期的直接比较面临偏差风险。此外,数据观测值的质量标志(如“序列中断”“临时值”)要求研究者具备识别和校正异常数据的能力。从构建层面看,整合多来源微观数据并映射至ILO统计定义的过程需兼顾数据完整性与隐私保护,而年度频率限制了高频劳动力市场波动的捕捉能力。
常用场景
经典使用场景
在劳动经济学与性别平权研究领域,该数据集凭借其横跨1991至2025年的时序记录,覆盖瑞士、葡萄牙、法国、英国等七个欧洲国家,为分析不同性别与婚姻状况下雇员时薪中位数的动态变迁提供了宝贵素材。研究者常利用其中'sex'与'classif1'维度进行分组比较,通过时间序列回归或面板数据模型,揭示婚姻状态对男女工资差距的调节效应,并控制货币与就业来源等协变量,从而在跨国视角下精准刻画劳动力市场报酬结构的演化路径。
实际应用
在实际应用中,该数据集为国际组织、政府劳工部门及非营利机构提供了监测体面劳动目标的量化工具。例如,政策制定者可依据不同性别与婚姻群体的收入中位数变化,动态调整最低工资标准或育儿津贴方案,以缓解单亲家庭与已婚女性面临的经济脆弱性。同时,跨国企业薪酬审计团队能借助这些公开可比的数据基准,检视自身全球分支机构的性别薪酬平等状况,并据此合规地优化内部职级与激励架构,促进企业社会责任与劳动力多元包容目标的落地。
衍生相关工作
受该数据集启发,学界产生了一系列衍生性研究贡献。一方面,有工作将其与同期失业率、教育分布进行关联分析,构建多层次贝叶斯模型来预测区域劳动力市场韧性;另一方面,部分研究聚焦于时序插值与异常检测,利用该数据源验证针对调查断点或融合多源资料的新型统计方法。此外,基于此数据集衍生的可视化仪表盘与开放数据平台推动了劳动统计的科普传播,而相关的HuggingFace仓库格式则成为后续欧洲官方微数据再包装的标准化范例,促进了经济数据集的可重复使用与分布式协作。
以上内容由遇见数据集搜集并总结生成



