遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-mts-cur-nb-average-monthly-earnings-of-employees-by-sex-marit

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲33个国家从1991年至2025年的17,853条观测数据,涉及“按性别、婚姻状况和货币划分的员工平均月收入”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了就业、工资等劳动统计信息,并经过Electric Sheep Europe重新打包,以提供统一的、适合机器学习使用的数据格式。数据集包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、婚姻状况分类、货币分类、观测年份、观测值、观测状态等列,支持表格分类、回归和时间序列预测等任务。

This dataset contains 17,853 observations of Average monthly earnings of employees by sex, marital status and currency data across 33 Europe countries, spanning 1991–2025. It is sourced from ILOSTAT, the ILOs central statistics database, and repackaged by Electric Sheep Europe to provide a unified, ML-ready data layer. The dataset includes columns such as country code, country name, source, indicator code, indicator name, sex disaggregation, marital status classification, currency classification, observation year, observed value, and observation status, supporting tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-mts-cur-nb-average-monthly-earnings-of-employees-by-sex-marit 数据集图片
构建方式
该数据集源自国际劳工组织ILOSTAT数据库,通过REST API接口拉取指标代码为EAR_EMTA_SEX_MTS_CUR_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。ILOSTAT利用国际劳工统计学家会议定义的标准化定义对各国劳动力调查、家庭收支调查及行政记录等微观数据进行协调处理,生成可比的跨国指标。数据集经Electric Sheep Europe团队重新封装,以Parquet格式提供,确保学者与开发者能够通过HuggingFace的load_dataset接口直接调用,极大降低了数据获取与预处理的门槛。
特点
该数据集涵盖1991年至2025年间33个欧洲国家的17853条观测记录,聚焦于按性别、婚姻状况及货币类型分组的雇员月均收入指标。数据包含丰富的维度拆解,如性别(总、男、女)、婚姻状况总计及本币计价类型,并提供来源标记、观测状态标志及注释说明列,确保了数据的可追溯性与质量透明度。时间跨度的广度与国家覆盖的完整性,使其成为研究欧洲劳动力市场薪酬结构演变、性别收入差距及婚姻溢价等议题的理想数据资产。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并利用to_pandas方法转换为DataFrame进行后续分析。典型使用场景包括按国家过滤子集进行国别分析,或针对特定指标构建时间序列可视化,揭示薪资变动趋势。此外,通过数据透视表操作可将数据重塑为国家×年份的面板矩阵,便于开展跨国比较与面板数据计量建模。数据集以cc-by-4.0许可发布,使用时需同时引用原始ILO数据来源及Electric Sheep Europe的重封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经由Electric Sheep Europe于2025年重新封装并发布在HuggingFace平台。其核心研究问题聚焦于欧洲33个国家1991年至2025年间,按性别、婚姻状况和货币分类的员工平均月收入,旨在揭示劳动力市场中的收入差异与结构性不平等。作为ILOSTAT数据库的分支,该数据集整合了来自劳动力调查、家庭收入调查等多源行政记录,依托国际劳工统计学家会议(ICLS)标准进行统一规范。数据集的发布为劳动经济学、性别研究和社会政策分析提供了高颗粒度的面板数据,尤其适用于评估欧洲各国在性别薪酬平等方面的长期趋势,对推动联合国可持续发展目标(SDG)中的体面劳动议题具有显著影响。
当前挑战
数据集面临的首要挑战是解决劳动力市场中性别与婚姻状况对收入影响的量化分析难题,传统宏观统计往往掩盖了细分群体的收入差异,而该数据通过引入婚姻状况分类,为揭示社会结构如何塑造经济不平等提供了新视角。在构建过程中,挑战在于跨国家、跨年度数据的协调一致:不同国家采用差异化的调查方法和货币单位,ILO虽通过最佳来源选择和数据标准化进行调和,但部分年份的标识(如“U”表示不可靠)仍反映了数据质量的波动。此外,数据仅覆盖年度频率,缺失季度或月度信息,限制了对短期经济冲击的追踪能力。多源数据整合时,分类字段(如sex、classif1)因指标不同而出现空值,进一步增加了跨指标联合分析的复杂度。
常用场景
经典使用场景
在劳动经济学与社会保障研究领域,该数据集为分析欧洲各国雇员平均月薪的性别差异与婚姻状况交互效应提供了标准化的面板数据基础。研究者可通过时间序列方法追踪1991至2025年间33个欧洲国家薪资水平的动态演变,利用分类变量(性别、婚姻状态)与连续变量(货币计值)的精细拆分,构建多维度回归模型,从而揭示劳动力市场中薪资不平等的历史趋势与区域异质性。
衍生相关工作
基于该数据集衍生的经典工作涵盖了多个前沿方向。在计量经济学领域,研究者利用其长面板特征开发了动态薪资差距分解方法,将性别工资差异拆解为禀赋效应与歧视效应。机器学习领域则涌现出基于梯度提升的时序预测模型,用于预测婚姻状态变更后的薪资变动轨迹。此外,空间计量分析中,学者借此构建了欧洲薪资收敛俱乐部,揭示了东西欧国家间薪资趋同的俱乐部特征与制度门槛效应。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲33国1991至2025年间按性别与婚姻状况划分的雇员平均月薪动态追踪,弥合了劳动力市场中性别薪酬差异与家庭结构变迁的交叉研究空白。在全球性别平等议题持续升温、欧盟《薪酬透明指令》等政策加速落地的背景下,该数据为量化婚姻状态对职业收入的影响、揭示性别与家庭角色交织下的经济分层提供了罕见的纵向面板基础。通过衔接ILOSTAT统一的统计口径与国别细颗粒度,研究可深入剖析南欧与北欧福利体制下薪酬不平等的异质性演变,助力识别传统性别角色固化向现代双职工模式转轨过程中的结构性障碍,从而为制定去中心化、证据驱动的公平薪酬干预策略奠定数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务