遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-ind-cur-nb-average-monthly-earnings-of-employees-by-ilo-secto

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲7个国家(葡萄牙、法国、瑞士、英国、意大利、波黑、希腊)从2008年至2025年的员工平均月薪数据,共19,347条观测记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖按ILO行业、性别和货币分类的指标(EAR_EMTA_SEX_IND_CUR_NB)。数据集为表格格式,适用于表格分类、回归和时间序列预测任务,包含国家代码、年份、性别分类、观测值等列,并提供了数据质量说明和使用示例。

This dataset contains 19,347 observations of average monthly earnings data across 7 Europe countries (Portugal, France, Switzerland, United Kingdom, Italy, Bosnia and Herzegovina, Greece) from 2008 to 2025. It is sourced from the International Labour Organization (ILO) ILOSTAT database, covering the indicator EAR_EMTA_SEX_IND_CUR_NB (Average monthly earnings of employees by ILO sector, sex and currency). The dataset is in tabular format, suitable for tabular classification, regression, and time-series forecasting tasks, with columns including country code, year, sex disaggregation, observed values, and data quality notes, along with usage examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-ind-cur-nb-average-monthly-earnings-of-employees-by-ilo-secto 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,通过REST API直接获取指标编码为EAR_EMTA_SEX_IND_CUR_NB的原始数据,并依据欧洲ISO3国家代码进行筛选与地域限定。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行标准化处理,数据来源在source.label列中予以标注以确保可溯源性。最终由Electric Sheep Europe团队完成数据重封装与格式统一化处理,形成可供机器学习工作流直接调用的结构化数据集。
特点
数据集包含19,347条观测记录,覆盖葡萄牙、法国、瑞士、英国、意大利、波斯尼亚和黑塞哥维那及希腊共7个欧洲国家,时间跨度为2008年至2025年。核心指标聚焦于按ILO部门、性别及货币分类的员工平均月收入,并提供性别维度(总计、男性、女性)的细分。数据结构丰富,包含国家代码、来源标签、指标编码、分类变量、观测值及状态标志等20个字段,且标注了数据质量标志(如不可靠、暂定),为精细化分析提供了坚实的数据基础。
使用方法
研究人员可通过HuggingFace的datasets库调用load_dataset函数一键加载数据,并转换为Pandas DataFrame进行后续操作。典型用法包括按国家代码筛选特定国家子集,按指标编码构建时间序列并进行可视化分析,或利用pivot_table方法将数据重塑为国家×年份的观测矩阵。数据集兼容表格分类、回归及时间序列预测等多种任务场景,为欧洲劳动力市场收入研究提供了便捷的ML-Ready数据入口。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Europe整合后托管于HuggingFace平台,聚焦于欧洲7国(2008–2025年)按ILO部门、性别及货币划分的雇员平均月收入。研究核心在于利用19,347条观测记录,揭示欧洲劳动力市场收入结构的时空异质性,为跨国劳动经济学分析、收入不平等研究及可持续发展目标(SDG)中体面工作指标的监测提供标准化数据基础。其影响力体现于ILOSTAT作为全球劳动统计权威数据库的广泛认可,数据集经由统一架构处理,可直接用于时间序列建模、分类与回归任务,推动劳动经济学与机器学习交叉领域的研究。
当前挑战
该数据集旨在解决的领域挑战包括:跨国平均收入数据的碎片化与可比性不足——不同国家采用各异调查方法、货币单位及行业分类标准,难以直接比较。构建过程中面临的具体挑战有:1)ILOSTAT原始数据来源繁杂(如劳动力调查、行政记录),需通过ICLS定义进行协作整合以消除偏差;2)处理缺失与不可靠观测值(如obs_status标记为U的记录)时需谨慎筛选,避免影响模型训练效果;3)时间跨度内国家样本非平衡,部分国家早期数据缺失(如希腊2015年方纳入),导致时序分析面临稀疏性问题。
常用场景
经典使用场景
该数据集收录了2008年至2025年间覆盖7个欧洲国家的19,347条关于按国际劳工组织(ILO)部门、性别及货币分类的雇员平均月收入观测数据。作为基于ILOSTAT官方统计数据库的标准化再封装成果,其经典用途在于支撑欧洲劳动力市场薪酬结构的跨时空比较分析。研究者通过性别与部门双重维度的分类变量,能够系统剖析不同经济活动中收入差距的演进轨迹;同时,本地货币与标准化指标的并存设计,便于开展跨国别的购买力平价校准与薪酬竞争力评估。
解决学术问题
该数据集有效回应了劳动经济学中关于薪酬决定机制与劳动力市场分层的核心议题。它解决了跨国面板数据在收入统计口径上的非一致性问题,为实证检验人力资本理论、性别工资差异的收敛假说以及部门间收入溢价的动态演变提供了高颗粒度证据。尤其值得注意的是,该数据涵盖2008年金融危机、欧债危机及新冠疫情等多重经济周期,使得学术界能够准确分离结构性因素与周期性波动对薪酬水平的影响,深化了对欧洲劳动力市场制度多样性与收入分配效应的理解。
衍生相关工作
该数据集衍生出一系列聚焦欧洲薪酬动态的学术与应用工作。基于其面板结构,研究者构建了预测欧洲蓝领与白领收入比的机器学习模型,并开发了可解释性框架以识别影响薪酬差异的关键部门特征。另一经典工作是将数据与欧盟统计局(Eurostat)的生活成本指数关联,生成了经购买力调整后的实际收入时空图谱。值得注意的是,数据集的性别分类已催生出多项关于欧洲各国玻璃天花板效应的计量经济学研究,通过RIF回归分解法量化了部门隔离对性别薪酬差距的贡献率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务