遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-edu-cur-nb-median-hourly-earnings-of-employees-by-sex-educati

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别、教育和货币划分的员工小时收入中位数指标数据,覆盖欧洲8个国家(包括瑞士、葡萄牙、英国、法国、波黑、摩尔多瓦、意大利、希腊),时间跨度为1991年至2025年,共计18,763个观测值。数据按性别(总计、男性、女性)、教育水平和货币类型进行细分,适用于表格分类、回归和时间序列预测等任务。

This dataset contains the Median hourly earnings of employees by sex, education and currency indicator from the ILOSTAT database of the International Labour Organization (ILO), covering 8 European countries (including Switzerland, Portugal, UK, France, Bosnia and Herzegovina, Moldova, Italy, Greece) from 1991 to 2025, with a total of 18,763 observations. The data is disaggregated by sex (total, male, female), education level, and currency type, and is suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-edu-cur-nb-median-hourly-earnings-of-employees-by-sex-educati 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接提取指标EAR_EHRM_SEX_EDU_CUR_NB的数据,并依据欧洲ISO3国家代码进行地理过滤。原始数据来自各国劳动力调查、家庭收入调查、机构调查及行政记录,经ILO统计部门依据国际劳工统计学家会议定义进行统一协调与清洗。每个观测值均附有来源标签以追踪数据溯源,最终整合为涵盖8个欧洲国家、1991至2025年间18,763条记录的结构化表格。
使用方法
用户可通过HuggingFace的datasets库以load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行后续分析。典型操作包括按国家筛选特定子集,按指标和时间排序以绘制时序趋势图,或利用pivot_table构建国家×年份的观测值矩阵。数据集可直接用于表格分类、回归以及时间序列预测等机器学习任务,其结构化的模式设计使得跨维度聚合与可视化分析极为便捷。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布,并由Electric Sheep Europe重新打包至HuggingFace平台,专注于欧洲8个国家1991至2025年间按性别、教育水平及货币划分的雇员每小时工资中位数。数据集涵盖18,763条观测记录,旨在为劳动经济学、性别薪酬差异及教育回报率等研究提供标准化、可复用的结构化数据。作为ILO核心统计数据库的衍生资源,该数据集凭借其权威来源与精细分类,为跨国比较分析、政策评估及时间序列建模奠定了坚实的数据基础,对推动欧洲劳动市场研究的实证化与可复现性具有重要意义。
当前挑战
数据集面临的核心挑战包括:1)领域问题层面,需解决劳动统计中因各国调查方法、教育分类标准及货币单位差异导致的跨国可比性难题,特别是在整合多来源数据时需处理数据缺失、标识不一致及观测值可靠性标注(如状态标记'U'表示不可靠)等问题。2)构建过程中,数据从ILOSTAT API抽取后需经过欧洲国家筛选与异构源(如劳动力调查、行政记录)的协调,同时保留来源溯源信息(source.label列)以确保透明度;此外,高频数据仅提供年度粒度,且非所有指标均具备完整的性别与教育维度分解,限制了更精细时空分析的可能性。
常用场景
经典使用场景
该数据集汇集了欧洲8个国家1991至2025年间按性别、教育程度和币种分列的雇员小时工资中位数数据,共计18,763条观测记录。在劳动经济学与社会科学研究中,这一数据集常被用于构建工资决定因素的计量经济模型,通过面板数据分析揭示性别工资差距的演变轨迹、教育回报率的跨国差异以及货币因素对收入比较的影响。研究者能够借助时间序列与回归分析方法,系统考察欧洲劳动力市场中结构性不平等现象的成因与动态变化。
解决学术问题
数据集为解答多个关键学术问题提供了权威支撑,包括欧洲各国间性别工资差距是否随时间收敛、不同教育层级的人力资本回报率如何随经济周期波动、以及本地货币计价下的实际收入水平在跨国比较中的调整机制。通过ILOSTAT统一公布的标准化统计口径,研究者能够消除数据可比性障碍,精准识别制度变迁与政策干预对劳动力市场结果的影响,从而深化对欧洲一体化进程中社会公平议题的实证理解。
实际应用
在实际应用层面,该数据集为国际组织、政府机构和政策制定者监测和评估劳动力市场绩效提供了基础工具。社会学家与经济顾问可借助这些数据定期生成性别薪酬平等指数,识别高教育群体与低教育群体之间的收入断层,并据此设计针对性的工资补贴或税收激励方案。跨国企业的人力资源部门亦可利用该数据集对标不同欧洲国家的薪酬水平,优化其区域薪酬策略,确保在多元文化与法规环境下的竞争力。
数据集最近研究
最新研究方向
性别薪酬差距的跨时空计量与教育回报率异质性分析。该数据集整合了1991至2025年间8个欧洲国家的按性别与教育程度划分的小时工资中位数数据,为劳动经济学中前沿的性别薪酬差距动态追踪提供了宝贵微观基础。研究者可借此剖析教育层级如何调节性别工资差异,并探讨不同货币单位下的实际收入变动。在欧洲持续关注体面工作与性别平等的政策背景下,该数据为构建预测模型、评估欧盟薪酬透明指令等举措的长期影响提供了量化支撑,助力揭开人力资本回报与劳动力市场结构性不平等之间的复杂互动。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务