遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-ocu-nb-average-hourly-earnings-of-employees-by-sex-and-oc

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲国家员工平均小时收入统计信息,主题为按性别和职业划分的收入(使用本地货币)。数据集涵盖38个欧洲国家,时间跨度为1969年至2025年,包含12,847个观测值。核心指标为EAR_EHRA_SEX_OCU_NB,即按性别和职业划分的员工平均小时收入。数据以表格形式组织,包括列如:国家代码(ref_area)、国家名称(ref_area.label)、数据来源(source和source.label)、指标代码和标签(indicator和indicator.label)、性别分类(sex和sex.label)、职业分类(classif1和classif1.label)、年份(time)、观测值(obs_value)、观测状态(obs_status)以及相关注释列。数据按年度频率提供,并经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)定义。数据集适用于表格分类、回归和时间序列预测等任务,主要用于劳动经济学、收入分析和政策研究。

This dataset contains statistical information on average hourly earnings of employees in European countries from the International Labour Organization (ILO) ILOSTAT database, focusing on earnings by sex and occupation in local currency. It covers 38 European countries from 1969 to 2025, with 12,847 observations. The core indicator is EAR_EHRA_SEX_OCU_NB, representing average hourly earnings of employees by sex and occupation. The data is organized in tabular format, including columns such as country code (ref_area), country name (ref_area.label), data source (source and source.label), indicator code and label (indicator and indicator.label), sex disaggregation (sex and sex.label), occupation classification (classif1 and classif1.label), year (time), observed value (obs_value), observation status (obs_status), and related note columns. Data is provided at annual frequency and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, primarily used in labor economics, earnings analysis, and policy research.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-ocu-nb-average-hourly-earnings-of-employees-by-sex-and-oc 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,依托于各国劳动力调查、家庭收入调查、企业调查及行政记录等多元原始数据,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行标准化处理与整合。数据通过ILOSTAT的REST API接口直接获取,并以欧洲38个国家的ISO3代码为筛选条件,提取了1969年至2025年间关于雇员按性别与职业划分的平均小时工资(本地货币)指标,最终汇聚成包含12,847条观测值的结构化数据集,并由Electric Sheep Europe团队进行了重新封装与发布。
特点
该数据集的核心特点在于其多维度的细粒度拆解与时空覆盖的广袤性。它不仅提供了跨越半个多世纪的年度时间序列数据,覆盖了38个欧洲国家,还通过'sex'(性别:总计、男性、女性)与'classif1'(职业技能水平)等分类维度,实现了对工资差异的精细化分析。数据集中包含了丰富的元数据列,如数据来源标签、观测状态标志及货币说明等,为研究者提供了充分的溯源依据与质量评估手段,极大地增强了数据的透明度和可信度。
使用方法
数据集以HuggingFace Datasets库的标准格式提供,用户可通过简洁的`load_dataset`函数一键加载至Python环境,并便捷地转换为Pandas DataFrame进行后续操作。典型的应用流程包括:按国家或性别字段过滤以聚焦特定群体,利用`obs_value`列与`time`列绘制时间序列趋势图,以及通过数据透视表技术构建国家与年份的交叉矩阵,从而支持从单变量分析到面板数据回归等多种经济与劳动力研究范式。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT数据库于2025年通过Electric Sheep Europe整理并发布,聚焦欧洲38个国家在1969至2025年间按性别与职业划分的雇员平均小时工资(以当地货币计),包含12,847个观测值。作为全球劳动统计的权威来源,ILOSTAT依据国际劳动统计学家会议(ICLS)定义对原始调查微观数据进行协调与整合,其数据源自各国劳动力调查、企业调查及行政记录,为研究欧洲劳动力市场的工资结构、性别薪酬差异及职业分层提供了标准化的时间序列数据。该数据集在计量经济学、劳动经济学和政策评估领域具有重要价值,能够支撑薪酬不平等趋势分析、跨时期工资收敛性检验以及国际比较研究,弥补了欧洲区域层面精细粒度工资面板数据的稀缺性,推动了基于证据的就业与社会政策制定。
当前挑战
该数据集面临的领域挑战主要源于劳动统计的复杂性:工资数据受各国货币价值波动、职业分类标准不一致(如技能等级定义差异)、以及调查方法变迁的影响,导致跨国家、跨时期的可比性需谨慎处理;同时性别薪酬分析要求精确处理性别缺失值及职业分类的细粒度对齐,而部分国家的数据因样本量小或统计口径变化被标记为不可靠。在构建过程中,挑战体现为从ILOSTAT REST API批量抓取大规模异构元数据后进行归一化,需将38个国家、多来源的原始编码通过策略性映射整合至统一模式(如ISO国家代码与职业分类体系),并保留数据溯源字段以支持质量审计;此外,年度数据与部分国家月度或季度序列的合并存在时间频率冲突,且当同一国家年份存在多个来源时需依赖ILO的“最优来源”选择逻辑,增加了数据一致性与透明度的维护难度。
常用场景
经典使用场景
该数据集收录了1969年至2025年间38个欧洲国家的雇员平均小时收入数据,按性别和职业技能水平进行细致分层,共计12,847条观测。在劳动经济学与社会科学研究中,它常被用于构建面板数据模型,以探究性别收入差距的时空演变趋势,或是分析职业结构变迁对工资水平的影响。研究者可借助该数据集开展跨国比较分析,评估不同劳动力市场制度下收入分配格局的异同,亦可结合其他宏观经济指标,挖掘工资变动与经济增长、就业结构之间的深层关联。
解决学术问题
该数据集精准回应了劳动经济学中关于收入不平等与性别歧视的经典议题。通过提供跨性别、跨职业和跨年代的系统性薪酬数据,学者能够量化分析性别工资差距的长期收敛或固化态势,验证人力资本理论、劳动力市场分割理论等假说在欧洲多国的适用性。数据中‘最佳来源’标记与注释字段(如观察状态、货币单位)有效控制了测量误差,使得研究结论更为稳健。其价值在于为政策评估——如同工同酬法规、最低工资制度的施行效果——提供了可溯源的实证根基,推动了欧洲乃至全球体面劳动议程的学术化讨论。
衍生相关工作
围绕该数据源,学术界已衍生出多项经典研究脉络。基于ILOSTAT历年数据,学者构建了全球性别工资差距指数,揭示了欧洲各国在缩小收入差异方面的不同进展;另有工作聚焦于职业技能水平与薪酬回报的关系,利用分层模型剖析了高技能岗位中的性别溢价现象。在方法论层面,研究者开发了跨时间、跨来源的数据融合技术,以应对不同调查口径带来的统计分歧。该数据集还被用于训练时序预测模型,如基于长短期记忆网络(LSTM)的工资动态预报系统,为劳动经济学引入机器学习方法提供了基准测试集,推动传统统计手段与前沿计算工具的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务