遇见数据集

electricsheepeurope/europe-ilo-ear-thra-sex-cur-nb-average-hourly-earnings-of-tourism-sector-employee

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲旅游部门员工按性别和货币分类的平均小时收入数据,来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集涵盖1个欧洲国家(英国),时间跨度为2009年至2025年,共包含141个观测值。核心指标为EAR_THRA_SEX_CUR_NB,即旅游部门员工平均小时收入,数据按性别(总计、男性、女性)和货币类型进行细分。数据模式包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、时间年份、观测值等列,支持数据追溯和分析。数据为年度频率,经过ILO harmonisation处理,使用最佳来源,并包含数据质量标记。适用于表格分类、回归和时间序列预测等任务。

This dataset contains average hourly earnings of tourism sector employees by sex and currency in Europe, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 1 European country (United Kingdom) from 2009 to 2025, with 141 observations. The core indicator is EAR_THRA_SEX_CUR_NB, representing average hourly earnings, disaggregated by sex (total, male, female) and currency type. The schema includes columns such as country code, country name, data source, indicator code, indicator name, sex classification, time year, observed value, and more, enabling traceability and analysis. Data is annual frequency, harmonised by ILO, uses the best source selection, and includes data quality flags. It is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-thra-sex-cur-nb-average-hourly-earnings-of-tourism-sector-employee 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT统计数据库,通过调用其REST API接口获取原始数据,随后依据欧洲ISO3国家代码进行过滤与地域限定,最终经Electric Sheep Europe团队重新封装并标准化为机器学习友好的格式。数据覆盖了2009年至2025年间英国旅游部门雇员的平均小时工资信息,按性别与货币类型进行细分,共计包含141条观测值。整个构建过程严格遵循ILO对劳动统计数据的国际定义与规范,确保了数据来源的权威性与一致性。
特点
本数据集的核心特色在于其高度结构化与精细化的特征设计。每条记录均包含ISO国家代码、数据来源标识、ILOSTAT指标编码、性别分类变量以及观测值等字段,其中性别维度涵盖总计数、男性与女性三类,便于进行性别间薪资差异分析。数据以年度频率呈现,并附有观测状态标记与注释信息,便于用户评估数据质量。此外,数据集的简洁规模(不足千条)使其非常适合作为时间序列预测、回归分析或分类任务的教学与验证数据。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,使用`load_dataset()`函数即可获取完整的训练集并转换为Pandas DataFrame对象。在此基础上,可依据国家代码进行子集筛选,或按时间序列对特定指标进行可视化分析。数据集的表格结构支持灵活的数据透视操作,例如构建以年份为行、国家为列的观测值矩阵,便于进行跨时期与跨区域的对比研究。推荐在引用时同时标注ILO原始数据来源与Electric Sheep Europe的重新封装工作,以尊重数据产业链各环节的贡献。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年发布,经Electric Sheep Europe重新打包后托管于HuggingFace平台,聚焦于2009至2025年间欧洲旅游业员工的性别与货币细分下的平均时薪数据。旅游业作为全球经济的关键支柱,其劳动力市场的收入结构分析对评估行业健康度、推动体面劳动及实现联合国可持续发展目标至关重要。该数据集基于ILOSTAT统一协调的劳动力调查数据,提供了141条覆盖英国、按性别分类的精确观测值,为旅游经济学、劳动经济学及欧洲区域研究提供了标准化的量化基础,有效弥补了该领域细粒度薪酬数据的空白,助力学者与政策制定者追溯薪酬趋势、评估性别收入差距。
当前挑战
该数据集所应对的核心领域挑战在于旅游业薪酬统计的碎片化与跨国可比性缺失,ILOSTAT通过统一方法论整合多源调查数据,解决了因各国统计口径差异导致的横向对比难题。构建过程中,挑战包括:1)从ILOSTAT REST API高频抓取原始数据时,需处理不同来源的时序不连续性及指标注释复杂性,例如部分年度数据可能存在预估或修订值;2)在重新打包为Parquet格式时,需通过单一国家(英国)的有限样本(141行)确保性别与货币维度下各分组的零缺失与逻辑一致性,这对数据清洗与异常值处理提出严苛要求;3)数据集仅囊括单一欧元区国家,使得跨地理空间的薪酬模式外推分析受限于样本代表性,需警惕区域偏差对模型泛化能力的潜在影响。
常用场景
经典使用场景
在劳动经济学与旅游经济学的交叉研究领域,该数据集的核心应用在于探索欧洲旅游业从业者的性别薪酬差异及货币波动对实际收入的影响。研究者可借助其包含的性别、时间与国家维度,构建面板数据模型,以量化分析旅游业小时工资的长期演变趋势。其经典用法是将`time`、`ref_area`与`sex`字段作为分组变量,对`obs_value`开展描述性统计或回归分析,揭示不同性别劳动者在旅游业中的收入分布特征。此外,时间序列预测(time-series-forecasting)亦是其典型场景,通过历史观测值(2009–2025年)外推未来薪资走势,为劳动力市场规划提供数据支撑。
解决学术问题
该数据集精准回应了旅游经济学中长期存在的两个关键学术挑战:一是旅游业作为低门槛、高性别化行业,其薪酬结构的透明化与可比性问题;二是如何在国际比较中消除货币与购买力差异带来的数据偏差。通过ILOSTAT标准化后的每小时平均工资指标(EAR_THRA_SEX_CUR_NB),学者得以摆脱碎片化国家统计的桎梏,首次在同一框架下审视欧洲旅游业薪酬的性别鸿沟与时间动态。其数据质量标注(如`obs_status`中的临时或不可靠标记)进一步提升了因果推断的严谨性,为检验人力资本理论、劳动力市场歧视理论提供了可信的经验基础,推动旅游就业政策从定性讨论迈向量化评估。
衍生相关工作
围绕该数据集已衍生出多项拓展性工作:一方面,研究者将其与ILOSTAT中其他指标(如就业率、工作时长)进行特征拼接,构建复合劳动力指数,用于预测旅游业季节性用工波动对整体经济的影响。另一方面,Electric Sheep Europe团队通过统一Schema与Parquet格式打包,推动了数据在HuggingFace生态中的即用性(load_dataset一键加载),这直接促进了跨数据集迁移学习实验——例如用`tabluar-regression`任务训练薪资预测模型,或在多国数据上验证薪资公平性评估算法的泛化能力。此外,该数据集的细粒度`classif1`(货币类型)字段还催生了汇率波动对旅游从业者实际收入冲击的计量经济学研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务