遇见数据集

electricsheepeurope/europe-ilo-ear-tmta-sex-cur-nb-average-monthly-earnings-of-tourism-sector-employe

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自欧洲1个国家(英国GBR)的141个观测值,时间跨度为2009年至2025年,专注于“按性别和货币划分的旅游业员工月平均收入”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过欧洲国家代码过滤,涵盖了就业、工资等劳动统计信息。数据集包括国家代码、指标代码、时间、观测值、性别分类(总计、男性、女性)、货币类型等列,适用于表格分类、回归和时间序列预测等任务。数据质量方面,为年度频率,使用ILO选择的“最佳来源”,并包含数据状态标志。数据集以CC-BY-4.0许可证发布,由Electric Sheep Europe重新打包,便于机器学习使用。

This dataset contains 141 observations from 1 Europe country (GBR) spanning 2009 to 2025, focusing on the indicator Average monthly earnings of tourism sector employees by sex and currency. Sourced from the ILOSTAT database of the International Labour Organization (ILO), it is retrieved via API and filtered for European country codes, covering labor statistics such as employment and wages. The dataset includes columns like country code, indicator code, time, observed value, sex disaggregation (total, male, female), and currency type, suitable for tasks like tabular classification, regression, and time-series forecasting. Data is annual frequency, uses ILO-selected best sources, and includes observation status flags. It is released under the CC-BY-4.0 license and repackaged by Electric Sheep Europe for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-tmta-sex-cur-nb-average-monthly-earnings-of-tourism-sector-employe 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,通过其REST API接口直接提取指标EAR_TMTA_SEX_CUR_NB的原始数据,并依据欧洲ISO3国家代码进行地理过滤。随后,由Electric Sheep Europe团队对数据进行重新封装与标准化处理,包括统一模式定义、转换为Parquet格式,以确保数据集具备机器学习就绪(ML-ready)的高可用性。数据采集覆盖2009年至2025年间的年度观测值,总计包含141条记录,所有原始调查微观数据均依据国际劳工统计学家会议(ICLS)定义进行协调,并通过source.label字段标注数据来源,保障了数据的可追溯性与统计口径的一致性。
特点
该数据集聚焦于欧洲旅游行业雇员的月均收入水平,按性别与货币进行细致分解,包含性别(SEX_T/SEX_M/SEX_F)和分类变量(如当地货币CUR_TYPE_LCU)等多个维度的交叉分组。其独特之处在于数据来源的权威性与专业性,由国际劳工组织官方发布,并经过Electric Sheep Europe的统一清洗与封装,使得原本结构复杂的官方统计数据变得易于加载和分析。此外,数据集还提供了观测状态标记(obs_status)和附属注释列(note_indicator、note_source),便于研究者识别数据的时效性、可靠性及货币换算细节,为深入的劳动经济学分析与跨国比较提供了坚实支撑。
使用方法
用户可通过HuggingFace Datasets库以一行代码快速载入数据:load_dataset('electricsheepeurope/europe-ilo-ear-tmta-sex-cur-nb-average-monthly-earnings-of-tourism-sector-employe'),并将其转换为Pandas DataFrame进行后续操作。典型用法包括按国家过滤(如df[df['ref_area'] == 'DEU'])、按时间序列绘制特定指标的变化趋势(通过sort_values('time')排序后绘图),以及利用透视表构建国家×年份的观测矩阵,便于进行面板数据分析或计量经济学建模。数据集的Parquet格式与标准化Schema设计,使其可直接用于分类、回归或时间序列预测等机器学习任务,显著降低了研究者从原始官方统计中提取和处理数据的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)于2025年创建,经Electric Sheep Europe团队重新封装后在HuggingFace平台发布,聚焦于欧洲地区旅游行业雇员的月度平均收入水平。ILO作为全球劳动统计的权威机构,通过整合各国劳动力调查、行政记录等多源数据,致力于实现全球劳工指标的可比性与标准化。该数据集的核心研究问题在于揭示按性别与货币划分的旅游业薪资结构,为评估旅游业的就业质量及性别收入差距提供了关键数据支撑。数据涵盖英国2009至2025年的141条观测记录,指标统一且来源可追溯,对欧洲旅游经济研究与劳动力政策制定具有重要的基础性参考价值。
当前挑战
该数据集主要着眼于多重挑战。从领域问题看,旅游行业因其季节性、非正规就业占比高及跨国数据标准不一,长期缺乏精准、可比的薪资信息,尤其性别维度的收入细分更显匮乏,而该数据集的发布为弥补这一空白提供了突破口。从构建过程看,挑战在于跨来源数据的技术规范整合:尽管ILOSTAT基于国际劳动统计学家会议定义进行数据协调,但原始数据包含来自不同国家调查的时频差异、统计口径波动及源数据标记冗余,需通过统一的API提取与筛选机制完成清洗与过滤。此外,受限于欧洲数据覆盖范围广而实际仅英国一国的观测样本,如何未来扩展国家覆盖面并维持数据一致性,亦是持续存在的标准化难题。
常用场景
经典使用场景
在劳动经济与旅游产业交叉研究领域,该数据集最为经典的应用场景是对欧洲旅游业雇员的薪资水平进行系统性建模与趋势分析。研究者可借助其按性别与货币类型划分的精细维度,剖析旅游部门内男性与女性员工的收入差异,并追踪其在2009至2025年间的时间序列演变。依托ILOSTAT权威数据源与标准化元数据架构,该数据集为构建面板回归模型、开展跨国收入比较以及验证旅游行业就业质量演变假说提供了可靠的数据基础,成为区域旅游劳动市场研究中不可或缺的实证资源。
解决学术问题
该数据集的核心学术价值在于回应了旅游经济学中一个长期存在的关键命题:旅游业就业是否意味着低薪与不稳定的代名词。通过提供标准化、可复现的月度均薪时序数据,它使得研究者能够量化旅游部门雇员的真实收入水平,并考察其与整体经济平均工资的动态关系。此外,按性别细分的观测值直接服务于对职场性别薪酬差距这一经典议题的实证检验,助力揭示旅游行业中性别不平等现象的演变规律,从而为完善旅游劳动经济学理论框架与推进联合国可持续发展目标中体面工作议程提供了坚实的量化依据。
衍生相关工作
围绕该数据集已涌现出若干富有启发性的延伸研究工作。在计量经济领域,学者常以其为核心变量,构建向量自回归模型或误差修正模型,探析旅游业薪酬波动与入境旅游收入、就业人口结构之间的长期协整关系。在公平劳动研究中,研究者利用其性别标签发展出旅游行业性别收入差距分解模型,将薪酬差异分解为可解释部分与不可解释部分,从而量化歧视效应在其中的占比。此外,该数据还催生了结合多源ILOSTAT指标的综合分析框架,用于绘制欧洲旅游就业体面工作晴雨表,为后续更广泛的国际比较研究树立了方法论范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务