遇见数据集

electricsheepasia/asia-ilo-ear-thra-sex-nb-average-hourly-earnings-of-tourism-sector-employee

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲16个国家从2010年至2025年期间,按性别划分的旅游部门员工平均每小时收入(以本地货币计)的249个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖单一指标EAR_THRA_SEX_NB,并提供了国家、年份、性别(总、男性、女性)、数据来源、观测值和状态等详细信息。数据集适用于表格分类、回归分析和时间序列预测等自然语言处理任务,旨在支持对亚洲旅游劳动力市场收入趋势的研究和分析。

This dataset contains 249 observations of average hourly earnings of tourism sector employees by sex (in local currency) across 16 Asian countries from 2010 to 2025. Sourced from the International Labour Organizations ILOSTAT database, it covers the indicator EAR_THRA_SEX_NB and includes detailed information such as country codes, years, sex disaggregation (total, male, female), data sources, observed values, and status flags. It is designed for tabular classification, regression, and time-series forecasting tasks, facilitating research and analysis of income trends in Asias tourism labor market.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-thra-sex-nb-average-hourly-earnings-of-tourism-sector-employee 数据集图片
构建方式
该数据集由国际劳工组织(ILO)的ILOSTAT核心统计数据库构建而成,数据通过REST API直接抓取,筛选指标代码为EAR_THRA_SEX_NB的观测值,并限定为亚洲地区的ISO3国家代码。原始数据来源于各国劳动力调查、家庭收入调查、企业调查及行政记录,经ILO依据国际劳工统计学家会议(ICLS)定义进行统一协调和标准化处理,每个观测值的来源均在source.label列中清晰标注,确保数据可追溯。数据集共包含249条记录,覆盖16个亚洲国家,时间跨度为2010年至2025年。
特点
该数据集聚焦于旅游业雇员按性别划分的平均小时收入(以当地货币计价),指标单一但维度精细。数据按性别进行分解,包含总、男、女三类,便于性别差异分析。地理覆盖范围广泛,从人口大国如越南(39条)到小型经济体如东帝汶(6条),时间序列长度不一,最长达15年(越南)。数据质量方面,标注了观测状态标志(如临时、断裂序列),并提供了来源和货币注释,但仅发布年度数据,不包含月度或季度序列。
使用方法
用户可通过HuggingFace Datasets库轻松加载数据集:使用`load_dataset`函数一键获取数据框,随后利用Pandas进行探索性分析。例如,可按国家筛选(如`df[df['ref_area'] == 'IDN']`),或针对特定指标绘制时间序列图(如`sample.plot(x='time', y='obs_value')`)。此外,可通过数据透视表构建国家×年份矩阵(如`pivot_table(index='time', columns='ref_area', values='obs_value')`),便于跨国比较和面板数据分析。数据以Parquet格式打包,兼容主流机器学习工作流。
背景与挑战
背景概述
旅游业作为全球经济的重要支柱,其从业者的薪酬水平直接映射出行业景气度与劳动权益保障程度。由国际劳工组织(ILO)旗下ILOSTAT数据库发布、Electric Sheep Asia于2025年重新打包的该数据集,聚焦亚洲16个国家2010年至2025年间旅游部门雇员按性别划分的平均时薪(以当地货币计),共包含249条观测记录。该数据集旨在弥补亚洲地区旅游业薪酬微观数据的碎片化缺陷,为跨国比较研究、性别工资差异分析及区域劳动力市场动态监测提供标准化、可复用的时序数据资源,有助于推动体面劳动与可持续发展目标(SDGs)的量化评估。
当前挑战
该数据集所应对的核心挑战在于,亚洲各国旅游业薪酬统计口径不一、数据采集频率各异且长期缺乏统一平台,导致跨国横向对比与历史趋势建模困难重重。在构建过程中,ILO需协调各国劳动力调查、机构调查及行政记录等多源异构数据,依据国际劳工统计学家会议(ICLS)标准进行清理与归并,同时面临部分年份数据缺失、性别分类细节不足以及汇率波动对当地货币单位可比较性的干扰。此外,源数据标注与中断序列标记的存在,进一步增加了时间序列分析与模型预测的难度,要求使用者在应用中审慎处理数据质量标记与来源变更信息。
常用场景
经典使用场景
该数据集聚焦于亚洲16个经济体旅游业从业者按性别划分的平均时薪信息,采集自国际劳工组织ILOSTAT官方数据库。在时间序列预测与面板数据回归分析中,该数据被广泛用于构建劳动经济学模型,例如探究旅游业薪资在2010至2025年间的动态演化趋势。研究者可借助该数据集对性别工资差距进行分解分析,通过分类任务识别影响薪酬水平的制度性因素,或在时序框架下评估宏观经济波动对旅游从业人员收入的影响。其简洁的指标设计使得跨国家、跨性别的对比分析变得直观且易于复现。
实际应用
该数据在实际应用中为国际组织与政策制定者监测亚洲旅游业劳动条件的演变提供了可靠工具。劳动部门可参照性别维度的薪资数据调整最低工资政策,优化旅游行业的薪酬公平性;跨国酒店集团与旅游运营商能据此评估不同市场的人力成本结构,辅助薪资预算与区域扩张战略制定。非政府组织在倡导体面劳动议程时,也可引用该数据集形成基于证据的倡议报告。此外,由于数据以Parquet格式在HuggingFace托管,数据科学家能够便捷地将之集成至数据看板或自动化报告管线,实现旅游行业薪酬指标的持续监测。
衍生相关工作
基于该数据集,学术界已衍生出多项影响力的研究方向。例如,将性别拆分的薪资序列与ILOSTAT其他指标联合构建多变量因果模型,探索不同国家旅游专业化程度对收入分配的非线性影响。另有工作利用该数据作为基础训练集中间表示,迁移至低资源国家的旅游劳动力预测任务。此外,围绕该数据构建的时间序列基线模型已被用于评估新冠疫情对亚洲旅游业薪资的冲击幅度与恢复速度,相关成果常见于《旅游管理》与《国际劳工评论》等期刊的方法论章节。该数据集亦成为亚洲区域劳动力市场比较研究中引用的标准数据来源之一。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务