遇见数据集

electricsheepasia/asia-ilo-ear-thra-sex-cur-nb-average-hourly-earnings-of-tourism-sector-employee

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲16个国家旅游部门员工按性别和货币分类的平均小时收入数据,时间跨度为2010年至2025年,共741个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过处理,涵盖了国家代码、年份、性别分类、观测值等字段。数据集主要用于表格分类、回归和时间序列预测等任务,适用于劳动经济学和旅游行业研究。

This dataset contains 741 observations of average hourly earnings for tourism sector employees across 16 Asian countries, spanning from 2010 to 2025. It includes data disaggregated by sex and currency, sourced from the International Labour Organizations ILOSTAT database via API. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, with fields such as country codes, year, gender classification, and observed values.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ear-thra-sex-cur-nb-average-hourly-earnings-of-tourism-sector-employee 数据集图片
构建方式
该数据集由Electric Sheep Asia团队从ILOSTAT REST API直接拉取原始数据,并过滤出亚洲ISO3国家代码的观测值而构建。ILOSTAT作为国际劳工组织(ILO)的核心统计数据库,通过整合各国劳动力调查、家庭收入调查、企业调查及行政记录等多元数据源,并依据国际劳工统计学家会议(ICLS)的定义进行数据协调与标准化处理,确保了数据的一致性与可比性。最终数据集以Parquet格式封装,便于机器学习场景下的高效加载与使用。
特点
该数据集聚焦于亚洲16个国家2010至2025年间旅游部门员工的平均时薪指标,共收录741条观测记录。其独特之处在于按性别(总计、男性、女性)与货币类型进行细粒度拆解,同时保留了数据来源标识、观测状态及注释信息等元数据列,为研究者提供了清晰的溯源路径与数据质量评估依据。数据集覆盖国家广泛,从经济规模较大的印度尼西亚到小型经济体如不丹,时间跨度长达16年,为区域劳动力市场的纵向比较与分析奠定了坚实基础。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据,随后将其转换为Pandas DataFrame进行灵活操作。典型用法包括按国家代码筛选特定国家的子集,例如印尼的数据;针对单一指标进行时间序列分析,并可视化其演变趋势;或通过数据透视表构建国家×年份的矩阵面板,便于跨国比较与面板数据建模。此外,数据集中包含的性别与货币分类变量支持多维度子样本分析,满足从描述性统计到因果推断的多样化研究需求。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属的ILOSTAT数据库于2025年整理发布,并由Electric Sheep Asia团队在HuggingFace平台重新封装。数据集聚焦于亚洲16个国家旅游业雇员的平均时薪,涵盖2010至2025年间741项观测值,并按照性别与货币类型进行细化分类。其核心研究问题在于揭示亚洲区域旅游业劳动力报酬的时空分布格局与性别差异,为劳动经济学、旅游经济学及可持续发展目标(SDG)中的体面工作指标提供数据支撑。作为ILOSTAT这一全球权威劳动统计数据库的典型子集,该数据集在推动亚太地区旅游就业质量监测、跨国比较研究以及政策评估方面具有重要应用价值,尤其填补了区域内精细化的行业薪酬数据空白。
当前挑战
该数据集所面临的挑战体现在双重维度。在领域问题层面,尽管旅游业是亚洲多国经济支柱,但区域内部薪酬统计口径不一、货币单位多样(如本地货币与美元并存),导致跨国比较困难;同时,性别维度的薪资差距分析受限于部分国家数据稀疏,难以支持稳健的纵向或横截面推断。在构建过程中,数据整合面临来自16个国家不同来源(如劳动力调查、行政记录)的结构异构与质量参差问题,ILOSTAT虽采用ICLS定义进行协调,但观测状态列(如'断点'标志)仍表明存在序列不连续性;此外,多数国家年观测数不足50条,部分国家仅9条,导致时间序列分析与面板模型面临严重的样本稀疏性挑战,限制了统计推断的可靠性。
常用场景
经典使用场景
该数据集收录了2010年至2025年间亚洲16个国家的旅游从业人员平均时薪数据,包含741条观测记录,并按性别与货币类型进行了细致分类。最经典的使用场景是在时间序列分析与面板数据回归中,通过绘制不同国家旅游行业小时工资的长期演变曲线,识别出区域间工资水平的差异与收敛趋势。研究人员可借助该数据集构建固定效应或随机效应模型,以定量评估旅游业发展对劳动者薪酬的拉动效应,亦可将其作为宏观经济监测的关键输入,用于横向对比亚洲各国旅游竞争力与劳动力成本变化。
实际应用
在实际应用中,该数据集为国际组织、政府部门以及旅游企业集团提供了清晰的薪酬基准参考。联合国下属机构可利用它监测亚洲各国在可持续旅游发展目标(SDG)下的体面工作进展,识别出薪资增长迟缓或性别不平衡的“热点国家”以调整援助策略。各国旅游部与劳动部则可基于实时行业工资动态,制定更具吸引力的海外人才引进政策,或与邻国进行劳资谈判时提供有据可查的薪酬锚点。此外,旅游行业协会亦能借此优化其年度薪酬调查报告,提升对会员单位的行业洞察力。
衍生相关工作
围绕该数据集所衍生的经典工作聚焦于两大方向:一是开发面向旅游行业的薪酬预测模型,如利用历史时序特征和该国GDP增长率、游客抵达量等外部变量,训练LightGBM或Prophet模型对下一季度平均时薪进行临近预报。二是构造区域旅游福利指数,将小时工资数据与旅游从业人数、产业增加值等结合,形成亚洲特色的“绿色旅游包容性增长”评价指标体系。此外,部分研究将该数据集纳入以深度学习为基础的跨国劳动力市场比较框架中,与ILOSTAT的其他指标联动,构建亚洲旅游业的数字孪生经济画像,推动了交叉学科的量化创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务