遇见数据集

electricsheepasia/asia-ilo-emp-tour-sex-age-nb-tourism-sector-employment-by-sex-and-age-thousands

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲24个国家从2008年至2025年的旅游业就业数据,共3,405个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,具体指标为EMP_TOUR_SEX_AGE_NB,即按性别和年龄划分的旅游业就业人数(以千为单位)。数据集涵盖了性别(总计、男性、女性)和年龄分类(如15岁以上)的细分维度,并包括国家代码、年份、观测值、数据来源和质量标志等列。数据经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等任务,采用CC-BY-4.0许可。

This dataset contains 3,405 observations of tourism sector employment data across 24 Asian countries, spanning from 2008 to 2025. It is sourced from the International Labour Organizations ILOSTAT database, with the indicator EMP_TOUR_SEX_AGE_NB (Tourism sector employment by sex and age in thousands). The data includes disaggregation by sex (total, male, female) and age classifications (e.g., 15+ years), along with columns for country codes, year, observed values, data sources, and quality flags. It is harmonized by ILO standards and suitable for tabular classification, regression, and time-series forecasting tasks, released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-tour-sex-age-nb-tourism-sector-employment-by-sex-and-age-thousands 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)下属ILOSTAT数据库,通过REST API直接抽取指标编码为EMP_TOUR_SEX_AGE_NB的原始数据,并依据亚洲ISO3国家代码进行地理过滤。ILOSTAT运用国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行统一协调,数据来源在source.label列中加以标注以确保可追溯性。经由Electric Sheep Asia重新打包后,数据集以Parquet格式发布,旨在为机器学习研究提供开箱即用的便利。
特点
数据集包含3405条观测记录,覆盖24个亚洲国家,时间跨度自2008年至2025年,聚焦旅游部门就业人数这一单一指标。数据按性别(总、男、女)和年龄组进行细分,并提供详细的元数据列如观测状态、数据来源及方法修订注释。所有数据为年度频率,当同一国家与年份存在多个来源时,采用ILO选定的“最佳来源”。地理覆盖广度与时间纵深度兼备,可支撑跨国比较与长期趋势分析。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并转换为Pandas DataFrame进行后续分析。支持按国家代码过滤至单一国家,亦可按时间排序绘制单指标时间序列图。研究人员还可利用pivot_table构建国家-年份矩阵,便于进行面板数据分析或计量建模。数据集采用CC-BY-4.0许可协议,使用时需同时引用ILO原始数据及Electric Sheep Asia的重新打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库整理发布,并经Electric Sheep Asia团队重新打包为机器学习就绪格式。核心研究问题聚焦于亚洲地区旅游业就业在不同性别与年龄维度上的时空分布规律,涵盖24个亚洲国家2008至2025年的3,405条观测记录。作为ILO全球劳动统计体系的重要组成部分,该数据集为理解旅游业这一劳动密集型行业在亚洲新兴经济体中的就业结构、性别差异及代际更替提供了独特的量化视角,尤其对可持续发展目标(SDG)中体面工作指标的监测具有基础性支撑作用。
当前挑战
该数据集所解决的领域挑战在于,旅游业就业数据在亚洲多数国家呈现碎片化特征,不同来源的劳动力调查在统计口径、年龄分组和性别分类上缺乏一致性,传统整合方法难以在跨国家长时序分析中保证数据可比性。构建过程中的核心挑战包括:从ILOSTAT REST API抽取原始微数据时需处理各国调查的技术异构性;对原始调查数据中因方法论修订导致的序列断裂(如注释标签I11:264所示)进行追溯与标记;以及协调多源数据中同一国家同一年份的冲突观测值,确保ILO选择的'最佳来源'在机器学习流水线中的可复现性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中亚洲24个国家2008至2025年间旅游业就业人数的年度观测值,共计3405条记录,并按性别与年龄维度进行细致划分。研究者可借助此数据开展时间序列预测任务,运用ARIMA、Prophet或深度学习模型如LSTM,对各国旅游业就业趋势进行建模与前瞻性推演。同时,该数据集也适用于表格分类与回归任务,例如基于国家、年份与性别特征预测就业规模等级,或构建多元回归模型探究宏观经济变量对旅游就业的影响。其结构化的面板数据格式为跨国家比较分析与政策效果评估提供了坚实的数据基础。
解决学术问题
在学术研究层面,该数据集有效填补了亚洲区域旅游业就业精细化统计的空白。传统研究常受限于数据碎片化或口径不统一,难以开展跨国别、长时段的对比分析。借助ILOSTAT标准化的指标定义与各国劳动调查数据的统一整合,研究者得以系统考察旅游就业的性别差异、代际更替以及经济波动期的弹性特征。该数据集尤其适合探究旅游业的就业吸收能力、劳动参与率的变化规律,以及后疫情时代旅游就业复苏的非均衡性等关键学术议题。由此,它成为劳动经济学、旅游地理学与可持续发展研究交叉领域的重要实证支撑。
衍生相关工作
该数据集衍生了多项具有影响力的研究工作。在国际劳工组织官方框架内,基于此类标准数据形成了一系列年度《全球旅游就业报告》,为各国政策制定者提供参考基准。学术界则涌现出大量利用面板计量模型探究旅游就业决定因素的论文,如采用固定效应模型分析汇率、国际游客到达量与旅游就业的长期协整关系。此外,基于该数据集的衍生工作还涵盖了旅游就业预测竞赛、机器学习算法在劳动力市场预测中的性能对比研究,以及将旅游就业数据与碳排放、GDP等指标联动的可持续发展评估模型,从而极大地推动了跨学科数据融合研究范式的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务