遇见数据集

electricsheepasia/asia-ilo-emp-tour-sex-ste-nb-tourism-sector-employment-by-sex-and-status-in-emp

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲24个国家从2008年至2025年的旅游业就业数据,按性别和就业状况分类(以千为单位)。数据来自国际劳工组织(ILO)的ILOSTAT数据库,涵盖1,182个观测值,核心指标为EMP_TOUR_SEX_STE_NB(旅游业就业按性别和就业状况分类)。数据集以表格形式组织,包括国家代码、年份、性别分类、观测值、数据来源和质量标志等列,适用于表格分类、回归和时间序列预测任务。数据经过ILOSTAT API提取和亚洲国家过滤,并遵循CC-BY-4.0许可。

This dataset contains tourism sector employment data for 24 Asian countries from 2008 to 2025, disaggregated by sex and status in employment (in thousands). Sourced from the International Labour Organizations (ILO) ILOSTAT database, it includes 1,182 observations with a core indicator EMP_TOUR_SEX_STE_NB (Tourism sector employment by sex and status in employment). Organized in tabular format, the data covers columns such as country code, year, sex classification, observed values, data sources, and quality flags, suitable for tabular classification, regression, and time-series forecasting tasks. Data is extracted via the ILOSTAT API, filtered for Asian countries, and released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-tour-sex-ste-nb-tourism-sector-employment-by-sex-and-status-in-emp 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下的ILOSTAT中央统计数据库,通过REST API接口直接提取指标EMP_TOUR_SEX_STE_NB的原始数据,并依据亚洲地区ISO3国家代码进行地域筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、住户收入调查等微观数据进行标准化处理,确保数据的一致性与可比性。数据集收录了24个亚洲国家2008至2025年间共计1182条观测记录,涵盖旅游业就业人数按性别与就业身份划分的单一核心指标。每条观测均附有来源标记字段,便于追溯原始调查数据,体现了严谨的数据溯源机制。
特点
该数据集最显著的特点在于其多维度的精细结构设计。除了核心观测值外,数据表包含性别(总、男、女)及就业身份等分类维度,支持不同粒度的子集划分。时间跨度为年度频率,覆盖2008至2025年,兼备历史纵向与近期横向分析潜力。数据质量标注机制完善,设有观测状态标志(如不可靠值)及断点说明注释,用户可据此评估数据适用性。此外,蒙古、越南、泰国等国家拥有较长的时序数据,为时间序列建模提供了丰富素材。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,并将其转换为pandas DataFrame进行后续操作。典型用法包括:按国家代码过滤特定国家的子集,利用sort_values对单一指标进行时间序列排序与可视化,或通过pivot_table构建以年份为行、国家为列的矩阵,便于进行跨国的比较分析与预测建模。数据集还支持基于性别或就业状态等分类列的分组聚合,适用于分类与回归任务。推荐在使用时同时引用原始ILO数据及Electric Sheep Asia的再打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT统计数据库发布,并由Electric Sheep Asia团队重新打包至HuggingFace平台,聚焦于亚洲24个国家2008至2025年间旅游业就业人数的性别与就业地位细分。ILOSTAT作为全球劳动统计的权威来源,依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查数据进行协调处理,确保了跨国可比性。核心研究问题旨在揭示亚洲旅游业就业结构的性别差异及就业地位分布,为区域旅游业可持续发展、性别平等政策及体面劳动目标的监测提供了关键数据支撑。该数据集在旅游经济学、劳动经济学及可持续发展研究领域具有重要影响力,尤其填补了亚洲地区旅游业精细化就业数据的空白。
当前挑战
该数据集面临的挑战首先在于领域问题的复杂性:旅游业就业的临时性、季节性与非正规性使得劳动力统计难以准确捕捉,而亚洲各国统计能力参差不齐,导致数据完整性与时效性存在差异,如部分国家观测年份稀疏(如东帝汶仅27条记录)或存在方法论中断(如标注“break in series”)。构建过程中的挑战则包括:跨23年时间跨度内各国调查口径、问卷设计及数据采集标准的异质性,需依赖ILO的标准化处理但可能引入偏差;从ILOSTAT API抽取时需过滤亚洲国家代码并处理多来源冲突(ILO选取“最佳来源”策略可能损失信息);此外,性别与就业地位细分维度的缺失值(如classif2列为空)限制了深度分析,而观测值可靠性标记(如“U”状态)警示部分数据需谨慎使用。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中涵盖亚洲24个国家、横跨2008至2025年的旅游业就业数据,堪称区域劳动力研究与旅游经济分析的宝贵资源。经典使用场景包括:基于性别与就业身份的维度剖析亚洲各国旅游业从业人数的演变轨迹,构建面板数据模型以探究旅游业发展对就业结构的冲击效应,或借助时间序列预测技术对亚洲旅游劳动力市场进行前瞻性预判。研究者可按国家、性别或就业状态进行精细过滤,快速提取特定子集以开展差异化的计量分析。
衍生相关工作
围绕该数据集衍生的经典工作涵盖多个研究方向。基于ILOSTAT的旅游就业数据已催生了一系列关于旅游经济与劳动力市场的计量研究,例如面板回归模型被广泛用于检验旅游专业化对就业质量的影响。在预测领域,ARIMA与Prophet等时间序列模型被应用于该数据上,产出多国旅游就业预测报告。该数据集亦常与GDP、游客到达人数等宏观数据联合使用,构建联立方程模型解析旅游就业的驱动机制。此外,部分研究将其纳入机器学习框架,通过分类与回归算法挖掘就业结构变迁的潜在模式。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲24国旅游业就业人口的性别结构与就业身份分布,为追踪后疫情时代亚洲旅游业复苏中的劳动力市场分化提供了关键数据支撑。基于ILOSTAT的标准化统计框架,研究者正利用其年频面板数据,结合时序预测与分类回归模型,探讨旅游业从业者中男性与女性在正式与非正规就业形态下的动态变迁。当前前沿方向包括:通过性别与就业身份交互分析,揭示旅游业数字化转型对女性和非正规就业群体的冲击与机遇;结合SDG体面劳动指标,评估亚洲各国旅游业就业质量的区域异质性;以及利用该数据训练可解释的机器学习模型,以预测旅游旺季就业波动。该数据集填补了亚洲旅游业细分雇佣形态的高质量公开数据集空白,为政策制定者设计包容性旅游业复苏方案提供了可复现的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务