遇见数据集

electricsheepasia/asia-ilo-emp-tour-sex-ec2-nb-tourism-sector-employment-by-sex-and-economic-acti

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲24个国家从2008年至2025年的旅游业就业统计数据,具体指标为EMP_TOUR_SEX_EC2_NB(按性别和经济活动划分的旅游业就业人数,ISIC第2级,单位:千)。数据集共有4,008个观测值,来源于国际劳工组织(ILO)的ILOSTAT数据库,通过劳动调查、家庭收入调查等原始数据整合而成。数据按国家、年份、性别(总计、男性、女性)和经济活动分类进行细分,并包含数据来源、观测状态和备注等信息,适用于表格分类、回归和时间序列预测等任务。

This dataset contains tourism employment statistics for 24 Asian countries spanning the period from 2008 to 2025. The specific indicator is EMP_TOUR_SEX_EC2_NB, which denotes the number of persons employed in tourism, classified by gender and economic activity at the ISIC Level 2, with the unit expressed in thousands. The dataset comprises a total of 4,008 observations, sourced from the ILOSTAT database of the International Labour Organization (ILO), and compiled from raw data originating from labor force surveys, household income surveys and other statistical sources. The data is disaggregated by country, year, gender (total, male, female) and economic activity category, and also includes supplementary metadata including data source, observation status and notes. It is suitable for a range of tasks including table classification, regression and time series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-tour-sex-ec2-nb-tourism-sector-employment-by-sex-and-economic-acti 数据集图片
构建方式
该数据集由国际劳工组织(ILO)下属的ILOSTAT统计数据库提供,经由Electric Sheep Asia团队重新封装并发布至HuggingFace平台。数据通过ILOSTAT公开的REST API接口直接获取,原始地址为`https://rplumber.ilo.org/data/indicator?id=EMP_TOUR_SEX_EC2_NB`。在获取过程中,数据被精确筛选至亚洲地区的ISO三位国家代码范围内,涵盖24个亚洲国家。ILOSTAT原始数据基于各国劳动力调查、家庭收入调查、企业调查及行政记录等多元来源,并依据国际劳工统计学家会议的统一定义进行协调统一,以确保跨国可比性。数据集的每一行观测都保留了`source.label`字段,用以标注数据来源,从而保障了数据溯源的可追溯性。最终形成包含4008条观测值的数据表格,按年份和性别等维度组织。
特点
此数据集的核心特点在于其专注于亚洲地区旅游业就业的时空纵贯与细分结构。数据时间跨度为2008年至2025年,提供了长达18年的年度序列观测,为时间序列分析和面板数据研究奠定了坚实基础。在维度设计上,数据集以性别(男、女、总计)为关键分类轴,并依据国际标准产业分类第二层级(ISIC Level 2)对经济活动进行细分,使得研究者能够深入剖析不同性别群体在亚洲各国旅游业各部门中的就业分布。此外,数据还包含了数据质量标记(如`obs_status`)和系列中断说明(如`note_indicator.label`),这为数据使用者评估数值的可靠性与连续性提供了必要的元信息,体现了其在细节上的严谨性。
使用方法
该数据集设计为与HuggingFace `datasets` 库无缝集成,研究者可通过一行Python代码 `load_dataset()` 直接加载数据,并转换为Pandas DataFrame格式进行后续分析。典型工作流程包括:首先,通过筛选`ref_area`字段锁定特定国家(如印度尼西亚),进行国别层面的就业特征研究;其次,可利用`time`和`obs_value`字段构建指定指标(`EMP_TOUR_SEX_EC2_NB`)的时间序列并可视化,观察亚洲旅游业就业的演变趋势;最后,通过数据透视表功能,可方便地将数据重塑为以年份为行、国家为列的二维矩阵,从而支持跨国比较和面板数据建模。数据集的表格结构清晰,分类变量(如`sex`)取值明确,为机器学习中的分类与回归任务提供了可直接使用的特征列。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Asia团队重新整合并封装为机器学习就绪格式,涵盖2008至2025年间24个亚洲国家旅游业就业数据,共计4008条观测。核心研究问题聚焦于揭示旅游产业在不同性别与经济活动分类下的就业结构性特征,为分析旅游业对区域劳动力市场的动态影响提供了珍贵的时间序列资料。该数据集在劳动经济学、旅游政策评估及可持续发展目标(SDG)追踪中具有重要影响力,尤其为亚洲发展中国家优化就业政策提供了基于实证的支撑。
当前挑战
该数据集旨在解决的领域问题在于,亚洲地区旅游就业统计长期呈现碎片化、缺标准与难比较的困境,亟需一个整合一致的数据基础以支持跨国家、跨时期的纵向分析。构建过程中面临的主要挑战包括:不同国家数据来源的统计口径差异(如部分指标基于劳动力调查、企业记录等混合来源),数据质量标记中存在不可靠观测(obs_status为'U')及序列断裂问题(因方法论修订导致前后不连续),同时近十年间部分国家的观测稀疏性(如马尔代夫仅有4个年度数据)限制了模型泛化能力。
常用场景
经典使用场景
在旅游经济学与劳动统计交叉领域,该数据集最经典的使用场景是构建亚洲各国旅游业就业规模的时序面板数据。研究者可利用其覆盖24个亚洲国家、2008至2025年的年度观测值,结合性别与经济活动的细分维度,揭示旅游业吸纳劳动力的动态变化规律。例如,通过绘制越南或泰国等旅游大国就业量的时间轨迹,可以量化旅游业在国民经济中的就业贡献度,或比较男性和女性在旅游相关行业中的参与差异。该数据集的结构化设计天然支持分国家、分性别的分组聚合与可视化分析,为跨国比较研究提供了可靠的数据基础。
解决学术问题
该数据集有效解决了亚洲区域旅游业就业统计碎片化与标准不统一的问题。学术研究常受困于各国统计口径差异和数据可得性不足,而ILOSTAT基于国际劳工统计学家会议定义的规范化处理,确保了指标可比性。利用此数据,学者可以严谨地检验旅游业发展对就业增长的影响机制,探讨经济危机或公共卫生事件(如疫情)对旅游劳动力市场的冲击程度,并评估不同性别在旅游就业中的结构性不平等。其意义在于,将分散的国别调查数据整合为统一的分析框架,推动了发展经济学与旅游地理学中关于可持续旅游与体面工作的实证研究。
衍生相关工作
该数据集衍生了一系列聚焦亚洲旅游就业的时空建模与因果推断工作。经典研究方向包括构建面板回归模型以检验旅游业专业化程度与就业质量之间的关系,或利用中断时间序列分析评估政策干预(如签证便利化)对从业人数的效果。部分工作进一步融合地理信息数据,揭示旅游就业的空间溢出效应,例如泰国边境省份的劳动力流动对邻国就业的影响。在方法论层面,研究者开发了基于该数据的缺失值插补算法,以优化年度数据不连续的观测。这些工作不仅深化了旅游就业决定因素的理论认知,也推动了跨学科方法论在劳动统计中的创新应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务