遇见数据集

electricsheepasia/asia-ilo-emp-tour-sex-jbt-nb-tourism-sector-employment-by-sex-and-working-time

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲24个国家从2008年至2024年的旅游部门就业数据,按性别和工作时间安排分类,单位为千。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖1,103个观测值,涉及一个核心指标(EMP_TOUR_SEX_JBT_NB)。数据集提供了结构化表格,包括国家代码、年份、性别分类、观测值及其状态等信息,适用于表格分类、回归和时间序列预测等任务。数据经过标准化处理,以支持机器学习和研究用途。

This dataset contains 1,103 observations of tourism sector employment data across 24 Asia countries, spanning from 2008 to 2024, categorized by sex and working time arrangement in thousands. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), focusing on a single indicator (EMP_TOUR_SEX_JBT_NB). The data is structured in tabular format with columns for country codes, years, sex disaggregation, observed values, and quality flags, suitable for tasks such as tabular classification, regression, and time-series forecasting. It has been repackaged for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-tour-sex-jbt-nb-tourism-sector-employment-by-sex-and-working-time 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API直接提取指标代码为EMP_TOUR_SEX_JBT_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围筛选。ILOSTAT基于国际劳工统计学家会议(ICLS)的定义框架,对各国劳动力调查、家庭收支调查及行政记录等微观数据予以统一协调和标准化处理,确保跨国可比性。数据集中每一观测值均附有来源标签(source.label),便于用户追溯数据原始出处。最终由Electric Sheep Asia团队重新打包为HuggingFace数据集,以Parquet格式存储,实现即用型机器学习数据准备。
特点
数据集囊括2008至2024年间24个亚洲国家的1103条观测记录,涵盖唯一指标“按性别和工作时间安排分类的旅游业就业人数(千计)”。其核心特色在于提供精细的性别维度分解,包含总人数、男性及女性三个类别,为深入剖析旅游业劳动力结构的性别差异奠定基础。数据质量方面,ILOSTAT采用年度频率,优先选用同一国家-年份组合下由ILO认定的“最佳来源”,同时标识观测状态(如临时、不可靠)及序列断裂注释,充分揭示数据局限性,增强研究透明度。
使用方法
该数据集设计为与HuggingFace Datasets库无缝集成,用户仅需调用load_dataset函数即可加载并转换为Pandas DataFrame对象,便于进行数据探索与分析。典型使用场景包括:按国家代码过滤以聚焦特定区域的时序变化;针对单一指标按年份排序,绘制时序折线图以揭示旅游业就业趋势;亦可通过透视表操作,将数据重塑为国家×年份的矩阵形式,便于面板数据分析或计量模型输入。数据集格式规范,列名清晰,配套示例代码详尽,降低了劳动经济学、旅游研究及时间序列预测等领域的研究门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年构建,并经Electric Sheep Asia重新打包发布,聚焦亚洲24个国家在2008至2024年间旅游行业的就业状况。核心研究问题在于揭示性别与工作时间安排对旅游从业者分布的影响,填补了亚洲区域旅游劳动力统计数据的标准化缺口。凭借ILOSTAT权威的劳动统计整合能力,该数据集为跨国家、跨时段的比较分析提供了高质量基础,对旅游经济学、劳动社会学及可持续发展目标(SDG)中的体面工作研究具有重要推动意义。
当前挑战
领域层面,旅游行业就业数据长期面临定义不一致、统计口径差异大等挑战,性别与工作时间的交叉分析更因各国劳动调查标准各异而难以统一。构建过程中,数据源自多类调查(如劳动力调查、企业调查),需经ILO协调剔除重复与冗余,且部分国家数据存在年份间断、可靠性标记(如“不可靠”状态)及方法论修订导致的序列断裂,影响时间序列分析的连续性与稳健性。此外,多重来源的选择偏差与少量亚国家样本限制了模型泛化能力。
常用场景
经典使用场景
该数据集汇集了2008至2024年间亚洲24个国家的旅游业就业人数,并按性别与工作时间安排进行细分,共包含1103条观测记录。在经典使用场景中,研究者常将其用于时间序列预测任务,借助历史就业数据构建模型,预判未来旅游业劳动力市场的变化趋势。同时,该数据集也广泛服务于分类与回归分析,例如探究不同性别和工时安排下就业模式的差异,或识别影响就业波动的关键特征。其结构化的表格形式和标准化字段设计,使得研究人员能够便捷地进行数据清洗、特征工程及模型训练,从而高效开展劳动经济学与旅游学交叉领域的定量研究。
解决学术问题
该数据集有效解决了亚洲区域旅游业就业数据碎片化与标准化不足的学术难题。通过整合国际劳工组织ILOSTAT的权威统计,它提供了跨国家、跨年份的可比数据,使研究者能够系统分析性别与工时安排如何影响旅游业就业结构。常见的研究议题包括:衡量女性在旅游业的参与度变化、评估非全日制就业的性别差异、以及跨国比较劳动力市场的灵活性。这一数据集的问世,极大推动了旅游经济学与劳动经济学领域的研究进程,为揭示亚洲旅游业就业的动态演变规律提供了坚实的数据基础,同时为政策评估与可持续发展目标的监测提供了量化依据。
衍生相关工作
基于该数据集衍生出的相关工作主要体现在劳动经济学与旅游学的方法创新与实证研究上。一些研究构建了混合机器学习模型,结合时间序列与分类算法,预测亚洲各国旅游就业受季节性或政策冲击的影响。另有一些工作聚焦于性别维度的深度分析,利用统计因果推断方法,量化工时安排对男性和女性就业保障差异的贡献度。此外,数据集的开放性与标准化格式还催生了可视化工具和交互式仪表盘的开发,便于非专业用户探索就业变动规律。这些衍生工作不仅丰富了旅游劳动力研究的工具箱,也为跨学科合作提供了可复用的数据资产,进一步拓展了ILOSTAT数据在亚洲区域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务