遇见数据集

electricsheepasia/asia-ilo-ees-tour-sex-ins-nb-tourism-sector-employees-by-sex-and-public-private

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和公共/私营部门划分的旅游部门雇员(千)| 亚洲(ILOSTAT),是一个表格数据集,专注于分类和回归任务以及时间序列预测。它包含1,106个观测值,覆盖23个亚洲国家(包括蒙古、越南、斯里兰卡、泰国等),时间跨度为2008年至2025年。数据集的核心指标是EES_TOUR_SEX_INS_NB,即按性别和公共/私营部门划分的旅游部门雇员数量(以千为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的主要来源,通过国家劳动力调查、家庭收入调查等收集数据。数据集经过重新打包,由Electric Sheep Asia提供,旨在为亚洲地区提供统一的机器学习就绪数据层。数据包括国家代码、国家名称、来源代码、指标代码、性别分类(总计、男性、女性)、观测年份、观测值、观测状态等列,并提供了数据质量说明,例如数据为年度频率,使用ILO选择的最佳来源。数据集以Parquet格式发布,便于使用Hugging Face的`load_dataset()`函数加载和分析。

This dataset, titled Tourism sector employees by sex and public/private sector (thousands) | Asia (ILOSTAT), is a tabular dataset designed for tabular classification, regression, and time-series forecasting tasks. It contains 1,106 observations across 23 Asian countries (including Mongolia, Vietnam, Sri Lanka, Thailand, etc.), spanning the years 2008 to 2025. The core indicator is EES_TOUR_SEX_INS_NB, which measures tourism sector employees by sex and public/private sector in thousands. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, a leading global repository for labour statistics that compiles data from national labour force surveys, household income surveys, and other sources. Repackaged by Electric Sheep Asia, the dataset is part of a mission to provide a unified, ML-ready data layer for Asia on Hugging Face. It includes columns such as country code, country name, source code, indicator code, sex disaggregation (total, male, female), observation year, observed value, observation status, and more, along with data quality caveats (e.g., annual frequency, use of ILOs best source). The dataset is published in Parquet format, enabling easy loading and analysis via Hugging Faces `load_dataset()` function.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-ees-tour-sex-ins-nb-tourism-sector-employees-by-sex-and-public-private 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,经由Electric Sheep Asia团队从REST API接口直接抽取并重新打包而成。原始数据依据国际劳工统计学家会议(ICLS)定义进行标准化处理,并通过劳动力调查、行政记录等多源渠道汇聚。构建过程中,数据被严格限定于亚洲地区的ISO三位国家代码,最终形成涵盖23个亚洲国家、时间跨度为2008年至2025年的1,106条观测记录,每条观测均保留了来源标签以确保可追溯性。
使用方法
用户可通过Hugging Face的`datasets`库便捷加载数据,调用`load_dataset()`函数即可获取以Parquet格式存储的完整表格,并转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定区域的时间序列、针对单一指标按年份排序以绘制趋势图,以及利用透视表构建国家×年份的观测矩阵。这些方法支持从宏观区域比较到微观国别动态的灵活研究,同时保留了元数据列以便溯源和校验。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年创建,并由Electric Sheep Asia在HuggingFace平台上重新打包发布,聚焦于亚洲23个国家2008至2025年间旅游业雇员按性别及公私部门划分的就业数据。旅游业作为全球经济的重要支柱,其就业结构的性别与部门差异是劳动经济学与可持续发展研究中的核心议题。该数据集整合了ILOSTAT数据库中通过劳动力调查等途径获取的宏观数据,提供了1,106条标准化观测记录,为探讨亚洲地区旅游业的劳动力市场动态、性别平等状况及政策影响提供了关键数据基础。其影响力体现在弥补了该区域高分辨率、长时间序列旅游就业数据的缺口,推动了劳动统计数据的可获取性与可复现性研究。
当前挑战
数据集面临的关键挑战在于数据质量的异质性与整合难度。一方面,不同国家的调查方法、年份覆盖范围及指标定义存在差异,如部分观测值标注为“不可靠”或存在序列断裂,反映出原始调查在频率、抽样框一致性及方法论变更上的局限性。另一方面,多源数据融合时,ILO需通过“最佳来源”筛选机制处理同一国家与年份的多来源冲突,但这可能引入选择偏差。此外,按性别与部门细分的数据在低覆盖国家(如缅甸、东帝汶)存在稀疏性,限制了跨国比较与时间序列分析的稳健性,对构建全面均衡的亚洲旅游就业图景形成挑战。
常用场景
经典使用场景
在劳动力经济学与旅游经济交叉研究领域,该数据集为分析亚洲地区旅游业就业结构提供了基础性数据支撑。其经典使用场景集中在按性别和公私部门维度对旅游业雇员数量进行统计建模与趋势分析,研究者可利用其覆盖23个亚洲国家、跨越2008至2025年的1,106条观测记录,构建面板数据模型以考察旅游业就业的时空演变格局。时间序列预测作为另一核心应用场景,允许利用年度观测值对各国旅游业就业态势进行外推预报,而分类与回归任务则可用于探索就业层级与地理经济特征之间的关联机制。数据集中性别的精细切分(总人数、男、女)更支持性别视角下的对比研究,为劳动参与率的性别差异分析提供量化依据。
解决学术问题
该数据集系统性地填补了亚洲区域旅游业就业统计在标准化、跨可比性方面的学术空白。由于ILOSTAT依据国际劳工统计学家会议(ICLS)标准对原始调查数据进行统一协调处理,解决了不同国家来源数据因定义与方法差异导致的整合难题,使跨国横向比较与纵向历史追踪成为可能。学术界可据此探讨旅游业发展对就业的拉动效应、公私部门在旅游就业吸纳能力上的分化机制,以及性别不平等在旅游业劳动力市场中的具体表现。该数据的发布推动了旅游经济学和劳动经济学领域计量分析的可重复性,为验证结构性因素如制度变迁、经济周期对旅游业就业冲击的作用路径提供了坚实的数据基础设施。
实际应用
该数据集在政策制定与国际组织监测层面展现出显著的应用价值。国际劳工组织、世界旅游组织等机构可借助其精细化统计指标,评估联合国可持续发展目标(SDGs)中体面工作与经济增长目标在亚洲旅游业的实现进程。各国劳动部门与旅游管理机构能够利用性别与公私部门交叉分组数据,诊断特定劳动力市场的供需失衡问题,从而制定精准的职业培训计划和就业促进政策。在商业领域,行业协会与咨询公司可通过历史就业数据分析预测人力资源需求,优化区域旅游投资布局与用工策略。数据集的开放许可(CC-BY 4.0)和标准化格式降低了使用门槛,更促进了研究机构与政府部门之间的数据共享与协作。
数据集最近研究
最新研究方向
在亚太区域旅游经济复苏与包容性就业的前沿探索中,该数据集为剖析旅游产业就业结构的性别分化与公私部门差异提供了关键实证基础。依托ILOSTAT权威统计框架与23个亚洲经济体2008至2025年的纵贯观测,研究者得以构建时间序列模型,追踪疫情冲击后旅游业就业弹性的性别异质性,并揭示公共部门与私营企业在吸纳女性劳动力方面的制度差异。当前热点聚焦于后疫情时代旅游业韧性重建与体面劳动目标的耦合机制,该数据集的引入为量化《2030年可持续发展议程》中性别平等与经济增长(SDG 5与SDG 8)的协同推进提供了稀缺的亚洲视角证据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务