遇见数据集

electricsheepasia/asia-ilo-emp-tour-sex-how-nb-tourism-sector-employment-by-sex-and-weekly-hours

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲23个国家2010年至2025年期间旅游业就业数据,具体指标为“按性别和实际每周工作小时数划分的旅游业就业人数(千)”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过过滤处理,涵盖2,475个观测值。数据集支持按性别(总计、男性、女性)进行细分,并包括国家代码、数据来源、观测值、年份等字段,适用于表格分类、回归和时间序列预测等自然语言处理任务。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的“最佳来源”和处理缺失值的方法。

This dataset contains tourism sector employment data for 23 Asian countries from 2010 to 2025, with the indicator Tourism sector employment by sex and weekly hours actually worked (thousands). It includes 2,475 observations sourced from the International Labour Organization (ILO) ILOSTAT database via REST API, filtered for Asia. The data supports disaggregation by sex (total, male, female) and features fields such as country codes, data sources, observed values, and years, suitable for tabular classification, regression, and time-series forecasting tasks. Data is annual, with quality notes on source selection and handling of missing values.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-tour-sex-how-nb-tourism-sector-employment-by-sex-and-weekly-hours 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接提取指标EMP_TOUR_SEX_HOW_NB的原始数据,并依据ISO 3166-1 alpha-3编码过滤出亚洲23个国家的观测值。ILOSTAT在数据整合过程中采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化处理,同时保留source.label列以标注数据来源的原始调查类型(如劳动力调查、家庭收入调查等),确保数据的可追溯性与国际可比性。最终由Electric Sheep Asia团队将上述数据重新封装为Parquet格式的高效数据集,便于机器学习的直接调用。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并将其转换为pandas DataFrame进行后续分析。针对单国别分析,可利用ref_area字段按ISO国家代码快速筛选;时序分析则可基于indicator字段过滤后按time字段排序,并绘制obs_value的变化趋势。数据集还支持通过pivot_table方法轻松重构为国家×年份的矩阵视图,适用于面板数据回归或横向比较研究。数据的使用需遵循CC-BY 4.0许可协议,引用时需同时注明ILO原始来源与Electric Sheep Asia的重新封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年创建,由Electric Sheep Asia重新打包并发布于HuggingFace平台。数据集聚焦亚洲23个国家的旅游业就业情况,涵盖2010年至2025年间的2475条观测记录,核心指标为按性别和实际周工作时间划分的旅游业就业人数(单位:千人)。研究旨在通过ILOSTAT这一全球权威劳工统计数据库,系统追踪亚洲地区旅游业劳动力市场的动态变化,为政策制定者、经济学家和社会学者提供跨国家、跨时间维度的标准化数据基础。作为ILO推动体面劳动与可持续发展目标(SDG)的重要数据资源,该数据集在劳工统计、旅游经济及性别平等研究领域具有显著影响力。
当前挑战
数据构建面临多重挑战:首先,亚洲各国旅游业统计口径、调查周期及数据采集方法存在显著差异,例如部分国家依赖劳动力调查(LFS),而另一些国家采用行政记录,导致跨国家可比性受限。其次,原始数据包含多个来源及修订标志(如方法论变更导致的序列中断),需仔细甄别处理。此外,数据按年发布,无法捕捉月度或季度内的波动细节,且部分年份的观测值被标记为‘不可靠’,增加了建模和预测的不确定性。最后,数据稀疏性问题突出——如马尔代夫仅43条记录,限制了国家层面的深度时序分析能力。
常用场景
经典使用场景
在国际劳工组织(ILO)的统计框架下,该数据集聚焦于亚洲23个国家2010至2025年间旅游业就业人口的性别结构及实际周工作时长分布。其经典用法在于作为面板数据基础,支持学者开展跨国家、跨时段的横向比较研究与纵向趋势分析。研究人员可借助该数据集构建回归模型,探究旅游业发展水平、性别平等政策与就业质量之间的内在关联,亦可结合宏观经济指标,剖析亚洲不同经济体在旅游就业弹性上的异质性特征。
解决学术问题
该数据集的推出系统性地回应了亚洲旅游业劳动力市场研究中长期存在的微观数据匮乏与跨国可比性不足的困境。通过提供按性别与工作时长双重维度细分的就业数据,它使学者得以精准刻画女性在旅游就业中的边缘化程度、非正规就业现象以及‘工作贫困’风险。这些分析为检验性别工资差距、劳动时间不平等及旅游经济包容性增长等理论假设提供了实证基础,推动了发展经济学与劳动经济学的交叉研究。
实际应用
在实际应用中,该数据集可服务于国际组织、国家劳动部门及旅游业协会的政策制定与项目评估。例如,基于数据中反映的女性就业比例与周工作时长波动,政策制定者可识别出性别敏感度较低的旅游就业环节,从而设计更具包容性的职业培训计划与工时法规。此外,旅游企业亦可参考该数据优化人力资源配置,在旅游旺季与淡季之间平衡不同性别劳动力的调度,提升行业整体的运营效率。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲23国旅游业就业按性别与周工时划分的多年面板数据(2010–2025年),为劳动力市场性别差异分析、旅游业复苏追踪及政策评估提供了高颗粒度的时序基础。结合ILOSTAT的标准化采集方法,当前研究方向正从描述性统计转向因果推断与预测建模,如利用机器学习方法解析工时波动与旅游收入、宏观经济冲击的关联,或通过性别维度揭示亚洲旅游业的隐性就业结构。数据的时间跨度覆盖了新冠疫情对旅游业的严重冲击与后续恢复过程,使其成为评估不同国家旅游业就业韧性及性别差异的珍贵资源,尤其在计算可持续旅游指标与SDGs体面工作目标中具有关键引用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务