遇见数据集

electricsheepasia/asia-ilo-emp-tpif-sex-nb-tourism-sector-employment-outside-the-formal-secto

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲20个国家从2008年至2025年关于旅游部门非正规部门就业(以千人为单位)的264个观测值,覆盖1个具体指标(EMP_TPIF_SEX_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API获取并过滤到亚洲国家代码,涉及就业、性别分类(总计、男性、女性)等维度,并包含数据源、观测状态和注释等信息。数据集以表格形式提供,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 264 observations of tourism sector employment outside the formal sector (in thousands) across 20 Asia countries from 2008 to 2025, covering one specific indicator (EMP_TPIF_SEX_NB). The data is sourced from the International Labour Organization (ILO)s ILOSTAT statistical database, retrieved via REST API and filtered to Asia country codes, and includes dimensions such as employment, sex disaggregation (total, male, female), along with data source, observation status, and notes. The dataset is provided in tabular format and is suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-tpif-sex-nb-tourism-sector-employment-outside-the-formal-secto 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,通过调用其REST API直接拉取指标代码为EMP_TPIF_SEX_NB的原始数据,并依据亚洲ISO3国家代码进行地理范围过滤。数据抽取后,由Electric Sheep Asia团队进行标准化重封装,统一转为Parquet格式,确保可直接通过HuggingFace Datasets库加载。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行协调,并在source.label列中标注数据来源,保证了从原始采集到最终聚合的全链条可追溯性。
特点
该数据集聚焦于亚洲20个国家2008至2025年间非正规部门旅游业就业人数的年度观测,共计264条记录,是ILO劳动统计中一个极为细分的指标。其核心特点在于通过性别维度(总、男、女)进行拆解,并附带了观测状态标签(如“不可靠”)及系列中断等注释信息,支持用户准确评估数据质量。数据集的模式设计严谨,包含国家代码、来源代码、指标定义、时间戳及观测值等16个字段,既保留了ILOSTAT官方结构的完整性,又经过精简打包,便于时间序列分析和面板数据建模。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset()函数一步加载数据,并直接转换为pandas DataFrame进行后续操作。典型用法包括按国别代码过滤特定国家子集,对单一指标按时间排序并可视化其长期趋势,以及利用透视表工具将数据重塑为国家×年份的矩阵格式,以便进行跨国的面板数据分析。由于数据以年度频率呈现,并包含了性别拆解和观测状态标记,研究者可直接在回归分析或时间序列预测模型中将其作为输入特征,或用于评估亚太地区旅游业非正规就业的演变模式。
背景与挑战
背景概述
在劳动经济学与旅游业可持续发展研究领域,非正规部门就业的量化分析长期受限于数据碎片化与跨国不可比性。国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布了该数据集,由Electric Sheep Asia团队重新封装为机器学习就绪格式。该数据集聚焦亚洲20国2008-2025年间旅游行业非正规部门就业规模(以千人为单位),共计264条观测记录,旨在填补亚洲区域旅游业非正规就业系统性数据的空白。作为ILO促进体面工作与可持续旅游目标的重要数据基础设施,该数据集为跨国比较、非正规经济建模及政策评估提供了标准化依据,对发展经济学与旅游学交叉领域具有显著推动价值。
当前挑战
其所面临的挑战首先体现在领域问题层面:旅游行业非正规就业的统计标准不统一,各国对“非正规部门”的定义差异显著,导致指标可比性存疑;此外,非正规就业数据的获取依赖劳动力调查,但亚洲多国调查频率低、覆盖样本有限,难以捕捉季节性旅游用工波动。在构建过程中,数据整合面临多重困难:需通过ILOSTAT REST API从分散的国家来源拉取数据并筛选亚洲国家,不同调查间存在方法论修订与断点问题;部分国家观测值极少或年份稀疏(如阿富汗仅3条记录),且数据质量标识(如“不可靠”状态)增加了模型训练时的噪声处理难度。
常用场景
经典使用场景
该数据集的核心价值在于为亚洲地区非正规旅游部门就业的时序与横截面分析提供了标准化、可复用的数据基础。研究者常将其用于构建面板数据模型,以探究2008至2025年间20个亚洲国家旅游业非正规就业的演变趋势,并结合性别维度(总就业、男性、女性)进行细分比较。具体而言,经典用法包括:利用时间序列分析揭示各国非正规旅游就业的季节性与长期波动规律;通过固定效应或随机效应模型检验旅游业发展、经济增长与就业非正规化之间的因果关系;以及运用聚类分析识别亚洲各国在该指标上的异质性模式,为后续政策模拟与预测研究奠定数据基石。
实际应用
在实际应用层面,该数据集为国际组织、国家统计部门与旅游政策制定者提供了不可或缺的决策支持工具。国际劳工组织(ILO)可借此监测亚太地区可持续发展目标(SDGs)中关于体面劳动与旅游业包容性增长的具体进展,特别是评估非正规就业对劳动者社会保障覆盖的影响。各国劳动部门能够通过对比邻国数据,识别本国旅游业非正规就业的特殊规律,从而设计更具针对性的正式化促进政策,例如优化小微企业注册流程或提供定向培训补贴。此外,旅游行业协会与跨国咨询公司可将其作为商业情报输入,在评估区域旅游投资风险时,将非正规就业比例纳入市场成熟度与劳动力合规性指标体系,辅助投资目的地选择与人力资本战略制定。
衍生相关工作
该数据集作为标准化的亚洲旅游非正规就业时序资料,已催生出多项具有影响力的衍生研究工作。依托其稳定的数据管道,研究者得以训练面向非正规就业预测的时序深度学习模型,如长短期记忆网络(LSTM)与Transformer,实现了对2025年之后各国就业趋势的概略预报。在因果推断领域,学者利用该数据集构建了双重差分(DID)模型和工具变量回归框架,量化了新冠疫情、政策干预及全球旅游业冲击对亚洲非正规就业的动态影响。进一步地,该数据被整合进多模态劳动经济分析平台,与旅游业GDP、国际游客到达量等外生变量联合,支撑了关于非正规就业与宏观经济波动之间传导机制的仿真研究。此外,若干知名经济学预印本将其作为核心数据源,开展了针对性别平等与就业质量之间交互效应的前沿探索,推动了非正规就业领域从描述性统计向结构性成因分析的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务