遇见数据集

electricsheepasia/asia-ilo-emp-tpif-sex-rt-share-of-tourism-sector-employment-outside-the-for

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲20个国家从2008年至2025年期间,旅游业就业在正规部门外占比(%)的264个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖了EMP_TPIF_SEX_RT这一指标,用于衡量旅游业工作者在非正规部门的就业比例。数据集包括国家代码、年份、性别分类(总计、男性、女性)、观测值及其状态等字段,并经过Electric Sheep Asia重新打包,以提供一致的机器学习就绪格式。

--- 许可证:CC BY 4.0 语言: - 英语 任务类别: - 表格分类 - 表格回归 - 时间序列预测 多语言属性:单语言 数据规模: - 样本量小于1000 标签: - 表格型数据 - 亚洲 - ILOSTAT(国际劳工组织统计数据库) - 旅游业就业人员 - ILO(国际劳工组织) - 劳工 - 就业 漂亮名称:"亚洲非正规部门旅游业就业占比(%)| 基于ILOSTAT数据" --- # 亚洲非正规部门旅游业就业占比(%)| 基于ILOSTAT数据 🌏 **共264条观测值** · **覆盖20个亚洲国家** · **时间跨度为2008–2025年** · *由[Electric Sheep Asia](https://huggingface.co/electricsheepasia)重新整理发布* ![数据行数](https://img.shields.io/badge/rows-264-blue) ![覆盖国家数](https://img.shields.io/badge/countries-20-green) ![时间跨度](https://img.shields.io/badge/years-2008–2025-orange) ![指标数量](https://img.shields.io/badge/indicators-1-purple) ![许可证](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 快速概览(TL;DR) 本数据集包含覆盖**20个亚洲国家、时间跨度2008–2025年**的**旅游业就业人员**相关数据,共计**264条观测值**,仅包含1项独立指标。 ## 数据源说明 **ILOSTAT(国际劳工组织统计数据库)**是国际劳工组织(ILO)的核心统计数据库,也是全球领先的劳工统计权威数据源。该数据库整合了就业、失业、薪资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标体面工作目标等多类指标,数据来源涵盖全国劳动力调查、住户收入调查、企业调查及行政记录。其覆盖范围超过200个经济体,数据的标准化工作由国际劳工组织统计部门负责完成。 - **原始数据源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_TPIF_SEX_RT) - **发布方**:国际劳工组织(ILO) - **许可证**:[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/) - **研究主题**:旅游业就业人员 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EMP_TPIF_SEX_RT`获取,并筛选出亚洲地区的ISO 3166-1 alpha-3国家代码对应的数据。ILOSTAT采用ICLS(国际劳工统计学家会议)的定义对原始调查微观数据进行标准化处理;数据来源的标识信息存储在`source.label`字段中,以保证可追溯性。 ## 地理覆盖范围 覆盖20个亚洲国家,以下为按数据行数排序的前15个国家及相关信息: | 国家代码 | 数据行数 | 起始年份 | 结束年份 | |---------|-----:|-----------:|----------:| | `MNG` | 42 | 2008 | 2024 | | `LKA` | 36 | 2013 | 2024 | | `VNM` | 33 | 2013 | 2024 | | `THA` | 30 | 2014 | 2024 | | `BRN` | 24 | 2017 | 2024 | | `PAK` | 18 | 2014 | 2025 | | `MMR` | 15 | 2015 | 2020 | | `BGD` | 12 | 2017 | 2024 | | `GEO` | 12 | 2021 | 2024 | | `TLS` | 6 | 2013 | 2021 | | `MDV` | 6 | 2016 | 2019 | | `KHM` | 6 | 2012 | 2019 | | `AFG` | 3 | 2021 | 2021 | | `LAO` | 3 | 2022 | 2022 | | `IND` | 3 | 2012 | 2012 | | …… | _另有5个国家_ | | | ## 指标示例 - `EMP_TPIF_SEX_RT` — 非正规部门旅游业就业占比(%) ## 数据结构 | 字段名 | 数据类型 | 字段说明 | 示例值 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3国家代码 | `AFG` | | `ref_area.label` | `string` | 英文国家名称 | `Afghanistan` | | `source` | `string` | ILOSTAT数据源代码(如劳动力调查) | `BA:15715` | | `source.label` | `string` | 英文数据源名称 | `LFS - 劳动力调查` | | `indicator` | `string` | ILOSTAT指标代码 | `EMP_TPIF_SEX_RT` | | `indicator.label` | `string` | 英文指标名称 | `Share of tourism sector employment ou…` | | `sex` | `string` | 性别细分维度(SEX_T=总计,SEX_M=男性,SEX_F=女性) | `SEX_T` | | `sex.label` | `string` | — | `总计` | | `time` | `int64` | 观测年份 | `2021` | | `obs_value` | `float64` | 观测指标值(单位详见指标定义) | `29.954` | | `obs_status` | `string` | 观测状态标记(如暂定、不可靠) | `U` | | `obs_status.label` | `string` | — | `不可靠` | | `note_indicator` | `string` | — | `I11:264` | | `note_indicator.label` | `string` | — | `序列中断:方法学修订` | | `note_source` | `string` | — | `R1:3513_S3:8` | | `note_source.label` | `string` | — | `存储库:ILO统计数据库 - 微观数据……` | ## 细分维度 以下字段提供数据细分维度: - **`sex`**(共3个唯一取值):`SEX_T`(总计)、`SEX_M`(男性)、`SEX_F`(女性) ## 数据质量与注意事项 - 本数据集采用年度频率数据。部分指标同时发布月度或季度序列数据,此类数据未包含在本数据集中。 - 若同一国家×年份的同一指标存在多个数据源,将采用国际劳工组织选定的“最优数据源”。 - 仅当指标支持对应细分维度时,细分字段(`sex`、`classif1`、`classif2`)才会有非空值。 ## 使用示例 python from datasets import load_dataset ds = load_dataset("electricsheepasia/asia-ilo-emp-tpif-sex-rt-share-of-tourism-sector-employment-outside-the-for") df = ds["train"].to_pandas() print(df.head()) ### 筛选单个国家 python indonesia = df[df["ref_area"] == "IDN"] ### 单个指标的时间序列数据 python sample = (df[df["indicator"] == "EMP_TPIF_SEX_RT"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EMP_TPIF_SEX_RT") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EMP_TPIF_SEX_RT"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{asia_ilo_emp_tpif_sex_rt_share_of_tourism_sector_employment_outside_the_for_2025, title = {Share of tourism sector employment outside the formal sector (%) | Asia (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_TPIF_SEX_RT}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Asia}, howpublished = {url{https://huggingface.co/datasets/electricsheepasia/asia-ilo-emp-tpif-sex-rt-share-of-tourism-sector-employment-outside-the-for}} } ## 许可证 本数据集采用[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)许可证发布。原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源及Electric Sheep Asia的重新整理版本。 ## 关于Electric Sheep Electric Sheep是Electric Sheep项目的组成部分,旨在构建一个统一的、适用于机器学习的亚洲地区数据层,托管于HuggingFace平台。我们从权威开放数据源获取数据,对数据Schema进行标准化处理,打包为Parquet格式,并发布为格式统一的数据集卡片,以便研究人员和开发者通过`load_dataset()`函数在数秒内完成数据加载与使用。 浏览完整数据集集合:[huggingface.co/electricsheepasia](https://huggingface.co/electricsheepasia) --- _数据溯源:2026年5月28日通过Electric Sheep数据流水线获取。源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EMP_TPIF_SEX_RT_

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-tpif-sex-rt-share-of-tourism-sector-employment-outside-the-for 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于亚洲地区旅游部门非正规就业的占比情况。数据通过ILOSTAT的REST API直接获取,具体从`https://rplumber.ilo.org/data/indicator?id=EMP_TPIF_SEX_RT`接口拉取,并依据亚洲ISO3国家代码进行筛选。原始数据由ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调处理,涵盖各国劳动力调查、家庭收入调查等多项来源,数据来源标识在`source.label`列中可追溯。最终由Electric Sheep Asia团队重新打包为便于机器学习使用的格式。
特点
该数据集包含264条观测记录,覆盖20个亚洲国家,时间跨度从2008年至2025年,聚焦于一个核心指标——旅游部门非正规就业占比。数据按性别进行细分,提供男性、女性及总计三个维度。每条记录包含国家代码、指标名称、观测值、数据来源及状态标记等丰富元数据,并标注了序列中断等质量备注。数据频率为年度,且采用ILO选定的‘最佳来源’以消除同一国家年份的多源冲突。整体结构简洁,便于进行时间序列分析与跨国家比较。
使用方法
用户可通过HuggingFace的`datasets`库轻松加载数据集,调用`load_dataset()`函数即可获取数据,并转换为Pandas DataFrame进行后续操作。支持按国家代码筛选特定国家数据,例如过滤印度尼西亚的观测值。同时,可依据指标代码进行时间序列分析,通过排序和绘图直观展示趋势。此外,利用`pivot_table`功能可将数据重塑为国家×年份的矩阵格式,便于进行面板数据分析或构建回归模型。数据集兼容表格分类、回归及时间序列预测等多种机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库创建,并由Electric Sheep Asia在HuggingFace平台上重新封装发布,聚焦于亚洲20个国家2008至2025年间旅游业非正规部门就业占比的指标(EMP_TPIF_SEX_RT)。作为全球劳动统计的权威来源,ILOSTAT通过统一国际劳动统计学家会议(ICLS)定义,整合各国劳动力调查、行政记录等多源数据,为理解旅游业这一劳动密集型行业的就业结构提供关键量化工具。旅游业在亚洲许多经济体中占据重要地位,但其非正规就业形态的普遍性长期缺乏系统性的跨国可比数据,该数据集弥补了这一空白,为政策制定者、经济学家和可持续发展研究者评估旅游业对体面劳动目标的贡献、识别区域差异及推动正式化转型提供了基础性资源。
当前挑战
该数据集面临的核心挑战在于解决旅游业非正规就业测度的领域难题:非正规部门界定标准因国家而异,导致跨国比较的语义一致性存疑;旅游业就业本身具有季节性、临时性和兼职属性,年度高频数据难以捕捉短期波动。在构建过程中,挑战尤为突出:ILO需从各国差异化的调查框架中协调数据,例如劳动力调查与行政记录的覆盖范围与定义偏差,数据标记如“不可靠”或“序列中断”频繁出现(例如注释字段中标注的方法修订);来源字段显示部分国家数据来自不同调查(如BA:15715与R1:3513),增加了时间序列断裂的风险。此外,样本量极小(总计264条观测,如阿富汗仅3条)与年份缺失(如印度仅2012年数据)限制了统计推断的稳健性,而20个国家的不均匀覆盖(如蒙古42条对比老挝3条)可能引入选择偏倚,影响区域整体推断的代表性。
常用场景
经典使用场景
在劳动经济学与旅游研究的交叉领域中,该数据集作为衡量亚洲各国旅游业非正规就业比例的核心工具,被广泛用于时间序列分析与面板数据建模。研究者通常利用其包含的264条年度观测记录,覆盖2008至2025年间20个亚洲国家,通过指标‘EMP_TPIF_SEX_RT’追踪旅游业中非正规部门就业份额的演变趋势。经典使用方式包括单一国家的趋势分析、跨国比较的纵向研究,以及按性别分组的差异探讨,从而揭示旅游业就业质量的结构性变化。
实际应用
在政策制定与国际比较实践中,该数据集为国际劳工组织(ILO)、各国劳动部门及旅游管理机构提供了关键决策依据。通过监测非正规就业比例的时间变化,政策制定者能够识别旅游业就业脆弱性的高发年份与区域,进而设计针对性的正规化激励措施,如简化企业注册流程或提供社会保障延伸方案。对于旅游企业而言,数据集揭示了不同性别群体的就业形态差异,有助于优化员工权益保护策略。此外,非政府组织利用该数据评估旅游扶贫项目的实际效果,推动体面工作在旅游价值链中的落实。
衍生相关工作
该数据集已衍生出若干具有影响力的学术与应用成果。在方法论层面,它被用于构建融合多元劳动力调查来源的面板数据集,推动了ILOSTAT数据标准化流程的优化。在实证研究方面,基于该数据的工作揭示了东南亚国家旅游业非正规就业与性别不平等之间的共生关系,并催生了旅游就业正规化转型的计量经济模型。同时,该数据集作为Electric Sheep Asia系列的一部分,启发了面向亚洲区域的统一、机器学习就绪数据层的构建理念,为后续跨领域劳动力数据集的整合与发布树立了可复用的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务