遇见数据集

VietTravelVQA

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

VietTravelVQA 是一个面向越南旅游和文化遗产的越南语视觉问答数据集。该数据集包含 1,406 张图片和 7,030 个经人工验证的问答对,按难度分为五个等级,从基础的视觉识别到文化推理。数据来源于 Wikimedia Commons,由专家标注员创建关于建筑细节、历史意义和空间推理的越南语问答对,并通过自动一致性检查和大规模多模态模型辅助事实审计,最终经人工验证。数据集划分为训练集和测试集,训练集包含 1,406 个对话(6,094 个问答对),测试集包含 678 个对话(936 个问答对),总对话数为 2,084,问答对总数为 7,030,图片总数为 1,406 张(不重复)。数据以 Parquet 格式存储,每条记录包含 messages(多轮对话格式的问答对)、images(嵌入的图片字节)、difficult(难度等级数组)和 source(来源信息)四个字段。该数据集可用于训练、微调和评估越南语旅游与文化内容的视觉语言模型,特别适用于视觉问答、本地化文化推理以及按难度级别进行评估。

VietTravelVQA is a Vietnamese visual question answering dataset focused on Vietnamese tourism and cultural heritage. The dataset contains 1,406 images and 7,030 manually verified question-answer pairs, divided into five difficulty levels, ranging from basic visual recognition to cultural reasoning. The data comes from Wikimedia Commons, created by expert annotators who produce Vietnamese question-answer pairs about architectural details, historical significance, and spatial reasoning, and undergo automatic consistency checks and large-scale multimodal model-assisted fact verification, finally verified by humans. The dataset is split into training and test sets, with the training set containing 1,406 dialogs (6,094 QA pairs), the test set containing 678 dialogs (936 QA pairs), totaling 2,084 dialogs, 7,030 QA pairs, and 1,406 unique images. The data is stored in Parquet format, with each record containing four fields: messages (QA pairs in multi-turn dialog format), images (embedded image bytes), difficult (array of difficulty levels), and source (source information). This dataset can be used for training, fine-tuning, and evaluating vision-language models for Vietnamese tourism and cultural content, particularly suitable for visual question answering, localized cultural reasoning, and evaluation by difficulty level.

创建时间:
2026-08-05
原始信息汇总

数据集概述

VietTravelVQA 是一个面向越南旅游与文化遗产领域的越南语视觉问答(Visual Question Answering)数据集,包含 1,406 张图片7,030 个经人工验证的问答对,按难度分为五个等级,涵盖从基础视觉识别到文化推理的多种任务。

数据集规模与划分

划分 对话/问答对数量 图片数量
训练集 6,094 1,406 张(唯一)
测试集 936 678 张(唯一)
总计 7,030 1,406 张(唯一)

划分基于问答对进行,同一张图片可能同时出现在训练集和测试集中。

数据格式

  • 数据文件为 Parquet 格式,训练集包含 49 个分片,测试集包含 8 个分片。
  • 每条记录包含四个字段:messagesimagesdifficultsource
  • messages 存储用户与助手的问答对话,其中包含文本与图片引用。
  • images 直接嵌入图片字节。
  • difficult 表示该问答对的难度等级。
  • source 记录图片来源平台、许可证及原始链接。

难度等级

数据涵盖五个复杂度等级,从直接感知、物体识别,到空间推理、历史与文化背景推理。

数据构建与验证

  • 图片来源于 Wikimedia Commons
  • 专家标注员创建了涉及建筑细节、历史意义、空间推理的越南语问答对。
  • 自动化一致性检查用于同步标注与图片文件。
  • 使用大型多模态模型辅助事实核查,并经过人工验证。

预期用途

适用于越南旅游与文化遗产内容的视觉语言模型训练、微调与评估,包括视觉问答、本地化文化推理以及跨难度等级的评估。

局限性

  • 内容聚焦于越南旅游与文化遗产,不能代表所有越南视觉语言应用场景。
  • 模型辅助审核不能保证每条标注均无事实或语言错误。
  • 由于划分基于问答对,训练集与测试集可能引用相同图片;若需图片不相交的划分,应基于嵌入图片重新构建数据集。

许可证与引用

  • 数据集采用 Creative Commons Attribution 4.0 International 许可证。
  • 图片来自 Wikimedia Commons,保留原始来源许可证和署名要求。
  • 官方发布版本存档于 Mendeley Data(版本 2),DOI 为 10.17632/fvxtpnh8mh.2,原始图片级元数据请参阅该发布版本。

贡献者

  • Nguyen Van Nha
  • Phung The Huan
  • Phu Nguyen Dinh
  • Le Hong Quan
  • Truong Quoc Huy
  • Pham Khanh Duy
  • Le Minh Tuan
  • Le Hoang Son
搜集汇总
数据集介绍
VietTravelVQA 数据集图片
构建方式
VietTravelVQA 数据集的构建植根于对越南旅游与文化遗传的深刻洞察,其图像资料均源自维基共享资源(Wikimedia Commons),确保了视觉素材的丰富性与合法性。专家标注者围绕建筑细节、历史意义及空间推理等维度,精心撰写了越南语问答对,并设计了一套覆盖从基础视觉识别到文化推理的五级难度体系。为确保数据质量,团队实施了自动化一致性校验,并引入大型多模态模型辅助事实核查,最终经由人工审核敲定,形成了包含1,406张图像与7,030个问答对的高质量数据集。
特点
该数据集的核心特质在于其多模态与领域专精性,聚焦越南旅游与文化遗传,并采用分层难度设计,使模型能够阶梯式地学习从直接感知到文化推理的认知过程。每一条问答对均包含嵌入的图像字节与难度标签,来源信息完整可溯,且在划分上以问答对为单位,允许同一图像在训练与测试集中出现,为跨难度评估与模型泛化能力测试提供了独特视角。数据集的规模适中,结构紧凑,是越南语视觉问答领域不可多得的基准资源。
使用方法
针对 VietTravelVQA 的使用,研究者可直接加载其 HuggingFace 仓库中的 Parquet 分片文件,其中训练集含49个文件、测试集含8个文件,每行包含 messages、images、difficult 与 source 四列。该数据集适用于视觉语言模型的微调与评估,特别是面向越南语旅游文化场景的视觉问答与地域性文化推理任务。值得注意的是,由于同一图像可能跨集出现,需严格评估协议者应按图像重新划分,以确保图像级分离。使用时务必遵循 CC-BY-4.0 许可,并引用其权威的 Mendeley Data 版本。
背景与挑战
背景概述
随着多模态人工智能技术的飞速发展,视觉问答(VQA)作为连接计算机视觉与自然语言处理的关键任务,日益受到学术界与工业界的广泛关注。然而,现有VQA数据集多聚焦于英语等主流语言,针对特定地域文化背景的视觉语言资源依然匮乏。在此背景下,VietTravelVQA数据集于2026年由越南研究团队创建,主要贡献者包括Nguyen Van Nha、Phung The Huan、Phu Nguyen Dinh等学者,其核心研究问题在于构建一个面向越南旅游与文化遗址的视觉问答基准,以填补低资源语言在多模态理解领域的研究空白。该数据集包含1,406张图像与7,030个人工验证的问答对,涵盖从基础视觉识别到文化推理的五个难度层级,为越南语视觉语言模型的训练与评估提供了宝贵资源,对推动区域文化特色的多模态研究具有重要影响力。
当前挑战
VietTravelVQA数据集的构建与应用面临着多重挑战。首先,在领域问题层面,视觉问答任务本身需融合精准的视觉感知与深层的语义理解,尤其在处理越南丰富的建筑细节、历史背景及空间关系时,模型需具备跨模态推理能力,而现有通用VQA模型在越南语文化语境中常出现理解偏差。其次,在数据集构建过程中,图像来源的多样性(取自Wikimedia Commons)与版权合规性增加了数据整理的复杂度,需严格遵循CC-BY-SA等许可要求。此外,专家标注者需在确保问题回答准确性的同时,设计涵盖不同难度级别的问答对,并借助大型多模态模型进行事实审核,但自动审核难以完全消除潜在的语言或事实错误,最终仍需人工复核以确保数据质量,这些环节均对数据集的科学严谨性提出了极高要求。
常用场景
经典使用场景
VietTravelVQA作为面向越南语旅游与文化领域的视觉问答数据集,其核心应用场景在于训练和评估多模态大语言模型在越南语环境下的细粒度视觉理解与推理能力。该数据集精心设计了从基础物体识别到空间关系推理、历史背景剖析及文化内涵解读的五级难度体系,为研究者提供了系统化的评测基准。凭借其涵盖建筑细节、历史遗迹及空间布局的高质量问答对,该数据集成为推动越南语视觉问答技术发展、促进低资源语言多模态研究的关键资源,尤其适用于探索跨模态对齐、文化特异性理解及复杂场景推理等前沿课题。
实际应用
在实际应用层面,VietTravelVQA为越南智慧旅游和文化遗产数字化保护提供了关键技术支撑。该系统可赋能智能旅游助手,实现基于图像的景点识别、历史讲解和文化问答,提升游客的个性化导览体验;亦可应用于文化遗产的自动化标注和知识库构建,支持文物建筑、传统艺术等内容的智能检索与教育传播。通过对旅游场景中空间关系、建筑细节等复杂问题的准确回应,该数据集训练的模型能有效服务于增强现实导览、多语言旅游服务平台及文旅内容审核,展现出在旅游产业数字化转型中的广阔应用前景,兼具文化传承与商业价值。
衍生相关工作
VietTravelVQA的发布催生了多项衍生研究,深刻影响了越南语视觉语言领域的发展方向。其多级难度设计和结构化标注启发了一系列针对文化推理能力评估的基准构建工作,推动了视觉问答任务从通用场景向特定文化语境的拓展。数据集中的细粒度问答对成为微调越南语多模态大语言模型(如PhoGPT系列)的宝贵训练语料,显著促进了低资源语言视觉指令模型的性能提升。此外,其基于大模型辅助审核与人工验证相结合的数据构建流程,为后续研究提供了可复制的高效标注范式,并衍生出关于多模态事实核查、跨语言知识迁移及评测协议设计等方向的学术探索,形成了一个活跃且富有成果的研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务