VietTravelVQA
收藏资源简介:
VietTravelVQA 是一个面向越南旅游和文化遗产的越南语视觉问答数据集。该数据集包含 1,406 张图片和 7,030 个经人工验证的问答对,按难度分为五个等级,从基础的视觉识别到文化推理。数据来源于 Wikimedia Commons,由专家标注员创建关于建筑细节、历史意义和空间推理的越南语问答对,并通过自动一致性检查和大规模多模态模型辅助事实审计,最终经人工验证。数据集划分为训练集和测试集,训练集包含 1,406 个对话(6,094 个问答对),测试集包含 678 个对话(936 个问答对),总对话数为 2,084,问答对总数为 7,030,图片总数为 1,406 张(不重复)。数据以 Parquet 格式存储,每条记录包含 messages(多轮对话格式的问答对)、images(嵌入的图片字节)、difficult(难度等级数组)和 source(来源信息)四个字段。该数据集可用于训练、微调和评估越南语旅游与文化内容的视觉语言模型,特别适用于视觉问答、本地化文化推理以及按难度级别进行评估。
VietTravelVQA is a Vietnamese visual question answering dataset focused on Vietnamese tourism and cultural heritage. The dataset contains 1,406 images and 7,030 manually verified question-answer pairs, divided into five difficulty levels, ranging from basic visual recognition to cultural reasoning. The data comes from Wikimedia Commons, created by expert annotators who produce Vietnamese question-answer pairs about architectural details, historical significance, and spatial reasoning, and undergo automatic consistency checks and large-scale multimodal model-assisted fact verification, finally verified by humans. The dataset is split into training and test sets, with the training set containing 1,406 dialogs (6,094 QA pairs), the test set containing 678 dialogs (936 QA pairs), totaling 2,084 dialogs, 7,030 QA pairs, and 1,406 unique images. The data is stored in Parquet format, with each record containing four fields: messages (QA pairs in multi-turn dialog format), images (embedded image bytes), difficult (array of difficulty levels), and source (source information). This dataset can be used for training, fine-tuning, and evaluating vision-language models for Vietnamese tourism and cultural content, particularly suitable for visual question answering, localized cultural reasoning, and evaluation by difficulty level.
数据集概述
VietTravelVQA 是一个面向越南旅游与文化遗产领域的越南语视觉问答(Visual Question Answering)数据集,包含 1,406 张图片和 7,030 个经人工验证的问答对,按难度分为五个等级,涵盖从基础视觉识别到文化推理的多种任务。
数据集规模与划分
| 划分 | 对话/问答对数量 | 图片数量 |
|---|---|---|
| 训练集 | 6,094 | 1,406 张(唯一) |
| 测试集 | 936 | 678 张(唯一) |
| 总计 | 7,030 | 1,406 张(唯一) |
划分基于问答对进行,同一张图片可能同时出现在训练集和测试集中。
数据格式
- 数据文件为 Parquet 格式,训练集包含 49 个分片,测试集包含 8 个分片。
- 每条记录包含四个字段:
messages、images、difficult、source。 messages存储用户与助手的问答对话,其中包含文本与图片引用。images直接嵌入图片字节。difficult表示该问答对的难度等级。source记录图片来源平台、许可证及原始链接。
难度等级
数据涵盖五个复杂度等级,从直接感知、物体识别,到空间推理、历史与文化背景推理。
数据构建与验证
- 图片来源于 Wikimedia Commons。
- 专家标注员创建了涉及建筑细节、历史意义、空间推理的越南语问答对。
- 自动化一致性检查用于同步标注与图片文件。
- 使用大型多模态模型辅助事实核查,并经过人工验证。
预期用途
适用于越南旅游与文化遗产内容的视觉语言模型训练、微调与评估,包括视觉问答、本地化文化推理以及跨难度等级的评估。
局限性
- 内容聚焦于越南旅游与文化遗产,不能代表所有越南视觉语言应用场景。
- 模型辅助审核不能保证每条标注均无事实或语言错误。
- 由于划分基于问答对,训练集与测试集可能引用相同图片;若需图片不相交的划分,应基于嵌入图片重新构建数据集。
许可证与引用
- 数据集采用 Creative Commons Attribution 4.0 International 许可证。
- 图片来自 Wikimedia Commons,保留原始来源许可证和署名要求。
- 官方发布版本存档于 Mendeley Data(版本 2),DOI 为
10.17632/fvxtpnh8mh.2,原始图片级元数据请参阅该发布版本。
贡献者
- Nguyen Van Nha
- Phung The Huan
- Phu Nguyen Dinh
- Le Hong Quan
- Truong Quoc Huy
- Pham Khanh Duy
- Le Minh Tuan
- Le Hoang Son




