andreidima/Flickr30K-RoQA-v1
收藏官方服务:
资源简介:
--- dataset_info: features: - name: file_name dtype: string - name: caption list: string - name: question dtype: string - name: answer dtype: string - name: image dtype: image splits: - name: train num_bytes: 3546900517 num_examples: 25426 - name: test num_bytes: 885610228 num_examples: 6357 download_size: 4407661173 dataset_size: 4432510745 configs: - config_name: default data_files: - split: train path: data/train-* - split: test path: data/test-* ---
提供机构:
andreidima搜集汇总
数据集介绍
构建方式
Flickr30K-RoQA-v1是首个面向罗马尼亚语的视觉问答语料库,其构建基于Flickr30K数据集。首先,由三位母语为罗马尼亚语的译者将全部158,915条英文描述翻译为罗马尼亚语。随后,利用LLaMA 3.3 70B大语言模型,以每张图像的多条描述为条件,自动生成问答对。训练集包含25,426个样本,完全由合成方式产生;测试集则包含6,357个样本,经过人工校对与归一化处理,以修正合成错误并确保答案的视觉关联性、语法正确性及完整句式表达。
特点
该数据集整合了31,783张图像,每张图像对应五条由人工翻译的罗马尼亚语描述,并配备一个视觉问答对。其双分结构别具匠心:训练集依托大模型合成以覆盖广泛场景,测试集则经人工精修以保障评估的可靠性。数据涵盖对象识别、数量统计、空间关系及动作描述等多样推理维度,为罗马尼亚语视觉语言模型提供了全面的指令微调与评测基础。
使用方法
通过HuggingFace的datasets库可便捷加载,需预先安装datasets与pillow库。使用时调用load_dataset函数即获取包含train与test两个子集的数据对象。每个样本包含图像文件标识符(file_name)、五条罗马尼亚语描述(caption)、问题(question)及答案(answer),图像以PIL格式呈现。该数据集适用于视觉问答任务的微调与评估,已有多项实验基于LLaMA、LLaVA及Qwen2-VL等模型,采用LoRA方法适配,有效提升了罗马尼亚语场景下的推理表现。
背景与挑战
背景概述
在视觉语言模型(VLM)蓬勃发展的浪潮中,多模态指令微调已成为提升模型跨模态理解与生成能力的关键范式。然而,现有大规模视觉问答(VQA)数据集多集中于英语等高资源语言,使得低资源语言在视觉推理任务中的研究进程严重滞后。为此,布加勒斯特理工大学(UNSTPB)下属的GRAI研究团队于2025年发布了Flickr30K-RoQA-v1数据集,旨在填补罗马尼亚语在视觉问答领域的空白。该数据集由George-Andrei Dima、Răzvan-Alexandru Smădu与Dumitru-Clementin Cercel主导构建,将Flickr30K数据集中158,915条英文描述经由三位母语者翻译为罗马尼亚语,并利用LLaMA 3.3 70B为每张图像合成问答对,最终形成包含31,783张图像、5条人工翻译描述及对应VQA样本的结构化资源。作为首个罗马尼亚语VQA语料库,Flickr30K-RoQA-v1为低资源语言视觉推理的研究提供了标准化基准,有力推动了多模态智能在罗马尼亚语场景下的发展。
当前挑战
该数据集的设计与构建面临双重挑战。在领域问题层面,罗马尼亚语作为低资源语言,缺乏大规模、高质量的多模态标注数据,导致视觉语言模型在该语言环境中的视觉问答与图像描述能力严重不足,亟需专门的数据集以突破零样本或小样本学习瓶颈。在构建过程中,首先需要解决跨语言翻译的一致性与语义保真性难题,确保158,915条英文描述转换为罗马尼亚语后仍能准确反映图像内容;其次,合成VQA对的生成依赖大语言模型,存在幻觉、语法错误或视觉信息不匹配的风险,需通过人工校对以提升测试集质量;此外,验证集标准化要求标注者同时兼顾罗马尼亚语的语法规范与视觉内容之间的语义对齐,消耗了大量人力与时间资源。这些挑战的克服为数据集的高质量交付奠定了基础。
常用场景
经典使用场景
在视觉与语言交叉领域的研究中,多模态指令微调与评估是提升模型跨语言泛化能力的关键路径。Flickr30K-RoQA-v1作为首个罗马尼亚语视觉问答语料库,其经典使用场景集中在基于图像内容理解的多轮对话生成与视觉推理任务。研究者利用该数据集提供的三万余张图像、五条人工翻译罗马尼亚语描述及其对应的问答对,对视觉语言模型进行指令微调,使模型在罗马尼亚语场景下能够准确回答关于图像中物体、数量、空间关系与动作等元素的问题。该数据集为低资源语言区域的视觉推理能力建设提供了标准化的基准测试平台。
解决学术问题
过往的多模态研究高度集中于英语等高资源语言,导致视觉语言模型在低资源语言上的理解与生成能力严重不足。Flickr30K-RoQA-v1的构建有效填补了这一学术空白,解决了罗马尼亚语视觉问答数据匮乏的根本性问题。通过引入人工翻译的标题与人工校验的测试集,该数据集为评估模型在低资源语境中的视觉定位、语义对齐与语法准确性提供了可靠依据。其衍生出的基准实验揭示了基于LoRA的参数高效微调方式能够显著提升多语言视觉模型的推理能力,为跨语言多模态学习领域拓展了新的研究方向。
衍生相关工作
围绕Flickr30K-RoQA-v1数据集,学术界已衍生出一系列具有代表性的工作。基于该数据,研究者构建了多种参数高效微调的罗马尼亚语视觉语言模型,包括LLaMA 3.2 11B Vision、LLaVA 1.6 Mistral 7B与Qwen2-VL 7B Instruct的LoRA适配版本。这些模型在零样本图像描述与视觉问答任务中取得了显著的性能提升,相关成果已发表于Parameter-Efficient Multimodal Instruction Tuning for Romanian Vision–Language Models等论文中。此外,该数据集的出现推动了低资源语言多模态基准测试体系的建设,启发了后续面向其他小语种的同类语料库构建工作。
以上内容由遇见数据集搜集并总结生成



