VIDA (Visually-Dependent Ambiguity)
收藏资源简介:
VIDA是由汉堡大学与阿里巴巴团队联合构建的多模态机器翻译数据集,专注于视觉依赖性歧义解析。该数据集包含2500条经严格筛选的英中翻译实例,涵盖词级、句级及集体名词三类歧义场景,所有样本均需依赖视觉证据进行消歧。数据通过三阶段半自动化流程构建,包括基于GPT-4o和双LLM共识的歧义筛选、结构化翻译生成及人工验证。其核心价值在于为评估LVLM模型的视觉消歧能力提供标准化测试基准,推动多模态翻译中语义精准度的研究。
VIDA is a multimodal machine translation dataset jointly constructed by the University of Hamburg and the Alibaba team, focusing on visual-dependent ambiguity resolution. This dataset contains 2500 strictly filtered English-Chinese translation instances, covering three types of ambiguity scenarios: word-level, sentence-level, and collective noun, where all samples require visual evidence for disambiguation. The dataset is built through a three-stage semi-automated workflow, including ambiguity screening based on GPT-4o and dual-LLM consensus, structured translation generation, and manual verification. Its core value lies in providing a standardized test benchmark for evaluating the visual disambiguation capability of LVLM models, promoting research on semantic accuracy in multimodal machine translation.
根据您提供的数据集详情页面地址和README文件内容,以下是对该数据集的关键信息总结:
数据集概述
- 数据集名称:visually-dependent-ambiguity(视觉依赖歧义数据集)
- 来源地址:https://huggingface.co/datasets/p1k0/visually-dependent-ambiguity
数据集特征
该数据集包含以下字段:
- idx:样本索引(int64类型)
- image:图像数据(image类型)
- en:英文文本(string类型)
- standard_zh:标准中文翻译(string类型)
- standard_resolved_ambiguity:标准歧义消解结果(string类型)
- fine_grained_zh:细粒度中文翻译(string类型)
- fine_grained_resolved_ambiguity:细粒度歧义消解结果(string类型)
- group:分组编号(int64类型)
- sense:语义信息,包含子字段:term(术语)、type(类型)、gold_interpretation(标准解释)
- agree_ambi:歧义一致性信息,包含子字段:type(类型)、explanation(解释)、ambiguous_terms(歧义术语列表)、translations(翻译列表)、possible_chinese_translations(可能的中文翻译列表)
数据集划分与规模
数据集包含四个子集,总数据量约2527个样本,总大小约690 MB:
| 子集名称 | 样本数量 | 数据大小 |
|---|---|---|
| vida_sent | 312 | 353.5 MB |
| vida_colln | 255 | 38.9 MB |
| vida_base_train | 1352 | 211.9 MB |
| vida_base_test | 580 | 85.7 MB |
数据用途
该数据集专门用于研究与视觉依赖歧义相关的任务,重点关注:
- 在不同语言(英文和中文)之间处理需要依赖视觉信息进行歧义消解的语言现象
- 提供了标准级别的细粒度歧义消解标注
- 包含图像数据,支持多模态学习场景




