ViMUL-Bench
收藏资源简介:
ViMUL-Bench 是一个多语言视频多模态模型评估基准,旨在测试视频语言模型在14种语言(包括低资源和丰富资源语言)上的跨语言和文化理解能力。该数据集涵盖了15个多样化的领域,包括生活方式、节日、食品、仪式、地标和文化人物等,并包括由本地专家手动验证的8000个样本。ViMUL-Bench 还包括一个由120万个样本组成的多语言视频训练集,并开发了一个名为 ViMUL 的简单多语言视频 LMM,该模型在视频理解方面取得了更好的跨语言和文化性能。
ViMUL-Bench is a multilingual video multimodal model evaluation benchmark designed to evaluate the cross-lingual and cross-cultural understanding capabilities of video-language models across 14 languages, including both low-resource and high-resource languages. This dataset covers 15 diverse domains including lifestyle, festivals, food, rituals, landmarks, cultural figures, etc., and contains 8,000 samples manually verified by local experts. ViMUL-Bench also includes a multilingual video training set consisting of 1.2 million samples, and a simple multilingual video large multimodal model (LMM) named ViMUL has been developed, which achieves better cross-lingual and cross-cultural performance in video understanding tasks.
ViMUL-Bench 数据集概述
数据集基本信息
- 名称: ViMUL-Bench
- 类型: 多语言多模态视频问答基准
- 语言数量: 14种(涵盖高资源与低资源语言)
- 核心作者: Mohamed bin Zayed University of AI 等机构研究人员
- 发布日期: 2025年(预印本)
- 论文链接: arXiv:2506.07032
核心贡献
-
ViMUL-Bench基准
- 首个多语言多元文化视频问答基准
- 覆盖14种语言(包括僧伽罗语、乌尔都语等低资源语言)
- 包含15个领域(8个文化相关领域+7个通用领域)
- 8,025个经母语专家验证的QA对
-
文化导向标注
- 通过(国家、语言、子主题)三元组筛选文化视频
- 所有非英语QA对均由母语者创建并验证
-
ViMUL模型
- 基于Qwen-2.0的多语言视频语言模型
- 使用120万机器翻译QA对训练
- 三阶段架构:SigLIP视觉编码器+MLP投影器+多语言LLM
数据集详情
语言覆盖
英语、汉语、西班牙语、法语、德语、印地语、阿拉伯语、俄语、孟加拉语、乌尔都语、僧伽罗语、泰米尔语、瑞典语、日语
文化类别
- 生活方式与习俗
- 节日庆典
- 饮食文化
- 体育运动
- 建筑与地标
- 著名公众人物
- 媒体娱乐
- 艺术文学
通用类别
- 艺术表演
- 数字内容
- 知识类
- 生活记录
- 体育竞赛
- 监控视频
- 其他
技术特性
- 视频处理: 1FPS帧采样+SigLIP编码
- 问题类型: 多选题/开放式(短答+长答)
- 视频时长: 短/中/长三类
- 数据来源: 879个精选视频
- 验证流程: 母语专家人工验证所有QA对
实验结果
- 模型对比: 评估6种SOTA LMM+ViMUL
- 关键发现:
- GPT-4o在闭源模型中表现最优
- ViMUL在开源模型中高低资源语言平衡最佳(整体提升2%)
- 低资源语言(如僧伽罗语)仍具挑战性
数据统计
- 总样本量: 8,025 QA对
- 语言脚本: 9种文字系统
- 文化类样本占比: 约50%(8类中的分布见原图)




