MultiVerse
收藏资源简介:
MultiVerse是一个新颖的多轮对话基准,包含647个对话,每个对话平均四轮,从12个流行的VLM评估基准中衍生而来。该数据集包括484个不同的任务和484个交互目标,覆盖了从事实知识、感知到高级推理任务如数学和编程的广泛话题。
MultiVerse is a novel multi-turn dialogue benchmark. It comprises 647 dialogues with an average of four turns per dialogue, derived from 12 popular VLM evaluation benchmarks. This dataset includes 484 distinct tasks and 484 interaction goals, covering a broad spectrum of topics ranging from factual knowledge and perception to advanced reasoning tasks such as mathematics and programming.
MultiVerse数据集概述
基本信息
- 数据集名称: MultiVerse
- 语言: 英语
- 许可证: CC-BY-NC-4.0
- 类型: 多轮对话基准测试数据集
- 标签: 基准测试、多模态、视觉语言模型、对话、多轮对话、评估
数据集规模
- 对话数量: 647个对话
- 平均轮次: 每个对话平均4轮
- 训练集大小: 370 MB
- 下载大小: 364 MB
- 示例数量: 647个
数据来源
- 源自12个流行的视觉语言模型评估基准
- 涵盖484个不同任务和484个交互目标
- 主题范围广泛:从事实知识、感知到数学和编程等高级推理任务
数据结构
主要字段
index: 唯一标识符,格式为idx:source_dataset_name:original_indeximage: 对话相关的源图像character: 对话中主要角色的身份或角色scenario: 对话的叙事或情境背景goal: 目标目的或对话意图conversation: 多轮对话交换序列
对话结构
speaker: 说话者名称或角色utterance: 该轮次的发言文本checklist: 每轮评估检查表question: 评估问题main_criteria: 主要评估维度sub_criteria: 次要评估子维度
分类字段
main_goal_category: 高级目标分类sub_goal_category: 细粒度目标分类main_task_category: 高级任务分类sub_task_category: 细粒度任务分类image_main_category: 高级图像领域分类image_sub_category: 细粒度图像领域分类
数据集创建方法
- 从12个广泛使用的视觉语言模型评估基准收集源图像
- 采用个人背景到对话的方法确保词汇多样性和上下文丰富的多轮对话
- 所有样本经过细致的人工审查,确保:
- 自然对话流程
- 事实准确性
- 盲测鲁棒性
相关资源
- GitHub仓库: https://github.com/passing2961/MultiVerse
- 论文: https://arxiv.org/abs/2510.16641
- 联系方式: passing2961@gmail.com
引用信息
bibtex @misc{lee2025multiversemultiturnconversationbenchmark, title={MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models}, author={Young-Jun Lee and Byung-Kwan Lee and Jianshu Zhang and Yechan Hwang and Byungsoo Ko and Han-Gyu Kim and Dongyu Yao and Xuankun Rong and Eojin Joo and Seung-Ho Han and Bowon Ko and Ho-Jin Choi}, year={2025}, eprint={2510.16641}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2510.16641}, }




