Unison
收藏资源简介:
Unison是由复旦大学研究团队构建的综合性统一多模态基准数据集,旨在评估统一多模态模型在理解与生成任务中的协同能力。该数据集包含2,169个经过人工验证的高质量统一任务样本,覆盖内部一致性、理解引导生成、生成引导理解及相互增强四个核心维度,数据来源于精心设计的图像-文本对及复杂指令。数据集通过系统化流程构建,强调语义对齐与任务交互,主要应用于评估多模态大模型在联合理解与生成场景下的性能,解决现有模型在协同任务中能力割裂的关键问题。
Unison is a comprehensive unified multimodal benchmark dataset developed by the research team from Fudan University, which aims to evaluate the collaborative capabilities of unified multimodal models in understanding and generation tasks. This dataset includes 2,169 high-quality unified task samples manually verified, covering four core dimensions: internal consistency, understanding-guided generation, generation-guided understanding, and mutual enhancement. The data comes from carefully designed image-text pairs and complex instructions. The dataset is constructed via a systematic workflow, with emphasis on semantic alignment and task interaction. It is mainly used to assess the performance of multimodal large language models in joint understanding and generation scenarios, solving the critical issue of capability fragmentation of existing models in collaborative tasks.
数据集概述:Unison
Unison 是一个用于评估统一多模态模型(Unified Multimodal Models, UMMs)的基准测试数据集,旨在通过协同理解与生成任务来全面衡量模型性能。该项目由复旦大学(Fudan University)的研究团队开发,相关论文已被 ICML 2026 接收。
核心评估维度
Unison 从四个关键维度评估统一多模态模型(UMMs):
- Internal Consistency(内部一致性):评估模型在理解和生成任务各自内部的性能一致性。
- Und.-Guided Gen.(理解引导生成):评估模型基于理解能力来指导生成任务的效果。
- Gen.-Guided Und.(生成引导理解):评估模型利用生成能力来提升理解任务的效果。
- Mutual Enhancement(相互增强):评估理解与生成任务之间的协同增效作用。
每个维度都分别报告了理解(Und.)、生成(Gen.)和综合(Uni.)三个方面的分数。
数据集结构
数据集可于 HuggingFace - FudanCVL/Unison 下载,期望的文件结构如下:
Unison/ └── data/ ├── Internal_Consistency/ ├── Und_Guided_Gen/ ├── Gen_Guided_Und/ └── Mutual_Enhancement/
评估工具:Unison-Judge
- Unison-Judge 是该项目提供的自动化评估模型,基于 Qwen3-VL 构建。
- 该评估器与人类判断的对齐度(accuracy)达到 88.7%。
- 其模型权重可在 HuggingFace - FudanCVL/Unison-Judge 获取。
评估结果摘要
以下是部分模型在 Unison 基准上的整体表现(Overall 分数),完整结果可查阅项目主页或论文。
开源模型(部分):
- BAGEL (14B):53.2 (🥇)
- OmniGen2 (7B):51.3 (🥈)
- UniWorld-V1 (19B):42.1 (🥉)
- ILLUME+ (7B):11.7
- SEED-X (17B):19.9
闭源模型:
- GPT-5.2:71.3
- Gemini 3 Pro:69.8

- 1Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation复旦大学·可信具身智能研究院; 复旦大学·大数据研究院·计算机科学与人工智能学院 · 2026年



