UNO-Bench
收藏资源简介:
UNO-Bench是一个高质量、统一的多模态模型基准,旨在有效评估uni-modal和omni-modal能力。它包括1250个多模态样本和2480个增强的单模态样本,适用于中国真实世界场景,并具有高效的数据处理能力。
UNO-Bench is a high-quality, unified multimodal model benchmark designed to effectively evaluate both unimodal and omnimodal capabilities. It consists of 1,250 multimodal samples and 2,480 augmented unimodal samples, and is tailored for real-world Chinese scenarios while featuring efficient data processing capabilities.
UNO-Bench数据集概述
数据集基本信息
- 许可证: MIT
- 支持语言: 中文、英文
- 标签: 多模态、视觉问答、音频问答
数据集简介
UNO-Bench是一个统一的全模态模型基准,旨在探索单模态与全模态之间的组合规律。该基准在统一能力分类体系下有效评估单模态和全模态能力,涵盖44种任务类型和5种模态组合。
数据集规模与质量
- 全模态样本: 1250个人工精心策划的样本,具有98%的跨模态可解性
- 单模态样本: 2480个增强的单模态样本
- 数据质量: 人工生成的数据集非常适合现实场景,特别是在中文语境下
- 自动压缩: 提供90%的速度提升,并在18个公共基准上保持98%的一致性
数据集特点
- 问题类型: 除了传统的多项选择题外,还提出了创新的多步开放式问题格式来评估复杂推理
- 评估模型: 包含通用评分模型,支持6种问题类型的自动评估,准确率达95%
- 模态组合: 涵盖视觉、音频和语言模态的统一评估
数据集构建
材料收集
- 多样化来源: 主要来自众包的真实世界照片和视频,辅以无版权网站和高质量公共数据集
- 丰富主题: 涵盖社会、文化、艺术、生活、文学和科学
- 现场录制音频: 由20多名人类说话者录制的对话,确保丰富的音频特征
质量保证
- 多阶段质量保证系统: 结合自动化工具和人工审查
- 三重独立检查: 初步模型检查、模态消融实验、最终人工检查和修订
数据压缩
采用聚类引导的分层抽样方法压缩18个公共基准的规模
主要贡献
- 提出首个统一的全模态模型基准UNO-Bench
- 建立高质量数据集流水线
- 引入多步开放式问题用于复杂推理评估
关键发现
- 感知能力与推理能力: 与人类专家相比,Gemini-2.5-Pro在感知方面表现相似,但在推理方面显著落后
- 组合规律: 全模态能力效果与单模态性能乘积遵循幂律关系
- 冗余同步视听视频数据: 音频-视觉同步视频数据高度冗余
数据集内容
- 能力维度: 系统分为感知和推理两个主要维度
- 任务类型: 44种任务类型
- 模态组合: 5种模态组合
引用信息
bibtex @misc{chen2025unobench, title={UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models}, author={Chen Chen and ZeYang Hu and Fengjiao Chen and Liya Ma and Jiaxing Liu and Xiaoyu Li and Ziwen Wang and Xuezhi Cao and Xunliang Cai}, year={2025}, eprint={2510.18915}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2510.18915}, }
数据来源
主要材料通过众包收集真实世界照片和视频,小部分来自高质量公共数据集。使用18个公开可用基准压缩视觉和音频数据集。
致谢
感谢LongCat Team EVA委员会在整个工作过程中提供的宝贵帮助、指导和建议。




