HoloCount
收藏资源简介:
HoloCount是一个用于多模态大语言模型(MLLMs)的整体视觉计数基准,它通过三级层次分类法评估MLLMs在语义计数、分析计数和鲁棒性测试方面的能力,包含2,480个问答对、20个细分子集和1,481个视觉概念,旨在解决现有基准在复杂逻辑约束和对抗条件下的不足。
HoloCount is a holistic visual counting benchmark for Multimodal Large Language Models (MLLMs). It adopts a three-level hierarchical classification framework to evaluate the capabilities of MLLMs in semantic counting, analytical counting, and robustness testing. The benchmark comprises 2,480 question-answer pairs, 20 fine-grained subsets, and 1,481 visual concepts, and it aims to address the shortcomings of existing benchmarks under complex logical constraints and adversarial conditions.
HoloCount:面向多模态大语言模型的全局视觉计数基准
概述
HoloCount是一个全面的视觉计数基准测试,旨在评估多模态大语言模型(MLLMs)在细粒度定位与空间推理方面的量化精确度。该基准通过一个三级层次分类法,系统性地评估模型在感知、逻辑推理及对抗条件下的计数能力。
核心信息
- QA对数量:2,480个
- 细粒度子集:20个
- 视觉概念:1,481个
- 已评估MLLMs:超过30个
层次化分类体系
HoloCount围绕三个层次构建:
- 语义计数(Semantic Counting):聚焦原子级和基于属性的枚举。
- 分析计数(Analytical Counting):通过空间和基于集合的推理评估逻辑组合能力。
- 鲁棒性测试(Robustness Testing):针对高密度场景、语言偏差等不利条件与对抗性先验,探测模型的完整性。
主要发现
通过对超过20个最先进MLLMs的评估,结果显示:当任务从感知逐步过渡到复杂分析推理和不利场景时,即使是顶尖模型也表现出显著的性能下降。
数据获取
数据集托管于HuggingFace,可通过以下方式加载: python from datasets import load_dataset dataset = load_dataset("MM-MVR/HoloCount")
相关链接
- 论文:https://arxiv.org/abs/2607.06420
- HuggingFace数据集:https://huggingface.co/datasets/MM-MVR/HoloCount
- 项目页面:https://mm-mvr.github.io/HoloCount/
许可协议
本项目采用 MIT 许可证。



