遇见数据集

HoloCount

收藏
github2026-07-08 更新2026-07-09 收录
数据链接:
官方服务:

资源简介:

HoloCount是一个用于多模态大语言模型(MLLMs)的整体视觉计数基准,它通过三级层次分类法评估MLLMs在语义计数、分析计数和鲁棒性测试方面的能力,包含2,480个问答对、20个细分子集和1,481个视觉概念,旨在解决现有基准在复杂逻辑约束和对抗条件下的不足。

HoloCount is a holistic visual counting benchmark for Multimodal Large Language Models (MLLMs). It adopts a three-level hierarchical classification framework to evaluate the capabilities of MLLMs in semantic counting, analytical counting, and robustness testing. The benchmark comprises 2,480 question-answer pairs, 20 fine-grained subsets, and 1,481 visual concepts, and it aims to address the shortcomings of existing benchmarks under complex logical constraints and adversarial conditions.

创建时间:
2026-07-06
原始信息汇总

HoloCount:面向多模态大语言模型的全局视觉计数基准

概述

HoloCount是一个全面的视觉计数基准测试,旨在评估多模态大语言模型(MLLMs)在细粒度定位与空间推理方面的量化精确度。该基准通过一个三级层次分类法,系统性地评估模型在感知、逻辑推理及对抗条件下的计数能力。

核心信息

  • QA对数量:2,480个
  • 细粒度子集:20个
  • 视觉概念:1,481个
  • 已评估MLLMs:超过30个

层次化分类体系

HoloCount围绕三个层次构建:

  1. 语义计数(Semantic Counting):聚焦原子级和基于属性的枚举。
  2. 分析计数(Analytical Counting):通过空间和基于集合的推理评估逻辑组合能力。
  3. 鲁棒性测试(Robustness Testing):针对高密度场景、语言偏差等不利条件与对抗性先验,探测模型的完整性。

主要发现

通过对超过20个最先进MLLMs的评估,结果显示:当任务从感知逐步过渡到复杂分析推理和不利场景时,即使是顶尖模型也表现出显著的性能下降。

数据获取

数据集托管于HuggingFace,可通过以下方式加载: python from datasets import load_dataset dataset = load_dataset("MM-MVR/HoloCount")

相关链接

  • 论文:https://arxiv.org/abs/2607.06420
  • HuggingFace数据集:https://huggingface.co/datasets/MM-MVR/HoloCount
  • 项目页面:https://mm-mvr.github.io/HoloCount/

许可协议

本项目采用 MIT 许可证。

搜集汇总
数据集介绍
构建方式
视觉计数作为多模态智能的基石,要求模型在细粒度定位与空间推理间实现无缝协同。然而,现有基准多局限于简化场景中的基础感知,难以剖析多模态大语言模型在逻辑约束或对抗条件下的复杂失谐模式。为此,HoloCount应运而生,它构建于一个三层级层次化分类体系之上,涵盖语义计数、分析计数与鲁棒性测试三大维度。语义计数聚焦原子级与属性级枚举,分析计数通过空间与集合推理评估逻辑组合能力,鲁棒性测试则针对高密度场景及语言偏见等对抗性先验探查模型完整性。基准囊括2480个问答对、20个细粒度子集及1481个视觉概念,并系统评估了30余种前沿模型,揭示出从感知到复杂推理与对抗场景间显著的性能鸿沟。
特点
HoloCount的核心特色在于其诊断性与层级化设计,能够系统揭示MLLM在计数任务中的退化轨迹。基准通过语义计数、分析计数与鲁棒性测试三层分类,精准定位模型从基础感知到高阶推理的失效节点。其中,鲁棒性测试引入高密度场景与语言偏见等对抗性先验,填补了现有基准对模型逻辑韧性评估的空白。此外,HoloCount涵盖20个细粒度子集与1481个视觉概念,确保了评估的广度与深度,能够刻画出即使顶尖模型在任务复杂度攀升时亦会显著退化的系统性规律。这种结构化剖析为发展更可信赖的多模态系统提供了清晰路线图。
使用方法
HoloCount数据集托管于HuggingFace平台,可通过Python的datasets库便捷加载。用户只需执行一行代码——`dataset = load_dataset("MM-MVR/HoloCount")`——即可获取完整数据。该工具适用于多模态大语言模型的计数能力诊断与对比评估,支持在语义、分析及鲁棒性三个层次上对模型进行系统性测试。研究人员可借助其分层分类体系,深入分析模型在不同难度任务中的表现差异,从而定位模型短板并指导后续优化。数据集的MIT开源许可协议进一步促进了学术共享与工业应用的无缝衔接。
背景与挑战
背景概述
视觉计数作为多模态智能的核心基石,要求模型具备精细化的目标定位与空间推理能力。尽管多模态大语言模型在定性场景理解领域取得了显著进展,但其在定量精度层面仍存在严重瓶颈,突出表现为持续性的数字幻觉现象。为系统评估并诊断这一能力缺陷,Jinhong Deng、Limeng Qiao与Guanglu Wan于2026年构建了HoloCount数据集。该基准创新性地提出了三级层次化分类体系,涵盖语义计数、分析计数与鲁棒性测试三大维度,涉及2480个问答对及超过1400个视觉概念。通过对30余种前沿多模态大语言模型的全面评测,HoloCount揭示了模型在从基础感知向复杂逻辑推理及对抗性场景过渡时性能急剧下降的关键现象,为构建更可靠的多模态系统提供了系统性图景。
当前挑战
HoloCount面临的挑战体现在双重层面:在领域问题层面,现有计数基准多聚焦于简化语境下的基础感知任务,无法有效捕捉逻辑约束或对抗性条件下涌现的复杂失效模式,模型在高密度场景、语言偏见等接地性反先验情境中尤其脆弱;在构建过程中的挑战方面,如何设计涵盖原子枚举、属性计数、空间推理与集合运算的精细分类体系,并确保每个子集的问题具备诊断性与区分度,同时保持数据规模与标注质量的平衡,构成了关键难点。此外,应对诸如数量级差异悬殊、目标密集堆叠等极端场景的视觉语义建模,也要求标注过程具备高度专业性与一致性。
常用场景
经典使用场景
在视觉计数研究的广阔疆域中,HoloCount被设计为一种系统性评估多模态大语言模型(MLLMs)细粒度量化能力的黄金标准。其经典使用场景涵盖基于语义的原子级与属性级物体枚举,如对特定颜色、类别或空间关系的对象进行精确计数;同时深入逻辑推理层面,运用空间组合与集合运算评估模型在复杂场景中的解析能力。该基准通过构建高密度、对抗性干扰及语言偏见等极端情境,系统性地揭示了模型在从感知到复杂推理转化过程中涌现的性能退化现象。这些诊断性用例为揭示当前MLLMs在量化任务中的本质缺陷提供了坚实的实验框架。
衍生相关工作
HoloCount的问世衍生了一系列富有启发性的后续研究工作。其三级分层体系启发了多个针对MLLMs认知深度的扩展性基准设计,例如将语义计数与空间推理进一步融合以评估模型对抽象数学概念的理解能力。基于该基准中揭示的数值幻觉现象,研究者提出了专注于计数行为的局部感知增强模块与对抗训练策略,旨在提升模型在高密度场景下的输出稳定性。另有工作将其鲁棒性子集作为压力测试用例,专门探索语言先验对视觉计数过程的误导机制,并发展出相应的去偏置训练方法。这些衍生工作共同推动着多模态系统从单纯的感知匹配走向更为严谨的量化推理范式。
数据集最近研究
最新研究方向
针对多模态大模型在视觉计数任务中的数值幻觉与推理脆弱性,HoloCount构建了一个涵盖语义计数、分析计数与鲁棒性测试的三级层级化基准。该基准通过2480个细粒度问答对及20余种前沿模型的系统评估,揭示了当前顶尖模型在从感知层向逻辑推理与对抗环境过渡时性能急剧衰减的瓶颈。这一研究不仅为理解多模态系统在复杂场景下的定量精度缺失提供了诊断工具,也为推动更可靠、更稳健的多模态智能系统设计与优化指明了关键路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务