遇见数据集

PerceptionBench

收藏
github2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

PerceptionBench是一个专门设计用于评估多模态大语言模型原子视觉感知能力的基准测试数据集。它通过诊断前沿MLLMs在42个现有基准测试中的早期失败点,构建了一个错误分类法,其感知分支定义了十个原子感知能力。基于此分类法,数据集包含3000个验证问题,每个问题隔离单一能力,难度源于感知而非推理或知识。数据集统计显示,60%的问题来自源基准测试的原子子问题分解,40%为新创作的问题,样本来自内部17000多个验证样本池。

PerceptionBench is a benchmark dataset specifically designed to evaluate the atomic visual perception capabilities of multimodal large language models (MLLMs). It constructs an error taxonomy by diagnosing the early failure points of state-of-the-art MLLMs across 42 existing benchmarks, and its perception branch defines ten atomic perception capabilities. Based on this taxonomy, the dataset contains 3,000 validation questions, each isolating a single capability, where the difficulty stems from perception rather than reasoning or knowledge. Dataset statistics show that 60% of the questions are derived from atomic sub-question decompositions of the source benchmarks, 40% are newly created questions, and samples are sourced from an internal validation sample pool of over 17,000 samples.

创建时间:
2026-07-23
原始信息汇总

数据集概述

PerceptionBench 是一个专门用于评估多模态大语言模型(MLLMs)原子视觉感知能力的基准测试。

核心目标

现有基准测试常无法隔离感知能力,整体评估会混淆感知错误与推理或领域知识的错误。PerceptionBench 采用自下而上的方法,通过分析前沿 MLLMs 在 42 个现有基准测试中回答的早期失败点,构建错误分类体系,其感知分支定义了十种原子感知能力。

数据集构成

  • 总题量: 3,000 个经过验证的问题。
  • 覆盖能力: 十种原子感知能力。
  • 来源构成:
    • 1,800 (60%): 从源基准测试的归因失败中分解出的原子子问题。
    • 1,200 (40%): 基于补充图片全新撰写的题目。
  • 样本池: 从内部超过 17,000 个验证样本中,通过能力级别平衡和难度分层采样得出。

十种原子感知能力

能力缩写 能力全称 中文含义
VRel Visual Relation 视觉关系
Count Counting 计数
Attr Attribute 属性
Depth Depth & 3D Perception 深度与3D感知
Loc Localization 定位
Comp Comparison 比较
FGR Fine-Grained Recognition 细粒度识别
Ctx Contextual Integration 上下文整合
OCR Optical Character Recognition 光学字符识别
Hallu Perception-Related Hallucination 感知相关幻觉

评测结果与排行榜

  • 模型数量: 16 个前沿 MLLMs(10个专有模型,6个开源模型)。
  • 评测方式: 统一提示词,开放式简短且答案唯一的问题,使用 GPT-oss-120B 作为裁判模型。
  • 裁判准确性: 在300样本抽查中,与人类判断的一致性达到 99.7%
  • 关键发现:
    • 所有模型整体准确率均未超过 60%。
    • 感知相关的幻觉是模型平均最薄弱的能力。
    • 相似的整体分数可能隐藏着截然不同的能力轮廓。

排行榜前五名及整体得分:

排名 模型名称 整体准确率
1 GPT-5.6-Sol 59.7%
2 Kimi K3 58.5%
3 Claude-Fable-5 57.2%
4 Gemini-3.1-Pro 56.2%
5 GPT-5.5 55.8%

使用与引用

搜集汇总
数据集介绍
PerceptionBench 数据集图片
构建方式
在多模态大语言模型(MLLMs)评估领域,现有基准常因混杂推理与领域知识而难以孤立衡量感知能力。为此,PerceptionBench采用自下而上的构建范式:通过系统分析前沿MLLMs在42个现有基准上的早期失效节点,我们提炼出一套错误分类体系,其感知分支定义了十项原子化视觉感知能力。基于该分类体系,我们从17000余个已验证样本中精选并分层抽样出3000道题目,每道题均具有简短且唯一的答案,并确保单一能力被独立隔离,难度源自感知本身而非推理或知识。其中,1800题(60%)源自对源基准中归因失败的原子化解构,其余1200题(40%)则为补充图像上的全新创作。
特点
PerceptionBench的核心特点在于其精细化的能力诊断框架。一方面,它突破了传统基准的“黑箱”评估模式,通过分解出视觉关系、计数、属性、深度与3D感知、定位、比较、细粒度识别、上下文整合、光学字符识别以及与感知相关的幻觉共计十项原子维度,实现了对MLLMs视觉感知边界的结构化剖析。另一方面,该基准的题目设计强调“感知孤立性”,即每道题目仅考察单一能力维度,且难度阶梯清晰,确保评估结果能精准反映模型在特定感知环节的真实局限。值得一提的是,评测采用人类-LLM联合验证机制,在300样本审计中达成99.7%的判分一致性,保证了评价的客观与可靠。
使用方法
使用者可通过简洁的配置流程快速启动模型评估。首先,从GitHub克隆仓库并安装依赖;随后,设置环境变量或编写.env文件,填入兼容OpenAI的API密钥与端点地址,并指定待测模型名称。运行单一命令python eval/eval.py即可启动评测,系统将以统一提示词与最大可用推理预算对模型进行开放式问答测试,生成的自由文本答案由预设的LLM裁判(默认为gpt-oss-120B)依据教师评分模板逐项判分,输出0/1严格判定。评估结果会分项存储为JSONL文件,并自动汇总总体及各能力维度的准确率分数,便于研究者深入分析模型在十项原子感知能力上的性能分布与薄弱环节。
背景与挑战
背景概述
PerceptionBench诞生于2026年,由Moonshot AI团队倾力打造,旨在深度剖析多模态大语言模型在原子级视觉感知维度的核心能力。既有评估体系常将感知、推理与领域知识混为一谈,或仅聚焦于狭窄的应用场景,致使模型在视觉层面的真正短板难以被精准定位。研究团队通过逆向诊断前沿模型在42个既有基准中的最早失效点,构建出包含十项原子感知能力的错误分类体系,并据此精心设计了3000道验证性题目。每道题目的解答唯一且简短,所需难度纯粹源自感知本身而非逻辑推演,从而为衡量和诊断多模态模型视觉感知的边界提供了坚实、精准的能力层标准。
当前挑战
该研究领域面临的核心挑战在于如何将多模态模型错综复杂的视觉误判从推理与知识错误中彻底剥离,以构建纯粹的感知评估框架。构建过程中,研究团队需从海量失败样本中归纳并验证十种原子感知能力的系统性分类,确保每项能力具备互斥性与完备性。同时,设计出能使难度纯粹源于感知而非推理的题目极其困难,需要精准控制视觉特征,避免模型利用启发式捷径或语言先验作答。实验结果揭示了另一个严峻挑战:即便最先进的模型在所有能力上的平均准确率也不及60%,尤其是感知相关幻觉成为普遍的薄弱环节,暗示当前主流架构在底层视觉表征层面存在根本性不足。
常用场景
经典使用场景
在视觉与语言交汇的智能疆域中,多模态大语言模型(MLLMs)的感知能力是其与外部世界交互的基石。PerceptionBench应运而生,被设计为原子化视觉感知能力的诊断标杆,其经典使用场景在于对MLLMs进行细粒度的感知能力拆解与评估。该基准通过拓扑式地构建包含视觉关系、计数、属性识别、深度感知、定位、比较、细粒度识别、上下文整合、光学字符识别及感知幻觉在内的十项原子能力,要求模型在短答案开放式问题中展现精准的视觉判断,从而抽丝剥茧般揭示模型在各维度上的真实水平。
衍生相关工作
PerceptionBench的诞生犹如投石入湖,激起了多模态研究领域层层涟漪。其定义的能力分类体系为后续工作提供了可复用的理论基础,研究者可在此基础上构建针对特定感知维度的专项增强数据集或训练策略。该基准的误差分析方法论亦启发了更多工作去探索模型行为的因果溯源,推动了对视觉感知与高级推理间耦合关系的深入理解。此外,PerceptionBench公开的验证问题库与评估代码为模型改进提供了可反复测量的标尺,促进了如类人视觉感知建模、轻量化感知模块设计等一系列创新成果的涌现。
数据集最近研究
最新研究方向
PerceptionBench作为多模态大语言模型细粒度视觉感知能力的评估标杆,近期研究聚焦于分离视觉感知与高级认知任务的耦合瓶颈。该基准通过自底向上的错误归类策略,构建了涵盖十项原子感知能力的3000道验证题,揭示当前前沿模型在视觉关系、深度感知等物理世界理解维度上的系统性缺陷——即便最顶尖模型准确率仍未突破60%,而感知相关幻觉更是成为共性短板。这一方向直接呼应大模型落地自动驾驶、机器人操作等高风险场景时对视觉可靠性的迫切需求,推动研究从整体能力排名转向诊断式能力剖析,为下一代具备精确空间推理与抗幻觉能力的视觉语言模型提供关键评估框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务