遇见数据集

COCOLogic-V2

收藏
arXiv2026-06-26 更新2026-06-30 收录
官方服务:

资源简介:

COCOLogic-V2是由达姆施塔特工业大学等机构联合构建的面向真实世界图像的视觉归纳推理数据集,旨在评估可解释模型在复杂逻辑任务上的性能。该数据集基于MSCOCO图像,包含10条一阶逻辑规则,涵盖对象计数与比较等操作,总计28500张图像,每条规则标注了正样本变体、近边界负样本和远边界负样本,以支持细粒度模型诊断。数据通过从MSCOCO中分层采样构建,确保平衡分布与逻辑多样性,主要应用于可解释人工智能领域,用于检验模型是否真正学习逻辑规则而非依赖统计捷径。

COCOLogic-V2 is a visual inductive reasoning dataset for real-world images jointly constructed by Technische Universität Darmstadt and other institutions, aiming to evaluate the performance of interpretable models on complex logical tasks. Based on MSCOCO images, this dataset contains 10 first-order logical rules covering operations such as object counting and comparison, with a total of 28,500 images. Each rule is annotated with positive sample variants, near-boundary negative samples and far-boundary negative samples to support fine-grained model diagnosis. The dataset is constructed via stratified sampling from MSCOCO, ensuring balanced distribution and logical diversity. It is mainly applied in the field of explainable artificial intelligence, used to test whether models truly learn logical rules rather than relying on statistical shortcuts.

创建时间:
2026-06-26
原始信息汇总

数据集概述:COCOLogic-V2

COCOLogic-V2 是一个面向真实世界图像的、以对象为中心的视觉归纳推理数据集。它构建于 MSCOCO 数据集之上,将推理任务框架化为一个多标签分类问题,涵盖 10 条基于一阶逻辑的组合规则(包括对象存在/缺失、计数和计数比较)。

核心改进

与原始 COCOLogic 数据集相比,COCOLogic-V2 在以下两个方面进行了扩展:

  • 多标签重构:每张图像同时为全部 10 条规则进行标注,消除了原始数据集中的单标签捷径和类别不平衡问题,孤立了每条规则的逻辑难度。
  • 更广的逻辑范围:规则覆盖了命题逻辑、对象计数、计数比较以及对象缺失。

该数据集的核心创新在于其采样过程,能够生成“真正的困难负样本”(Near-Boundary, NB),这些样本位于每条规则的决策边界附近。同时,数据集还标注了“正变体”(Positive variants)和“远离边界负样本”(Far-from-Boundary, FB),从而可以自动诊断模型行为,无需人工检查。

10 条逻辑规则

序号 规则名称 逻辑规则描述
1 Signal and Ride 交通灯 ∧ {自行车, 公交车, 火车} 中的一个
2 Double Serving {瓶子, 杯子, 披萨} 中正好有两个类别
3 Herd Alone {牛, 大象, 羊} 中至少有两个相同类别的对象 ∧ 没有人
4 Either Dog or Car 要么是狗,要么是车
5 Three of a Kind 正好有三个碗 ∨ 正好有三个杯子
6 Car Majority 汽车的数量多于卡车 ∧ 两者都至少有一个
7 Empty Seat (沙发 ∨ 椅子) ∧ 没有人
8 Single Mode Traffic {自行车, 摩托车, 汽车, 公交车} 中只有一个类别
9 Personal Transport 人 ∧ (自行车 或 汽车中的一个)
10 Surf Trip 人的数量等于冲浪板的数量 ∧ 两者都至少有一个

所有规则均基于 MSCOCO 的 91 个对象类别。

诊断样本分类

每个样本针对每条规则被归为以下三类之一:

  • 正变体 (Positive variants):规则能够被满足的不同方式。每个规则被转换为析取范式 (DNF),每个析取项即为一个正变体。
  • 近边界负样本 (Near-boundary negatives, NB):通过翻转 DNF 析取项中的一个字面量(对于计数规则,则改变要求的对象计数)而产生的困难负样本。这些样本紧邻规则边界,是检测模型是否真正理解规则的关键探针。
  • 远离边界负样本 (Far-from-boundary negatives, FB):从剩余 MSCOCO 图像中抽取的简单负样本,用于保持数据分布接近原始 MSCOCO。

数据划分与规模

版本 训练集 测试集 来源 备注
COCOLogic-V2 (完整版) 25,000 3,500 MSCOCO 训练集 / 验证集 对正变体、NB类型和FB负样本进行平衡采样
COCOLogic-V2-FS (少样本版) 239 368 人工策划 每条规则24个训练样本(8个正样本+16个负样本);40个测试样本(20个正样本+20个负样本)

完整版数据分片以 JSON 格式提供,每个图像条目包含其 10 维标签 labels、91 维 COCO 类别计数 categories、每条规则的规则变体 rule_variants 以及边界类型 boundary_type 注释。

评估指标

评估指标针对每条规则计算,然后跨规则取平均:

  • 平衡准确率 (B-Acc):所有样本上的平衡准确率,作为整体性能的汇总指标。
  • NB类型准确率 (NB-type accuracy):在近边界负样本上的准确率,按NB类型进行分组。
  • 正变体准确率 (Positive-variant accuracy):在正样本上的准确率,按变体进行分组。

NB类型和正变体准确率是更具信息量的指标,能直接反映模型是否真正学习了逻辑规则。

模型架构

所有模型遵循“编码器 → 预测器”结构(除端到端的ResNet-50外),区别在于如何获取概念以及如何进行推理。支持的 --model_type 包括:

  • resnet: ResNet-50 + 线性规则头(处理原始图像)
  • linear / mlp: 真实COCO类别计数 + 线性层/MLP(处理91维计数)
  • detector_linear / detector_mlp: 目标检测器计数 + 线性层/MLP(处理检测计数)
  • cbm_sup_linear / cbm_sup_mlp: 监督式概念编码器 + 线性层/MLP(处理原始图像)
  • cbm_clip_linear / cbm_clip_mlp: 冻结CLIP概念分数 + 线性层/MLP(处理原始图像)
  • ocb_linear / ocb_mlp: 聚合的逐对象概念 + 线性层/MLP(处理预计算的对象概念)
  • dcr: 概念嵌入 + 概念推理层(处理原始图像)

关键发现

论文的关键发现是:基于概念的模型和黑盒基线模型虽然能达到很高的整体 B-Acc,但在 NB 样本上的表现接近随机。这意味着这些模型只是根据相关对象的存在来学习正样本与简单FB负样本之间的粗略区分,而非底层的逻辑规则。

搜集汇总
数据集介绍
COCOLogic-V2 数据集图片
构建方式
COCOLogic-V2 数据集基于 MSCOCO 真实图像构建,专注于视觉归纳推理任务。其构建核心在于将逻辑规则转化为多标签分类问题,以消除原始单标签设置中的捷径学习与类别不平衡。数据集包含 10 条覆盖命题逻辑、对象计数及计数比较的一阶逻辑规则。每条规则通过析取范式分解为若干正变体(对应规则满足的不同方式),并衍生出近边界负样本(通过对析取项翻转文字或调整计数得到)与远离边界负样本。从 MSCOCO 中抽样 25,000 幅训练图像与 3,500 幅测试图像,确保每类样本的均衡分布,并提供精细的标注信息。此外,还构建了 COCOLogic-V2-FS 子集,包含每规则 24 个精选训练样本,专为少样本与上下文学习设计。
使用方法
COCOLogic-V2 适用于评估视觉归纳推理模型的多维度性能。用户可将其作为多标签分类任务,利用提供的规则标签、正变体标识及负样本类型进行细粒度分析。推荐做法是报告每规则的平均平衡准确率、正变体准确率与近边界准确率,后者能有效揭示模型的真实推理能力。数据集支持概念瓶颈模型、端到端黑盒模型及神经符号方法的评估。在少样本场景下,COCOLogic-V2-FS 子集可用于上下文学习与程序合成方法的诊断。需注意,使用时应关注感知模块的质量,并警惕潜在的推理捷径,如基于无关对象共现的虚假关联。
背景与挑战
背景概述
在可解释人工智能领域,概念瓶颈模型与神经符号方法虽能实现决策验证,却长期受限于单一标签分类与合成数据的简单评测,难以触及真实图像上的复杂归纳推理。为此,由德国达姆施塔特工业大学、马克斯·普朗克信息学研究所等机构的研究者于2026年共同推出了COCOLogic-V2数据集。该数据集基于MSCOCO图像构建,将视觉归纳推理任务重构为多标签分类,涵盖一阶逻辑中的命题逻辑、对象计数与数量比较等广泛子集。通过引入正例变体、近边界负例与远边界负例的精细标注,COCOLogic-V2为模型责任性提供了自动诊断工具,推动了对可解释模型在真实世界中推理能力的系统评估。
当前挑战
COCOLogic-V2所揭示的核心挑战在于视觉归纳推理中模型对逻辑规则的真正理解而非统计捷径的依赖。首先,现有概念瓶颈模型与黑盒基线虽能在整体上分离正例与易负例,却在近边界负例上表现接近随机,暴露出模型未习得规则细节而仅利用粗糙统计模式的根本缺陷。其次,在少样本场景下,感知噪声与逻辑规则引发的巨大搜索空间构成了双重瓶颈:视觉语言模型易受无关对象干扰,程序合成方法则受限于搜索时间,即便使用真实概念标注,复杂规则如单模式交通仍难以在约束时间内准确推导,凸显了可靠对象识别与相关对象决策的严峻挑战。
常用场景
经典使用场景
在视觉归纳推理的研究领域中,COCOLogic-V2数据集为评估和诊断可解释模型在真实世界图像上的逻辑推理能力提供了精细化的测试平台。该数据集不仅涵盖了命题逻辑、对象计数及计数比较等一阶逻辑的核心子集,更通过引入正样本变体、近边界负样本与远边界负样本的精细分类体系,实现了对模型归因能力的自动化诊断。研究者可借助该数据集考察概念瓶颈模型、视觉语言模型以及程序合成等前沿方法是否能真正习得潜在逻辑规则,而非仅仅依赖粗粒度的统计模式完成分类。其独特价值在于能够揭示模型在哪些具体的逻辑约束下失效,从而为构建真正具备透明性与可验证性的智能系统奠定基础。
解决学术问题
该数据集精准回应了当前可解释人工智能领域一个悬而未决的学术难题——如何系统性地评估模型在复杂真实图像上进行逻辑推理时的真实能力。传统评估范式往往局限于简单任务或合成数据,难以暴露模型在逼近决策边界的样本上的表现短板。COCOLogic-V2通过近边界负样本的设计,有效揭示了众多先进模型在需要精确理解逻辑规则时表现出的系统性缺陷,证明它们更擅长分离正样本与容易识别的负样本,而非真正掌握规则内涵。这一发现推动了学界重新审视可解释模型的归因可靠性,并对概念瓶颈模型、神经符号系统等方向的评估方法论产生了深远影响,促使研究者致力于开发能够抵御逻辑捷径的新一代推理架构。
实际应用
COCOLogic-V2的实际应用价值广泛渗透于高可靠性领域,例如医疗影像诊断、自动驾驶场景理解以及金融风控中的合规性验证。在这些场景中,模型不仅需要给出正确输出,更要求其决策过程具备透明且可验证的逻辑依据。例如,在自动驾驶的交通标志识别与场景规则遵守评估中,该数据集定义的逻辑规则如“信号灯与特定交通工具共存”可转化为可解释的决策约束,帮助开发更安全的感知系统。此外,该数据集配套的精简版COCOLogic-V2-FS为小样本学习场景提供了测试基准,使得在数据稀缺的实际部署条件下,模型依然能够基于少量示例快速归纳并验证逻辑规则,从而提升工业系统应对新奇情况的鲁棒性与可审计性。
数据集最近研究
最新研究方向
当前,视觉归纳推理领域的前沿研究正聚焦于揭示模型在真实世界图像上的逻辑一致性短板。COCOLogic-V2的提出标志着该领域从简单语义分类迈向复杂一阶逻辑推理的关键转折,其核心创新在于通过精巧的“近边界负样本”设计,能够精准诊断模型是否真正习得逻辑规则而非依赖统计捷径。这一数据集紧密关联可解释人工智能的 accountability 热点,尤其是在医疗、金融等高危决策场景中,模型透明性成为迫切需求。研究表明,当前主流的概念瓶颈模型、视觉语言模型乃至程序合成方法在近边界样本上普遍表现不佳,暴露了它们在处理计数比较、异或关系等细粒度逻辑时的深层缺陷,这为未来开发真正具备推理能力的可解释模型提供了明确的方向与严苛的评测基准。
相关研究论文
  • 1
    COCOLogic-V2: Identifying Logical Inconsistencies via Truly Hard-Negatives达姆施塔特工业大学·计算机科学系; 黑森人工智能中心; 德国人工智能研究中心; 马克斯·普朗克信息学研究所·SIC; RTG Neuroexplicit Models · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务