COCOLogic-V2
收藏资源简介:
COCOLogic-V2是由达姆施塔特工业大学等机构联合构建的面向真实世界图像的视觉归纳推理数据集,旨在评估可解释模型在复杂逻辑任务上的性能。该数据集基于MSCOCO图像,包含10条一阶逻辑规则,涵盖对象计数与比较等操作,总计28500张图像,每条规则标注了正样本变体、近边界负样本和远边界负样本,以支持细粒度模型诊断。数据通过从MSCOCO中分层采样构建,确保平衡分布与逻辑多样性,主要应用于可解释人工智能领域,用于检验模型是否真正学习逻辑规则而非依赖统计捷径。
COCOLogic-V2 is a visual inductive reasoning dataset for real-world images jointly constructed by Technische Universität Darmstadt and other institutions, aiming to evaluate the performance of interpretable models on complex logical tasks. Based on MSCOCO images, this dataset contains 10 first-order logical rules covering operations such as object counting and comparison, with a total of 28,500 images. Each rule is annotated with positive sample variants, near-boundary negative samples and far-boundary negative samples to support fine-grained model diagnosis. The dataset is constructed via stratified sampling from MSCOCO, ensuring balanced distribution and logical diversity. It is mainly applied in the field of explainable artificial intelligence, used to test whether models truly learn logical rules rather than relying on statistical shortcuts.
数据集概述:COCOLogic-V2
COCOLogic-V2 是一个面向真实世界图像的、以对象为中心的视觉归纳推理数据集。它构建于 MSCOCO 数据集之上,将推理任务框架化为一个多标签分类问题,涵盖 10 条基于一阶逻辑的组合规则(包括对象存在/缺失、计数和计数比较)。
核心改进
与原始 COCOLogic 数据集相比,COCOLogic-V2 在以下两个方面进行了扩展:
- 多标签重构:每张图像同时为全部 10 条规则进行标注,消除了原始数据集中的单标签捷径和类别不平衡问题,孤立了每条规则的逻辑难度。
- 更广的逻辑范围:规则覆盖了命题逻辑、对象计数、计数比较以及对象缺失。
该数据集的核心创新在于其采样过程,能够生成“真正的困难负样本”(Near-Boundary, NB),这些样本位于每条规则的决策边界附近。同时,数据集还标注了“正变体”(Positive variants)和“远离边界负样本”(Far-from-Boundary, FB),从而可以自动诊断模型行为,无需人工检查。
10 条逻辑规则
| 序号 | 规则名称 | 逻辑规则描述 |
|---|---|---|
| 1 | Signal and Ride | 交通灯 ∧ {自行车, 公交车, 火车} 中的一个 |
| 2 | Double Serving | {瓶子, 杯子, 披萨} 中正好有两个类别 |
| 3 | Herd Alone | {牛, 大象, 羊} 中至少有两个相同类别的对象 ∧ 没有人 |
| 4 | Either Dog or Car | 要么是狗,要么是车 |
| 5 | Three of a Kind | 正好有三个碗 ∨ 正好有三个杯子 |
| 6 | Car Majority | 汽车的数量多于卡车 ∧ 两者都至少有一个 |
| 7 | Empty Seat | (沙发 ∨ 椅子) ∧ 没有人 |
| 8 | Single Mode Traffic | {自行车, 摩托车, 汽车, 公交车} 中只有一个类别 |
| 9 | Personal Transport | 人 ∧ (自行车 或 汽车中的一个) |
| 10 | Surf Trip | 人的数量等于冲浪板的数量 ∧ 两者都至少有一个 |
所有规则均基于 MSCOCO 的 91 个对象类别。
诊断样本分类
每个样本针对每条规则被归为以下三类之一:
- 正变体 (Positive variants):规则能够被满足的不同方式。每个规则被转换为析取范式 (DNF),每个析取项即为一个正变体。
- 近边界负样本 (Near-boundary negatives, NB):通过翻转 DNF 析取项中的一个字面量(对于计数规则,则改变要求的对象计数)而产生的困难负样本。这些样本紧邻规则边界,是检测模型是否真正理解规则的关键探针。
- 远离边界负样本 (Far-from-boundary negatives, FB):从剩余 MSCOCO 图像中抽取的简单负样本,用于保持数据分布接近原始 MSCOCO。
数据划分与规模
| 版本 | 训练集 | 测试集 | 来源 | 备注 |
|---|---|---|---|---|
| COCOLogic-V2 (完整版) | 25,000 | 3,500 | MSCOCO 训练集 / 验证集 | 对正变体、NB类型和FB负样本进行平衡采样 |
| COCOLogic-V2-FS (少样本版) | 239 | 368 | 人工策划 | 每条规则24个训练样本(8个正样本+16个负样本);40个测试样本(20个正样本+20个负样本) |
完整版数据分片以 JSON 格式提供,每个图像条目包含其 10 维标签 labels、91 维 COCO 类别计数 categories、每条规则的规则变体 rule_variants 以及边界类型 boundary_type 注释。
评估指标
评估指标针对每条规则计算,然后跨规则取平均:
- 平衡准确率 (B-Acc):所有样本上的平衡准确率,作为整体性能的汇总指标。
- NB类型准确率 (NB-type accuracy):在近边界负样本上的准确率,按NB类型进行分组。
- 正变体准确率 (Positive-variant accuracy):在正样本上的准确率,按变体进行分组。
NB类型和正变体准确率是更具信息量的指标,能直接反映模型是否真正学习了逻辑规则。
模型架构
所有模型遵循“编码器 → 预测器”结构(除端到端的ResNet-50外),区别在于如何获取概念以及如何进行推理。支持的 --model_type 包括:
resnet: ResNet-50 + 线性规则头(处理原始图像)linear/mlp: 真实COCO类别计数 + 线性层/MLP(处理91维计数)detector_linear/detector_mlp: 目标检测器计数 + 线性层/MLP(处理检测计数)cbm_sup_linear/cbm_sup_mlp: 监督式概念编码器 + 线性层/MLP(处理原始图像)cbm_clip_linear/cbm_clip_mlp: 冻结CLIP概念分数 + 线性层/MLP(处理原始图像)ocb_linear/ocb_mlp: 聚合的逐对象概念 + 线性层/MLP(处理预计算的对象概念)dcr: 概念嵌入 + 概念推理层(处理原始图像)
关键发现
论文的关键发现是:基于概念的模型和黑盒基线模型虽然能达到很高的整体 B-Acc,但在 NB 样本上的表现接近随机。这意味着这些模型只是根据相关对象的存在来学习正样本与简单FB负样本之间的粗略区分,而非底层的逻辑规则。

- 1COCOLogic-V2: Identifying Logical Inconsistencies via Truly Hard-Negatives达姆施塔特工业大学·计算机科学系; 黑森人工智能中心; 德国人工智能研究中心; 马克斯·普朗克信息学研究所·SIC; RTG Neuroexplicit Models · 2026年



