遇见数据集

ComposerGCoT

收藏
arXiv2026-06-22 更新2026-06-24 收录
数据链接:
官方服务:

资源简介:

ComposerGCoT是由巴黎-萨克雷大学研究团队构建的专门用于评估多模态大语言模型推理一致性的数据集。该数据集包含16.3万条高质量推理链,覆盖5.5万张图像,通过蒸馏GQA数据集并基于规则化流程生成,每条数据均标注了中间答案和视觉定位信息。其创建过程采用两阶段策略:首先通过CC3M、Flickr30K等数据集进行空间对齐预训练,然后利用GQA的场景图和功能程序分解为离散的视觉推理步骤。该数据集主要应用于视觉问答领域,旨在解决模型推理过程与视觉证据脱节的问题,通过结构化评估框架验证模型在答案准确性、推理一致性和视觉定位精度三个维度的综合性能。

ComposerGCoT is a dataset constructed by the research team from Université Paris-Saclay, specifically designed to evaluate the reasoning consistency of multimodal large language models. This dataset contains 163,000 high-quality reasoning chains covering 55,000 images, which is generated by distilling the GQA dataset and following a regularized workflow. Each data entry is annotated with intermediate answers and visual localization information. Its creation adopts a two-stage strategy: first, spatial alignment pre-training is performed using datasets such as CC3M and Flickr30K; then, the scene graphs and functional programs of GQA are decomposed into discrete visual reasoning steps. This dataset is mainly applied in the field of visual question answering (VQA), aiming to solve the problem that model reasoning processes are disconnected from visual evidence, and verify the comprehensive performance of models across three dimensions: answer accuracy, reasoning consistency and visual localization accuracy through a structured evaluation framework.

创建时间:
2026-06-22
搜集汇总
数据集介绍
ComposerGCoT 数据集图片
构建方式
ComposerGCoT数据集是为了严格验证可学习的代理令牌视觉定位机制而构建的。它基于GQA场景图和功能程序,通过规则驱动的管道将类似SQL的推理路径分解为离散的、视觉可定位的步骤。每个步骤都标注有中间答案和视觉定位注释,最终从55K张图像中生成163K个高质量的推理链。
特点
该数据集的核心特点在于提供了细粒度的逐步推理监督,从而能够对模型能力进行整体评估。它超越了最终的答案准确性,能够评估整个推理路径的一致性以及视觉定位的忠实度,确保模型推理步骤与图像证据之间存在可学习的语义联系。
使用方法
ComposerGCoT数据集主要用于评估多模态大语言模型在基础视觉推理任务中的表现。使用方法包括:通过最终答案准确性判断模型预测是否正确;利用结构化输出格式解析模型生成的视觉能力序列,通过任务序列准确性评估推理逻辑一致性;通过在整个推理序列上计算IoU@k指标,评估视觉定位的精确度。
背景与挑战
背景概述
ComposerGCoT数据集由法国巴黎-萨克雷大学、CEA List实验室的研究团队于2025年创建,旨在解决多模态大语言模型在视觉问答任务中缺乏可解释性的核心问题。该数据集通过蒸馏GQA的语义场景图与功能程序,采用基于规则的流水线将SQL式推理路径分解为离散的、具备视觉锚定的中间步骤,最终构建了涵盖55K图像、163K高质量推理链的专用基准。其创新之处在于支持对模型进行三维度评估:最终答案准确性、推理路径一致性以及视觉定位精度,填补了现有评估协议仅关注最终答案的缺陷。ComposerGCoT的发布首次实现了对模型“是否基于正确理由给出正确预测”的严格诊断,为推进可信赖、可解释的多模态推理研究提供了关键验证工具。
当前挑战
ComposerGCoT所应对的核心挑战源于现有接地视觉推理方法中根深蒂固的“语义-空间鸿沟”:传统基于坐标回归的范式将空间位置视作任意文本字符串,导致模型在推理过程中常产生与图像证据不符的伪影坐标,严重损害解释忠实性。在数据集构建层面,面临的挑战在于如何从GQA原始功能程序自动生成细粒度、多步骤且具备中间空间监督的推理链,要求每条推理路径的每一步骤都必须显式关联对应图像区域。此外,现有评估基准的匮乏使得模型可靠性诊断无从下手——仅依赖最终答案准确率无法区分真正的因果推理与基于语言偏误的侥幸正确,而ComposerGCoT需首次实现推理步骤一致性与视觉定位保真度的量化解耦评估。
常用场景
经典使用场景
在视觉问答(VQA)与多模态大语言模型(MLLMs)领域,ComposerGCoT数据集专为细粒度、可解释的视觉推理评估而设计。其最具代表性的使用场景在于验证基于可学习代理令牌(proxy-token)的视觉定位机制,该机制通过离散符号指针直接索引图像潜空间,取代传统坐标回归范式。研究者和开发者可利用此数据集,对模型在复杂多步推理任务中的中间步骤定位精度与逻辑一致性进行系统性诊断,尤其适用于对比不同视觉定位策略(如坐标文本化与代理令牌索引)对推理忠实性的影响。该场景的核心价值在于超越了仅关注最终答案准确率的传统评估,转而强调推理路径的视觉可溯源性。
解决学术问题
ComposerGCoT精准解决了当前接地视觉推理(GVR)研究中的两大核心学术困境:一是语义-空间鸿沟问题,即传统坐标回归方法使模型仅将空间位置作为任意文本字符串处理,缺乏与视觉特征的可学习关联,导致推理步骤与图像证据脱节;二是评估体系浅表化问题,现有基准多聚焦于最终答案准确率,掩盖了模型可能依赖语言偏差或虚假相关性而答对却推理有误的缺陷。通过提供163K条包含完整中间答案与视觉定位标注的高质量推理链,ComposerGCoT使得研究人员能够首次从答案正确性、推理一致性及视觉定位精度三个维度对模型进行全面剖析,推动了可信赖多模态推理评估标准的建立。
衍生相关工作
ComposerGCoT的诞生催生了多条富有启发的研究路径。直接衍生的经典工作包括:基于离散代理令牌的视觉定位范式(如Composer模型自身)证明了可学习语义链接相较于坐标文本化在定位精度(IoU@0.95提升9.0点)上的显著优势;其结构化输出标签体系(<think>/<answer>块与视觉能力标签)为后续研究提供了标准化评估接口,启发了如显式多步推理链损失函数的设计;此外,该数据集所依仗的规则化合成管线(从GQA场景图分解推理路径)推动了合成数据构建方法的优化,促使学术界探索如何在有限标注成本下生成具有细粒度中间监督的高质量训练与评估数据,从而服务于更广泛的视觉推理模型诊断与鲁棒性提升工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务