遇见数据集

See2ThinkBench

收藏
github2026-07-30 更新2026-08-04 收录
数据链接:
官方服务:

资源简介:

See2ThinkBench包含1,200个样本,涵盖12个任务类别,覆盖2D结构推理、3D场景推理和真实世界视觉推理。

See2ThinkBench contains 1,200 samples, spanning 12 task categories, and covers 2D structural reasoning, 3D scene reasoning, and real-world visual reasoning.

创建时间:
2026-07-28
原始信息汇总

数据集概述

See2Think 是一个用于诊断多模态模型是否真正使用中间视觉状态的数据集与评测框架。其核心研究问题为:模型能够生成看似有用的中间图像,但后续推理是否真的依赖该视觉状态?

数据集规模与构成

  • 总量:包含 1,200 个开放式、依赖视觉的样本
  • 任务类别:覆盖 12 个任务类别,分为三个互补的推理世界:
    • 二维结构推理:图表、几何与符号视觉结构。
    • 三维场景推理:空间关系、具身场景与操纵。
    • 真实世界视觉推理:自然图像与多模态问答。

评测协议与诊断机制

数据集提出 视觉思维行动(Visual Action-of-Thought, VAoT) 协议,记录完整推理轨迹:文本思维、视觉行动、渲染状态、后续推理及最终答案。通过四种匹配的推理设置进行诊断:

设置 视觉行动 渲染反馈 诊断作用
CoT 纯文本推理基线
VAoT-NoRender 提出行动本身是否有用
VAoT-Full 真实视觉反馈是否有帮助
VAoT-WrongRender 被破坏 后续推理是否依赖返回的视觉证据

数据集提供三个过程级测量指标:行动相关性(所选视觉操作是否针对任务相关证据)、渲染忠实性(渲染器是否忠实执行请求操作)、反馈采纳性(模型在后续推理中是否实际使用渲染状态)。

主要内容与结果

  • 提供最终答案准确率与过程行为相结合的报告,区分“看似正确”与“正确使用中间视觉状态”。
  • 主要分析包括:四种设置之间的匹配比较、成对渲染收益与破坏反馈敏感性、过程评判及人工审计。
  • 仓库包含推理管线、转换解析、评估代码、提示词及最小示例清单。完整基准数据、生成轨迹、渲染图像及日志未包含在公开仓库中。

使用方式

可通过仓库提供的快速启动指南安装环境、配置模型端点并运行四种推理设置(text_cot、vaot_no_render、vaot_full、vaot_wrong_render)及对应的答案与过程评估。项目采用 MIT 许可证。

搜集汇总
数据集介绍
See2ThinkBench 数据集图片
构建方式
See2ThinkBench数据集旨在系统评估多模态模型对中间视觉状态的真实依赖程度。其构建过程汇聚了1200个开放式且视觉依赖的问题样本,涵盖12个任务类别,并划分为二维结构推理、三维场景推理与真实世界视觉推理三大互补的视觉世界。每个问题均设计为需要模型主动提出视觉操作(如绘制辅助线、裁剪区域或突出对象)并观察渲染后的中间图像,从而构建出完整的推理轨迹。该数据集通过精心设计的四组匹配推理设置(纯文本推理、无渲染视觉行动、完整视觉反馈及错误渲染反馈)与三项过程级测量(行动相关性、渲染忠实度与反馈采纳度),实现了对模型视觉状态使用过程的细粒度诊断。
特点
该数据集的独特之处在于其从“最终答案正确性”转向“过程行为可测性”的评估范式。See2ThinkBench不仅提供最终答案的自动评判,更引入了“视觉思维行动”协议,完整记录文本思考、视觉行动、渲染状态、后续推理及最终答案的全链条信息。其四组匹配设置使研究者能够剥离单一变量,独立考察提出视觉行动本身的价值、真实视觉反馈的增益以及模型对反馈的依赖程度。通过错误渲染干预,数据集能够揭示模型后续推理是否真正建立于返回的视觉证据之上,从而区分“表象正确”与“过程正确”。此外,三项过程级测量与人工审核机制保障了评估的可靠性与深度。
使用方法
使用者可通过克隆代码仓库并配置模型端点快速启动。具体步骤包括创建Python虚拟环境并安装依赖,复制配置文件以设置各模型API密钥及本地路径。由于公开仓库不包含完整任务清单与基准图像,使用者需按照示例格式提供自定义任务清单。运行推理时,可通过指定`--setting`参数选择文本推理、无渲染、完整渲染或错误渲染四种模式,并利用多进程加速。后续评估涉及构建答案评判输入与执行过程级评判,分别对应最终答案质量与行动相关性、渲染忠实度、反馈采纳度的自动化诊断。该工具包支持灵活接入多种模型后端,适用于多模态模型推理过程的可解释性研究。
背景与挑战
背景概述
See2ThinkBench是See2Think项目推出的核心基准,由中南大学等机构的研究者于2026年构建,旨在探究多模态模型是否真正依赖中间视觉状态进行推理。该基准包含1200个开放式、视觉依赖的问题,覆盖2D结构、3D场景及真实世界推理三大视觉领域,共12类任务,并引入视觉思维行动(VAoT)协议,通过四种推理设置和三种过程级测量,细粒度诊断模型的行为。其影响力在于推动多模态推理评估从结果导向转向过程透明化,为理解模型内部推理机制提供了新范式。
当前挑战
该数据集面临的挑战包括:领域层面,多模态模型常生成看似合理的中间图像,但最终答案的准确性无法揭示视觉动作的相关性、渲染器的忠实性及反馈对后续推理的影响,需构建能区分偶然正确与真正利用视觉状态的评估体系。构建层面,基准需精心设计跨多个视觉世界的多样化任务,确保问题的开放性与视觉依赖性,同时开发VAoT协议以分离动作、渲染与反馈变量,还需构建人工审计机制保障过程评判和错误渲染的质量,这些均在数据收集、标注和验证上带来显著困难。
常用场景
经典使用场景
See2ThinkBench提供了一个包含1200个开放式、视觉依赖问题的基准测试,横跨2D结构推理、3D场景推理和现实世界视觉推理三大领域。该数据集的核心应用场景在于评估多模态大模型在推理过程中是否真正利用中间视觉状态,通过四种匹配的推理设置(CoT、VAoT-NoRender、VAoT-Full和VAoT-WrongRender),研究者可以系统性地诊断模型在视觉动作选择、渲染执行和后续推理反馈三个层面的行为表现。这种精细化的过程诊断方法使得See2ThinkBench成为验证多模态模型推理透明度和可靠性的重要工具。
解决学术问题
该数据集解决了多模态模型评估中的一个关键学术难题:仅凭最终答案的准确性无法判断模型是否真正依赖中间视觉状态进行推理。通过引入视觉动作思维(VAoT)协议,See2ThinkBench能够分离动作相关性、渲染忠实度和反馈采纳度三个过程级指标,从而揭示模型是'看起来正确'还是'真正使用了视觉信息'。这一方法为因果推理、模型可解释性和多模态认知研究提供了新的实验范式,推动了从结果导向到过程导向的评估转变,对理解大模型的认知机制具有重要意义。
衍生相关工作
See2ThinkBench的提出催生了多个相关研究方向,包括视觉推理过程的可解释性研究、基于中间视觉状态的模型增强方法,以及对抗性干扰下的鲁棒性分析。其VAoT协议为后续工作提供了标准化框架,推动了诸如'视觉思维链'(Visual Chain-of-Thought)和'渲染感知推理'(Render-Aware Reasoning)等主题的深入探索。同时,该数据集也促进了多模态基准测试方法的演进,启发了针对模型内部状态依赖性的因果评估工具开发,并在模型审计和公平性检验中展现出应用潜力,形成了一系列关于多模态推理透明度的高影响力学术成果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务