遇见数据集

AdaCoVT-Experiments

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

本数据集关联的实验研究基于两个视觉问答(VQA)或视觉理解基准数据集:CV-Bench和BLINK。CV-Bench数据集包含2638个样本,任务类型涵盖计数(Count)、深度估计(Depth)、距离估计(Distance)和关系理解(Relation)。BLINK数据集包含681个样本,任务类型涵盖相对深度(Relative_Depth)、物体定位(Object_Localization)、空间关系(Spatial_Relation)、计数(Counting)和视觉对应(Visual_Correspondence)。这些数据集被用于评估Adaptive Routing of Latent Perception Tokens in CoVT方法(AdaCoVT)的性能,实验对比了包括全专家模型、路由模型、零分配等多种方法,并在VQA准确率、专家令牌使用数量和延迟等指标上报告了结果。

The experimental research associated with this dataset is based on two visual question answering (VQA) or visual understanding benchmark datasets: CV-Bench and BLINK. The CV-Bench dataset contains 2638 samples, with task types covering counting (Count), depth estimation (Depth), distance estimation (Distance), and relation understanding (Relation). The BLINK dataset contains 681 samples, with task types covering relative depth (Relative_Depth), object localization (Object_Localization), spatial relation (Spatial_Relation), counting (Counting), and visual correspondence (Visual_Correspondence). These datasets are used to evaluate the performance of the Adaptive Routing of Latent Perception Tokens in CoVT method (AdaCoVT), with experiments comparing various methods including full expert models, routing models, and zero allocation, and reporting results on metrics such as VQA accuracy, expert token usage count, and latency.

创建时间:
2026-06-05
原始信息汇总

数据集概述

名称: AdaCoVT Experiments

描述: 该数据集包含“Adaptive Routing of Latent Perception Tokens in CoVT”方法的实验结果,旨在探索在CoVT模型中自适应路由潜在感知令牌的效果。


关键结果

下表展示了不同方法在VQA准确率、专家令牌使用数量和延迟方面的对比:

方法 VQA准确率 专家令牌数 延迟
Oracle minimal 81.8% 3.4
Oracle detector 80.2% 4.2
Full experts (实际) 79.4% 9.9 3.51秒
Routed (实际, 相同流程) 79.2% 8.3 4.13秒
Zero-all + BanExpert 63.2% 0 2.28秒

文件内容

Phase 0 KV-Level 消融实验

  • results/phase0_kv_cvbench_fixed.json — CV-Bench数据集上的2638个样本,使用固定答案解析器
  • results/phase0_kv_blink_fixed.json — BLINK数据集上的681个样本
  • results/phase0_kv_*_merged.json — 合并后的结果

实际推理

  • results/real_routed_single.json — 完整的CV-Bench路由推理结果(2638个样本)
  • results/b4_fair.log — 公平配对比较(完整模型 vs 路由模型,相同流程)
  • results/real_routed_fixed2.log — 使用BanExpertTokens修复后的结果

检测器检查点

  • checkpoints/detector/best.pt — 二值检测器(标准版)
  • checkpoints/detector/best_costsens.pt — 成本敏感检测器(NEED权重=2)

消融实验

  • results/b6_ablation.log — 完整模型 vs AdaCoVT vs 仅问题 vs SafeRouter vs 随机 vs 无
  • results/detector_cost_sensitive.log — NEED权重扫描

基础模型

  • 模型名称: CoVT-7B (seg_depth_dino, Qwen2.5-VL-7B)
  • 模型来源: Wakals/CoVT

基准测试

  • CV-Bench: 包含计数、深度、距离、关系四个子任务
  • BLINK: 包含相对深度、物体定位、空间关系、计数、视觉对应五个子任务
搜集汇总
数据集介绍
AdaCoVT-Experiments 数据集图片
构建方式
AdaCoVT-Experiments数据集源于对自适应路由潜在感知令牌机制在协同视觉变换器中的实验探究。该数据集基于CoVT-7B模型构建,以Qwen2.5-VL-7B为骨干,集成了分割深度与DINO特征。实验设计涵盖了从KV级消融到实际推理的多阶段评估流程,其中阶段零通过CV-Bench与BLINK基准生成固定解析结果,实际推理阶段则记录了路由推理与配对比较日志。消融实验囊括了完整专家、自适应路由、仅问题路由、安全路由及随机路由等多种策略,并包含了二值检测器及其成本敏感变体的检查点文件,从而系统性地构建了一个多层次、可复现的实验结果集合。
特点
该数据集的核心特色在于其精细化的路由效率与精度权衡分析框架。通过记录Oracle最小令牌数、真实完整专家推理与自适应路由下VQA准确率、专家令牌消耗及延迟等关键指标,数据集揭示了自适应路由能够在仅消耗8.3个专家令牌的情况下达到79.2%的准确率,显著优于完整专家推理的3.51秒延迟。此外,数据集包含了成本敏感检测器的权重扫描结果,展示了在NEED权重为2时的检测器性能,体现了对计算资源利用与任务精度之间平衡关系的深入探索,为多模态大模型中的令牌高效路由提供了实证基准。
使用方法
研究人员可利用本数据集进行自适应路由策略的性能复现与比较分析。通过加载checkpoints目录下的检测器检查点,在CV-Bench和BLINK基准上运行路由推理,并与results目录中提供的固定解析结果和消融日志进行对比,以验证不同路由方法的有效性。数据集同时支持针对令牌分配策略的细粒度消融研究,用户可修改BanExpertTokens参数并参考real_routed_fixed2.log调整路由决策,从而在相同的CoVT-7B流水线上评估新颖的路由算法对计算开销与任务精度的综合影响。
背景与挑战
背景概述
AdaCoVT-Experiments数据集诞生于2025年,由研究团队Wakals针对多模态大语言模型在视觉推理任务中的效率问题而创建,核心研究聚焦于感知令牌的适应性路由机制。该数据集基于CoVT-7B模型(融合Qwen2.5-VL-7B与深度感知分割模块),旨在通过动态调整专家令牌数量来平衡模型性能与推理延迟,从而解决视觉问答(VQA)任务中计算资源浪费的瓶颈。实验覆盖CV-Bench和BLINK两大基准,涵盖计数、深度估计、空间关系等复杂视觉推理场景,为令牌路由算法的鲁棒性评估提供了标准化测试平台。其提出的Oracle最小令牌策略(仅需3.4个令牌即可达到81.8%准确率)揭示了传统全专家模式中高达数倍的计算冗余,对高效多模态系统的设计具有里程碑式的指导价值。
当前挑战
该数据集面临的核心挑战在于如何在视觉问答场景中实现令牌分配与推理性能的帕累托最优。领域问题层面,传统全专家模型(如CoVT-7B)虽能捕获细粒度视觉线索,却因固定激活所有专家导致资源浪费和延迟过长(3.51秒),亟需路由机制在噪声干扰下仍能精确识别关键感知区域。构建过程中,研究者需克服三项技术障碍:其一,二元检测器(vanilla与成本敏感版本)的训练需平衡标注敏感性与泛化性,尤其在深度异常和物体遮挡场景中易产生误判;其二,路由策略的鲁棒性测试需覆盖令牌零分配(如BanExpert导致准确率骤降至63.2%)与过度路由的极端情况;其三,跨模型、跨任务的迁移验证困难,因为同一路由方案在CV-Bench的计数任务与BLINK的空间关系任务中表现差异显著,缺乏统一的理论收敛保证。
常用场景
经典使用场景
AdaCoVT-Experiments 数据集源于对视觉-语言模型中潜在感知令牌路由机制的深入研究,其经典使用场景聚焦于评估自适应路由策略在视觉问答任务上的效能。研究者通过构建包含多种路由方案(如Oracle minimal、Oracle detector、Full experts及Routed)的对比实验框架,系统性地衡量不同策略下的回答准确率、专家令牌消耗量及推理延迟。该数据集为验证令牌级路由技术的有效性提供了标准化的测试平台,尤其适用于探索如何在不牺牲性能的前提下动态降低计算开销。
衍生相关工作
该数据集衍生了多项经典研究工作,包括基于二进制检测器的令牌级路由模型(vanilla detector及其成本敏感变体cost-sensitive detector),以及针对不同任务复杂度的自适应路由消融实验(如AdaCoVT与SafeRouter、Random路由策略的对比)。CV-Bench和BLINK两个基准测试中分别涵盖了2638和681个样本的细粒度评估,在此基础上,研究者进一步探索了NEED权重扫描对路由决策的影响。此外,该工作与CoVT-7B基础模型联动,推动了基于Qwen2.5-VL架构的模块化视觉推理范式发展。
数据集最近研究
最新研究方向
随着多模态大语言模型在视觉-语言任务中展现出卓越能力,如何高效处理视觉感知信息成为前沿焦点。AdaCoVT实验探索了在CoVT-7B模型中引入自适应路由机制,通过动态调配潜在感知令牌的数量,在保持高视觉问答精度的同时显著降低计算开销,尤其针对CV-Bench与BLINK等基准测试。该研究方向呼应了当前对高效多模态推理的热点需求,即在不牺牲性能的前提下实现模型的轻量化部署,其在延迟与专家令牌数上的实验对比为构建更经济的视觉语言系统提供了关键洞见。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务