遇见数据集

BenchCheck-Pool

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

BenchCheck-Pool 是一个用于评估视频理解模型的多选题数据集。该数据集包含来自 139 个视频基准测试的 299,366 道多项选择题(经过去重处理)。每道题提供问题文本和多个选项,并配有对应的视频帧缓存(来自 GMLRVigil/BenchCheck-Pool-Frames 数据集)。数据集设计用于通过三步筛选流程(盲测、单帧、32 帧)测试模型(如 Qwen3-VL 系列)对视频内容的推理能力。数据以 parquet、csv、jsonl 格式存储,包含题目 ID、选项、模型 log-probability 等信息。整体数据规模约为 80 MB(题目文件)加上约 35 GB 的帧缓存。该数据集适用于视频问答、多模态理解、模型鲁棒性评估等研究场景。

BenchCheck-Pool is a multiple-choice dataset for evaluating video understanding models. It contains 299,366 multiple-choice questions (deduplicated) from 139 video benchmarks. Each question provides text and options, accompanied by corresponding video frame caches (from the GMLRVigil/BenchCheck-Pool-Frames dataset). The dataset is designed to test models (such as the Qwen3-VL series) on video content reasoning through a three-step screening process (blind test, single frame, 32 frames). Data is stored in parquet, csv, and jsonl formats, including question IDs, options, and model log-probabilities. The overall data size is approximately 80 MB (question files) plus about 35 GB of frame caches. This dataset is suitable for research scenarios such as video question answering, multimodal understanding, and model robustness evaluation.

创建时间:
2026-09-08
原始信息汇总

BenchCheck-Pool 数据集详情

数据集概览

BenchCheck-Pool 是一个用于视频基准测试全项目池筛选的数据集,包含139个视频基准测试中的299,366道多项选择题(经过第0步去重后)。该数据集旨在通过三步基于模型的筛选流程,从大规模题库中筛选出高质量测试项目。数据集的配套数据集 GMLRVigil/BenchCheck-Pool-Frames(公开)提供帧缓存。

筛选流程

数据集的筛选流程分为三个步骤,每步使用不同的 Qwen3-VL 模型和输入配置:

步骤 模型 输入 移除规则
步骤1(盲测) Qwen3-VL-8B-Instruct 问题+选项,无帧,每题4个选项排列 4个排列中≥3个选择正确答案且平均边际>log 2
步骤2(单帧) Qwen3-VL-8B-Instruct 中间帧(448像素长边)+问题 正确答案为最大概率且边际>log 2
步骤3(32帧) Qwen3-VL-2B-Instruct 32个均匀帧(448像素)+问题 同步骤2

运行逻辑:步骤2仅对通过步骤1且有帧的项目运行;步骤3仅对通过步骤2的项目运行。协议相关的提示词、排列种子、帧选择、分辨率、模型版本和边际规则均在代码中固定,不可更改。

硬件与软件要求

  • 目标硬件:4x NVIDIA B200(各180 GB),也支持32 GB GPU
  • 运行架构:每GPU运行1个vLLM服务器和1个客户端分片
  • 软件环境:Python 3.12,vLLM 0.11.0 + torch 2.8(CUDA 12.8)
  • VRAM占用:Qwen3-VL-8B约16.4 GB,Qwen3-VL-2B约4.4 GB,GPU内存利用率设置为0.85
  • 磁盘需求:项目80 MB,帧约35 GB(解压后+35 GB tar分片),结果<2 GB,模型权重约21 GB

数据规模与预期

  • 完整项目数:299,366个项目(= 1,197,464次前向传播)
  • 含帧项目:183,196个项目(67,021个视频)在当前快照中有帧
  • 跳过项目:116,170个项目引用的视频尚未在源集群下载(video_id以k:开头),步骤2和3会跳过
  • 预计运行时间(4x B200上):步骤1约1-2小时,步骤2约1.5-2.5小时,步骤3约2-4小时

运行过程

数据获取与准备

  1. 下载数据集和帧缓存,验证SHA256校验
  2. 解压帧tar文件(预期67,021个视频,见frames_manifest.json
  3. 将项目文件复制到结果目录

运行命令

bash STEP=1 bash code/run_remote.sh --plan-only # 预期显示299,366个项目 STEP=1 bash code/run_remote.sh # 执行步骤1 STEP=2 bash code/run_remote.sh --plan-only # 上限183,196个项目 STEP=2 bash code/run_remote.sh # 执行步骤2 STEP=3 bash code/run_remote.sh --plan-only STEP=3 bash code/run_remote.sh # 执行步骤3

各步骤可重复运行并从中断处继续(按item_id按键)。环境变量可配置:NGPU(GPU数)、WORKERS(每GPU客户端线程数)、PORT0GPU_UTILPYVLLM

进度验证

--plan-only参数打印REMAINING_TOTAL=<n>,当打印0时表示步骤完成。

质量控制与已知限制

健全性检查

  • 步骤1应移除每基准少数项目(300项样本中通常为20-60%);若接近100%或0%移除率需检查客户端日志
  • 步骤1每个项目应有4次排列转发
  • 状态非"ok"的行自动重试;百万次转发中出现几百次永久错误属正常,数千次需检查vLLM日志是否有OOM

已知限制

  • vLLM 0.11.0需CUDA 12.8 + torch 2.8 wheels(支持Blackwell B200 / RTX 5090)
  • --max-logprobs 20continue_final_message为vLLM特有功能,客户端不兼容其他服务栈
  • 帧缓存为快照,部分video_id可能缺少目录属预期情况

结果文件与返回

运行产出:

  • results/pool/step1/*.jsonl(每项目一行,追加式,可恢复)
  • results/pool/step2/*.jsonl
  • results/pool/step3/*.jsonl

结果打包上传至 GMLRVigil/BenchCheck-Pool 仓库的returns/目录。报告中需说明每步骤的完成项目数、移除项目数、错误行数(含示例item_ids)、墙钟时间和每GPU每秒项目数,以及对run_remote.sh的任何修改。

搜集汇总
数据集介绍
BenchCheck-Pool 数据集图片
构建方式
BenchCheck-Pool数据集的构建流程严谨而系统,旨在通过多阶段筛选机制从海量视频问答题目中甄别出高质量的基准测试项。该过程首先对139个视频基准的299,366道多项选择题进行去重,随后依次执行三个基于模型的筛选步骤。每个步骤均采用Qwen3-VL系列模型,通过分析模型对题目各选项的log概率来判断题目是否具备容易辨识的答案。具体而言,步骤一为盲测,不提供视频帧,通过四种选项排列检验模型能否稳定选择正确选项;步骤二则引入中间帧,检验模型在单帧信息下的审判能力;步骤三进一步扩展至32帧均匀采样,以评估模型对完整视频内容的理解。每一步均设定了严格的移除规则,即模型以超过log 2的置信度选择正确选项时,该题目即被判定为过于简单,从而从池中剔除。这一迭代式筛选确保了最终保留的题目具备足够的挑战性和区分度。
特点
BenchCheck-Pool数据集的核心特点在于其对视频理解模型性能的精准校准能力。通过逐步增加视觉信息的复杂度,该数据集能够系统性地评估模型在多种条件下(无帧、单帧、多帧)的推理稳健性。此外,数据集的构建过程高度可重复且具备容错性,能够从部分失败或中断中自动恢复,保证了结果的完整性。该数据集还涵盖了广泛的视频基准,包括文本注释、人工标注的开放性问题以及多选格式,为视频-语言模型的综合评测提供了丰富素材。其筛选逻辑基于对数概率和排列验证,确保了数据质量,而所有协议代码均被固定,以保障科学研究的一致性和可复现性。
使用方法
使用BenchCheck-Pool数据集进行评测时,用户需遵循严格的运行协议。首先,需要配置合适的硬件环境,推荐使用4块NVIDIA B200或至少32GB显存的GPU,并安装指定版本的vLLM和模型(Qwen3-VL-8B-Instruct与Qwen3-VL-2B-Instruct)。随后,通过执行启动脚本,系统会按照步骤1至3的顺序自动进行推理与筛选,每个步骤的输出以JSONL格式存储,便于增量式追踪进度。用户可根据实际需求修改并行度等参数,但核心协议代码和模型参数不可更改,以确保评估结果的可比性。最终,运行结果会被打包上传,用户可根据返回的统计信息,如各步骤移除的题目比例,来洞察模型在不同视觉条件下的表现差异。
背景与挑战
背景概述
BenchCheck-Pool数据集由GMLRVigil团队于近期创建,旨在解决视频理解基准测试中题目池质量不一的问题。随着视频语言模型(如Qwen3-VL)的快速发展,现有基准如Video-MME等虽覆盖广泛,但存在题目过易或过难、无法有效区分模型能力等缺陷。该数据集汇集139个视频基准的299,366道多项选择题(经去重),通过三步模型筛选流程,利用Qwen3-VL-8B/2B模型的输出对数概率,依据固定规则移除模型可轻易答对的题目,以构建更具挑战性的评测集。其核心研究问题在于如何系统化筛选高质量视频问答题目,提升基准的判别力。该数据集及配套代码为视频理解评估提供了新范式,对后续基准设计与模型评测具有重要影响。
当前挑战
BenchCheck-Pool面临的挑战涵盖领域问题与构建过程两方面。领域层面,视频基准中大量题目难以区分模型优劣,且视频帧采样、问题表述等易引入偏差,需设计稳健筛选规则。构建过程面临多重困难:一是需处理海量多模态数据,包含67,021个视频的帧缓存,存储与计算开销大;二是三步筛选依赖模型对数概率,需精确控制推理参数与模型版本,确保结果可复现;三是步骤间存在依赖,仅部分题目有帧供后续筛选,导致处理不均;四是计算资源要求高,需多GPU并行,且需处理内存溢出、日志异常等工程问题。此外,筛选需在保持题目多样性(如选项排列)与去除易答题目间取得平衡,避免过度精简或引入偏差。
常用场景
经典使用场景
BenchCheck-Pool数据集作为视频基准测试的全面筛选工具,其经典使用场景聚焦于大规模多选题视频理解基准的自动化清理与净化。该数据集整合了139个视频基准、近30万个多项选择题项,通过三步模型筛选流程(无帧盲测、单帧推理、多帧时序分析)系统性地剔除可被现成视觉语言模型轻易解答的题目,从而为后续基准的可靠性评估与难度标定提供纯净的题目池。研究者可借助该数据集对候选题目进行严格分级,确保在模型能力快速迭代的背景下,基准测试仍能有效区分不同模型间的性能差异,并规避因题目泄露或盲目猜测导致的评估失真现象。
解决学术问题
该数据集有效解决了视频问答基准领域长期存在的‘基准饱和’与‘题目冗余’难题,即随着视觉语言模型能力的跃升,大量既有题目逐渐丧失判别力,致使得分普遍偏高而无法反映真实进展。BenchCheck-Pool通过严格的三级筛选机制,在无需人类标注的前提下识别并移除那些模型可凭借先验知识、单帧线索或浅层时序模式即可正确作答的题项,从而保留具有挑战性的核心题目。这一方法为基准维护者提供了一套可复现、可扩展的自动化净化工序,促进了更精准、更鲁棒的模型能力评估体系构建,对推动视频理解领域的科学进步具有深远意义。
衍生相关工作
BenchCheck-Pool的发布催生了一系列衍生研究。一方面,其三步筛选方法论启发后续工作探索更精细的难度分层策略,例如利用模型置信度分数来量化题目难度的连续分布,而非仅执行二元移除,进而构建难度梯度基准以细致刻画模型能力边界。另一方面,该数据集所采用的log-probability解析和选项置换自检技术,推动了关于多选题评估中位置偏差与提示敏感性的系统性研究。此外,该工作明确指出的跨快照时间一致性问题,引发了关于视频基准时效追踪与动态更新框架的设计,研究者开始尝试建立基于持续筛选的‘活’基准体系,以确保评估资源的长效价值与题目库的自适应演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务