BenchCheck-Pool
收藏资源简介:
BenchCheck-Pool 是一个用于评估视频理解模型的多选题数据集。该数据集包含来自 139 个视频基准测试的 299,366 道多项选择题(经过去重处理)。每道题提供问题文本和多个选项,并配有对应的视频帧缓存(来自 GMLRVigil/BenchCheck-Pool-Frames 数据集)。数据集设计用于通过三步筛选流程(盲测、单帧、32 帧)测试模型(如 Qwen3-VL 系列)对视频内容的推理能力。数据以 parquet、csv、jsonl 格式存储,包含题目 ID、选项、模型 log-probability 等信息。整体数据规模约为 80 MB(题目文件)加上约 35 GB 的帧缓存。该数据集适用于视频问答、多模态理解、模型鲁棒性评估等研究场景。
BenchCheck-Pool is a multiple-choice dataset for evaluating video understanding models. It contains 299,366 multiple-choice questions (deduplicated) from 139 video benchmarks. Each question provides text and options, accompanied by corresponding video frame caches (from the GMLRVigil/BenchCheck-Pool-Frames dataset). The dataset is designed to test models (such as the Qwen3-VL series) on video content reasoning through a three-step screening process (blind test, single frame, 32 frames). Data is stored in parquet, csv, and jsonl formats, including question IDs, options, and model log-probabilities. The overall data size is approximately 80 MB (question files) plus about 35 GB of frame caches. This dataset is suitable for research scenarios such as video question answering, multimodal understanding, and model robustness evaluation.
BenchCheck-Pool 数据集详情
数据集概览
BenchCheck-Pool 是一个用于视频基准测试全项目池筛选的数据集,包含139个视频基准测试中的299,366道多项选择题(经过第0步去重后)。该数据集旨在通过三步基于模型的筛选流程,从大规模题库中筛选出高质量测试项目。数据集的配套数据集 GMLRVigil/BenchCheck-Pool-Frames(公开)提供帧缓存。
筛选流程
数据集的筛选流程分为三个步骤,每步使用不同的 Qwen3-VL 模型和输入配置:
| 步骤 | 模型 | 输入 | 移除规则 |
|---|---|---|---|
| 步骤1(盲测) | Qwen3-VL-8B-Instruct | 问题+选项,无帧,每题4个选项排列 | 4个排列中≥3个选择正确答案且平均边际>log 2 |
| 步骤2(单帧) | Qwen3-VL-8B-Instruct | 中间帧(448像素长边)+问题 | 正确答案为最大概率且边际>log 2 |
| 步骤3(32帧) | Qwen3-VL-2B-Instruct | 32个均匀帧(448像素)+问题 | 同步骤2 |
运行逻辑:步骤2仅对通过步骤1且有帧的项目运行;步骤3仅对通过步骤2的项目运行。协议相关的提示词、排列种子、帧选择、分辨率、模型版本和边际规则均在代码中固定,不可更改。
硬件与软件要求
- 目标硬件:4x NVIDIA B200(各180 GB),也支持32 GB GPU
- 运行架构:每GPU运行1个vLLM服务器和1个客户端分片
- 软件环境:Python 3.12,vLLM 0.11.0 + torch 2.8(CUDA 12.8)
- VRAM占用:Qwen3-VL-8B约16.4 GB,Qwen3-VL-2B约4.4 GB,GPU内存利用率设置为0.85
- 磁盘需求:项目80 MB,帧约35 GB(解压后+35 GB tar分片),结果<2 GB,模型权重约21 GB
数据规模与预期
- 完整项目数:299,366个项目(= 1,197,464次前向传播)
- 含帧项目:183,196个项目(67,021个视频)在当前快照中有帧
- 跳过项目:116,170个项目引用的视频尚未在源集群下载(video_id以
k:开头),步骤2和3会跳过 - 预计运行时间(4x B200上):步骤1约1-2小时,步骤2约1.5-2.5小时,步骤3约2-4小时
运行过程
数据获取与准备
- 下载数据集和帧缓存,验证SHA256校验
- 解压帧tar文件(预期67,021个视频,见
frames_manifest.json) - 将项目文件复制到结果目录
运行命令
bash STEP=1 bash code/run_remote.sh --plan-only # 预期显示299,366个项目 STEP=1 bash code/run_remote.sh # 执行步骤1 STEP=2 bash code/run_remote.sh --plan-only # 上限183,196个项目 STEP=2 bash code/run_remote.sh # 执行步骤2 STEP=3 bash code/run_remote.sh --plan-only STEP=3 bash code/run_remote.sh # 执行步骤3
各步骤可重复运行并从中断处继续(按item_id按键)。环境变量可配置:NGPU(GPU数)、WORKERS(每GPU客户端线程数)、PORT0、GPU_UTIL、PY、VLLM。
进度验证
--plan-only参数打印REMAINING_TOTAL=<n>,当打印0时表示步骤完成。
质量控制与已知限制
健全性检查
- 步骤1应移除每基准少数项目(300项样本中通常为20-60%);若接近100%或0%移除率需检查客户端日志
- 步骤1每个项目应有4次排列转发
- 状态非"ok"的行自动重试;百万次转发中出现几百次永久错误属正常,数千次需检查vLLM日志是否有OOM
已知限制
- vLLM 0.11.0需CUDA 12.8 + torch 2.8 wheels(支持Blackwell B200 / RTX 5090)
--max-logprobs 20和continue_final_message为vLLM特有功能,客户端不兼容其他服务栈- 帧缓存为快照,部分
video_id可能缺少目录属预期情况
结果文件与返回
运行产出:
results/pool/step1/*.jsonl(每项目一行,追加式,可恢复)results/pool/step2/*.jsonlresults/pool/step3/*.jsonl
结果打包上传至 GMLRVigil/BenchCheck-Pool 仓库的returns/目录。报告中需说明每步骤的完成项目数、移除项目数、错误行数(含示例item_ids)、墙钟时间和每GPU每秒项目数,以及对run_remote.sh的任何修改。




