BenchCheck-FramesPixels
收藏资源简介:
BenchCheck-FramesPixels是一个用于评估视频理解模型在分辨率、帧率和帧数变化下性能的数据集。它包含84个视频基准测试(benchmarks),每个基准测试有300个多项选择题(items),使用Qwen3-VL-8B-Instruct模型在多种条件(分辨率阶梯:168/224/336/448/原始短边;帧率阶梯:0.25/0.5/1/2 fps;帧数阶梯:8/32/128帧)下进行推理。数据集提供了标准化视频(19633个,存储为video.mp4及meta.json)、每个基准测试的样本文件(items/samples/<bench>.jsonl)、推理结果(results/conditions_results.csv和results/p1_raw/<condition>/<benchmark>__DIAG_V.jsonl)以及详细日志。该数据集旨在分析不同视频基准测试对像素细节和帧数变化的敏感度,总推理次数约230k。
BenchCheck-FramesPixels is a dataset designed to evaluate the performance of video understanding models under variations in resolution, frame rate, and number of frames. It contains 84 video benchmarks, each with 300 multiple-choice items, using the Qwen3-VL-8B-Instruct model for inference under multiple conditions (resolution ladder: 168/224/336/448/original short side; frame rate ladder: 0.25/0.5/1/2 fps; frame count ladder: 8/32/128 frames). The dataset provides normalized videos (19,633, stored as video.mp4 and meta.json), sample files per benchmark (items/samples/<bench>.jsonl), inference results (results/conditions_results.csv and results/p1_raw/<condition>/<benchmark>__DIAG_V.jsonl), and detailed logs. This dataset aims to analyze the sensitivity of different video benchmarks to pixel details and frame count variations, with approximately 230k total inference runs.
BenchCheck-FramesPixels 数据集详情
该数据集是 “分辨率 × 帧率”扫描任务(任务11)的运行包,用于在独立 GPU 机器上执行视频基准测试,以系统评估 Qwen3-VL-8B-Instruct 模型在像素(分辨率)与帧(帧率/帧数)维度的表现偏好。
1. 核心任务目标
- 对 84 个视频基准(每个基准 300 个相同多选题)运行 Qwen3-VL-8B-Instruct。
- 在 分辨率阶梯、帧率阶梯、帧数阶梯 三种条件下生成模型输出。
- 分析结果由原始端完成,用于判断每个基准是偏好“像素”(更高分辨率)、“帧”(更多帧),还是两者皆需或都不需要。
2. 评估条件(固定协议)
| 阶梯类型 | 具体条件 | 说明 |
|---|---|---|
| 分辨率(固定32帧) | v_32_s168, v_32_s336(新增);v_32_s224, v_32_s448, v_32(已有) | 短视频下采样至 168/224/336/448 像素或存储分辨率。 |
| 帧率(短边224) | v_fps0.25_s224, v_fps0.5_s224, v_fps1_s224, v_fps2_s224(新增) | 按固定帧率网格取最近存储帧并去重;上下文上限为 N_max = min(1024, floor(56500 / tokens_per_frame)),16:9 视频 N_max=582;超出后按时间均匀重采样。 |
| 帧数(短边224) | v_8_s224, v_128_s224(新增);v_32_s224(已有) | v_128_s224 对少于 128 帧的视频发送全部帧。 |
| 基础条件 | v_blind, v_1, v_32, v_32_s224, v_32_s448 | 多数基准已在原始集群计算;运行器跳过已有行,仅补跑缺失部分(84 个基准中 24 个缺少部分基础条件)。 |
总工作量:84 基准 × 300 项 × 8 个新条件 = 201,600 次推理,另加约 30,000 次基础条件推理。
3. 硬件与软件要求
- 目标硬件:4× NVIDIA B200(180 GB),每 GPU 一个 vLLM 服务器;32 GB GPU(如 RTX 5090)需调整 MAX_SEQS=8。
- 模型:Qwen3-VL-8B bf16(约 16.4 GB),使用固定修订版
0c351dd01ed87e9c1b53cbc748cba10e6187ff3b。 - 软件栈:vllm 0.11.0 + torch 2.8 cu128;要求
--max-model-len 65536、--limit-mm-per-prompt {"image": 1024}、--token-budget 58000。 - 存储:视频 94 GB(解压后)+ 94 GB tar 分片(可删除)、模型 17 GB。
- CPU:帧解码为 CPU 密集型,建议 16+ 核心。
4. 数据分布与获取
- 视频存储在
videos/videos_*.tar分片中,共 19,633 个视频(经 SHA256 校验),解压至data/store/normalized/<hash>/{video.mp4, meta.json}。 - 数据项:
items/samples/<bench>.jsonl(84 个文件),清单manifest/manifest_subset.jsonl。 - 现有结果:
results/conditions_results.csv+results/p1_raw/v_32/(用于断点续跑和 480 存储分辨率复用规则)。 - 共 25,193 个数据项,其中 96 个无标准化视频(记录为失败,由原始集群处理)。
5. 运行方式与输出
- 运行脚本
code/run_frames_pixels.sh,支持--dry-run预检和PILOT=1试运行(先跑 MVBench、LVBench、TimeScope)。 - 可恢复:已有行自动跳过。
- 输出文件:
results/conditions_results.csv(新行)、results/p1_raw/<condition>/<benchmark>__DIAG_V.jsonl(原始输出)、logs/(vLLM 日志、运行日志、计时与失败记录)。 - 环境变量:
NGPU、WORKERS(默认每 GPU 6)、MAX_SEQS(32)、GPU_UTIL(0.85)、BENCH和CONDS用于限制范围。
6. 检查点与限制
- 预检:基础条件对 60 个已有基准应显示
todo=0;新条件应显示todo=300(或更少)。 - 试运行后:LVBench/TimeScope 长视频在 fps1/fps2 下
meta.capped_ctx=true,fps0.25 下为 false;MVBench 短视频永不封顶;16:9 视频n_max=582。 - 失败日志:
data/logs/failures.jsonl应保持简短;单条件数百次失败表明 vLLM 重启(查 OOM,降低 MAX_SEQS 后重跑)。
7. 不可变更项
提示词、帧选择、分辨率、帧率网格与封顶规则、JPEG 质量(q=85)、temperature=0 和 max_tokens=128、模型修订版、--token-budget 58000 等协议参数禁止修改。若机器无法提供 65536 上下文,须停止并上报而非降低配置。
8. 结果回传
- 打包:
results/conditions_results.csv、results/p1_raw、logs、data/logs为 tar.gz 并计算 SHA256,上传回数据集returns/目录。 - 无写令牌时通过任意方式传输 tarball 和校验值;报告中需包含试运行计时表、总墙钟时间、各条件新增行数、失败数及示例 item id、精确的 vLLM 启动命令。





