遇见数据集

BenchCheck-FramesPixels

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

BenchCheck-FramesPixels是一个用于评估视频理解模型在分辨率、帧率和帧数变化下性能的数据集。它包含84个视频基准测试(benchmarks),每个基准测试有300个多项选择题(items),使用Qwen3-VL-8B-Instruct模型在多种条件(分辨率阶梯:168/224/336/448/原始短边;帧率阶梯:0.25/0.5/1/2 fps;帧数阶梯:8/32/128帧)下进行推理。数据集提供了标准化视频(19633个,存储为video.mp4及meta.json)、每个基准测试的样本文件(items/samples/<bench>.jsonl)、推理结果(results/conditions_results.csv和results/p1_raw/<condition>/<benchmark>__DIAG_V.jsonl)以及详细日志。该数据集旨在分析不同视频基准测试对像素细节和帧数变化的敏感度,总推理次数约230k。

BenchCheck-FramesPixels is a dataset designed to evaluate the performance of video understanding models under variations in resolution, frame rate, and number of frames. It contains 84 video benchmarks, each with 300 multiple-choice items, using the Qwen3-VL-8B-Instruct model for inference under multiple conditions (resolution ladder: 168/224/336/448/original short side; frame rate ladder: 0.25/0.5/1/2 fps; frame count ladder: 8/32/128 frames). The dataset provides normalized videos (19,633, stored as video.mp4 and meta.json), sample files per benchmark (items/samples/<bench>.jsonl), inference results (results/conditions_results.csv and results/p1_raw/<condition>/<benchmark>__DIAG_V.jsonl), and detailed logs. This dataset aims to analyze the sensitivity of different video benchmarks to pixel details and frame count variations, with approximately 230k total inference runs.

创建时间:
2026-09-08
原始信息汇总

BenchCheck-FramesPixels 数据集详情

该数据集是 “分辨率 × 帧率”扫描任务(任务11)的运行包,用于在独立 GPU 机器上执行视频基准测试,以系统评估 Qwen3-VL-8B-Instruct 模型在像素(分辨率)与帧(帧率/帧数)维度的表现偏好。

1. 核心任务目标

  • 84 个视频基准(每个基准 300 个相同多选题)运行 Qwen3-VL-8B-Instruct。
  • 分辨率阶梯、帧率阶梯、帧数阶梯 三种条件下生成模型输出。
  • 分析结果由原始端完成,用于判断每个基准是偏好“像素”(更高分辨率)、“帧”(更多帧),还是两者皆需或都不需要。

2. 评估条件(固定协议)

阶梯类型 具体条件 说明
分辨率(固定32帧) v_32_s168, v_32_s336(新增);v_32_s224, v_32_s448, v_32(已有) 短视频下采样至 168/224/336/448 像素或存储分辨率。
帧率(短边224) v_fps0.25_s224, v_fps0.5_s224, v_fps1_s224, v_fps2_s224(新增) 按固定帧率网格取最近存储帧并去重;上下文上限为 N_max = min(1024, floor(56500 / tokens_per_frame)),16:9 视频 N_max=582;超出后按时间均匀重采样。
帧数(短边224) v_8_s224, v_128_s224(新增);v_32_s224(已有) v_128_s224 对少于 128 帧的视频发送全部帧。
基础条件 v_blind, v_1, v_32, v_32_s224, v_32_s448 多数基准已在原始集群计算;运行器跳过已有行,仅补跑缺失部分(84 个基准中 24 个缺少部分基础条件)。

总工作量:84 基准 × 300 项 × 8 个新条件 = 201,600 次推理,另加约 30,000 次基础条件推理。

3. 硬件与软件要求

  • 目标硬件:4× NVIDIA B200(180 GB),每 GPU 一个 vLLM 服务器;32 GB GPU(如 RTX 5090)需调整 MAX_SEQS=8。
  • 模型:Qwen3-VL-8B bf16(约 16.4 GB),使用固定修订版 0c351dd01ed87e9c1b53cbc748cba10e6187ff3b
  • 软件栈:vllm 0.11.0 + torch 2.8 cu128;要求 --max-model-len 65536--limit-mm-per-prompt {"image": 1024}--token-budget 58000
  • 存储:视频 94 GB(解压后)+ 94 GB tar 分片(可删除)、模型 17 GB。
  • CPU:帧解码为 CPU 密集型,建议 16+ 核心。

4. 数据分布与获取

  • 视频存储在 videos/videos_*.tar 分片中,共 19,633 个视频(经 SHA256 校验),解压至 data/store/normalized/<hash>/{video.mp4, meta.json}
  • 数据项:items/samples/<bench>.jsonl(84 个文件),清单 manifest/manifest_subset.jsonl
  • 现有结果:results/conditions_results.csv + results/p1_raw/v_32/(用于断点续跑和 480 存储分辨率复用规则)。
  • 共 25,193 个数据项,其中 96 个无标准化视频(记录为失败,由原始集群处理)。

5. 运行方式与输出

  • 运行脚本 code/run_frames_pixels.sh,支持 --dry-run 预检和 PILOT=1 试运行(先跑 MVBench、LVBench、TimeScope)。
  • 可恢复:已有行自动跳过。
  • 输出文件results/conditions_results.csv(新行)、results/p1_raw/<condition>/<benchmark>__DIAG_V.jsonl(原始输出)、logs/(vLLM 日志、运行日志、计时与失败记录)。
  • 环境变量NGPUWORKERS(默认每 GPU 6)、MAX_SEQS(32)、GPU_UTIL(0.85)、BENCHCONDS 用于限制范围。

6. 检查点与限制

  • 预检:基础条件对 60 个已有基准应显示 todo=0;新条件应显示 todo=300(或更少)。
  • 试运行后:LVBench/TimeScope 长视频在 fps1/fps2 下 meta.capped_ctx=true,fps0.25 下为 false;MVBench 短视频永不封顶;16:9 视频 n_max=582
  • 失败日志data/logs/failures.jsonl 应保持简短;单条件数百次失败表明 vLLM 重启(查 OOM,降低 MAX_SEQS 后重跑)。

7. 不可变更项

提示词、帧选择、分辨率、帧率网格与封顶规则、JPEG 质量(q=85)、temperature=0max_tokens=128、模型修订版、--token-budget 58000 等协议参数禁止修改。若机器无法提供 65536 上下文,须停止并上报而非降低配置。

8. 结果回传

  • 打包:results/conditions_results.csvresults/p1_rawlogsdata/logs 为 tar.gz 并计算 SHA256,上传回数据集 returns/ 目录。
  • 无写令牌时通过任意方式传输 tarball 和校验值;报告中需包含试运行计时表、总墙钟时间、各条件新增行数、失败数及示例 item id、精确的 vLLM 启动命令。
搜集汇总
数据集介绍
BenchCheck-FramesPixels 数据集图片
构建方式
BenchCheck-FramesPixels数据集旨在系统评估视频基准测试中分辨率、帧率与帧数对视觉-语言模型性能的影响。其构建方式严谨,选取84个视频基准,每个基准包含300个多项选择项,采用Qwen3-VL-8B-Instruct模型,在受控条件下进行推理。条件设计包含三组梯度:分辨率梯度(短边168至448像素及原始尺寸)、帧率梯度(0.25至2 fps)、帧数梯度(8至128帧),均基于归一化视频(存储帧率2 fps,最大1024帧,短边720或480像素)进行时间均匀采样,JPEG压缩质量固定为85,温度设为0,最大生成令牌数128。所有条件共享同一提示模板,确保变量单一可控,并通过详尽的元数据记录(如上下文截断标志、实际使用帧数)实现透明化追踪。
特点
该数据集的核心特点在于其系统性的多维退化分析与细粒度控制。通过三组独立的阶梯式条件,能清晰区分模型对空间细节(像素)与时间信息(帧)的偏好,并揭示两者的交互效应。数据集规模庞大,涵盖约23万次推理,其中新条件约201,600次,并针对缺失基准补充了基础条件推理,确保完整性。数据构建采用去重与上下文自适应机制,如高帧率下基于令牌预算动态调整采样帧数,长视频则通过截断策略平衡负载,同时记录截断状态便于后续分析。此外,数据集严格遵循固定协议,包含健全的检查流程,确保结果的可复现性与可靠性,为视频理解研究提供了精细的评测工具。
使用方法
使用该数据集时,用户需先通过HuggingFace CLI下载数据,并校验视频完整性。解压后,运行提供的脚本启动多GPU vLLM推理服务器,执行主运行程序,该程序支持断点续跑,可跳过已处理的行。用户可通过环境变量灵活控制GPU数量、工作线程及并发序列数,以适应不同硬件。建议先进行干运行模式评估任务量,再以小规模试点(如MVBench、LVBench)校准时间与资源,随后执行全量推理。运行结果以CSV和JSONL格式输出,包含逐项推理原始文件,便于后续分析。最终,需打包结果并上传或传输至数据集中,过程中应检查日志确保无异常失败,并对失败项进行记录与报告。
背景与挑战
背景概述
随着视频语言模型(Video-Language Models, VLMs)的迅猛发展,如何系统性地评估其在时间与空间维度上的感知能力成为研究前沿的重要课题。BenchCheck-FramesPixels数据集由GMLRVigil团队于2025年创建,旨在通过精细化的分辨率、帧率与帧数阶梯实验,探究Qwen3-VL-8B-Instruct等模型在84个视频基准测试中的表现差异。该数据集的核心研究问题在于,不同视频内容特性(如运动速度、细节密度)对模型在像素(空间分辨率)与帧(时间采样)维度上的偏好有何影响,进而揭示模型理解视频信息的内部机制。该工作通过大规模(超过23万次推理)与系统化的控制变量设计,为视频理解领域提供了一份具有代表性的评估基准,对模型架构优化与视频预处理策略的制定具有重要参考价值。
当前挑战
该数据集所应对的核心挑战在于双重层面。在领域问题层面,视频理解任务长期面临信息冗余与关键帧捕获的矛盾:分辨率提升虽能增强空间细节,却增加计算负担并可能超越模型上下文窗口;而帧率选择需在时间动态捕捉与推理效率间权衡,现有基准鲜有对此进行解耦分析。BenchCheck-FramesPixels通过设置分辨率(168至原始)、帧率(0.25至2 fps)及帧数(8至128)的阶梯条件,并严格约束推理参数与上下文预算,为量化这些权衡提供了实验基础。在构建过程中,挑战集中于数据规模与工程实现:需处理19,633个视频的标准化存储,应对不同时长视频的帧数上限截断(如长视频在上下文限制下需重采样),以及保障约23万次推理在限制性硬件(如4×B200)上的可行性与容错性,为此设计了可恢复的调度机制与代码中的复用规则,确保数据生成的一致性与完整性。
常用场景
经典使用场景
BenchCheck-FramesPixels数据集是视频理解领域一项系统性探究的产物,它围绕分辨率、帧率与帧数三组递进式阶梯展开,为多模态大语言模型(如Qwen3-VL-8B-Instruct)在84个视频基准上的表现提供了细粒度的诊断框架。该数据集的核心使用场景在于量化视频表征中空间细节与时间动态的相对贡献,通过控制变量法揭示模型性能随输入像素密度或采样频率变化的敏感度曲线。研究者可借此剖析不同视频任务(如时序推理、事件定位、细粒度动作识别)对空间或时间信息的偏好,从而为视频预处理策略的优化提供实证依据。其标准化的问答协议与原始输出存档亦支持跨模型复现与对比,是视频理解评测领域中一个兼具深度与广度的工具型资源。
实际应用
在实际应用中,该数据集可直接服务于视频理解系统的部署优化与成本控制。工程团队可利用其条件对照结果,针对特定业务场景(如短视频审核、长视频摘要、实时监控分析)选择最优的分辨率与帧率组合,在保证任务精度的同时最小化计算资源消耗与延迟。例如,若某下游任务在0.5 fps与224像素条件下已达到性能饱和,则可避免不必要的全帧率与高分辨率采样,从而显著降低推理成本。此外,数据集附带的标准化视频存储与采样代码亦可用于构建内部评测流水线,辅助模型上线前的鲁棒性检验,以及指导视频压缩、关键帧提取等预处理模块的参数调优。
衍生相关工作
围绕该数据集,一系列衍生工作已或将在视频理解领域展开。其一,基于所揭示的“基准对分辨率或帧率的偏好图谱”,可催生自适应采样算法,动态调整输入配置以匹配视频内容复杂度或任务类型。其二,其帧率阶梯测试中暴露的上下文窗口截断机制(即长视频被迫降采样至最大可容纳帧数)为长视频建模研究提供了新线索,可能启发更高效的视觉令牌压缩或记忆增强架构。其三,该数据集的诊断协议可推广至其他多模态基座模型(如不同参数规模的LLaVA-Video系列),形成跨模型的性能剖析对比,进而指导模型预训练阶段视频采样策略的设计。最后,分析结果亦可反馈至基准构建者,促使新一代视频基准在难度设计上更加关注时间动态与空间细节的均衡性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务