VCBench
收藏资源简介:
VCBench 是一个用于评估视频理解模型中时空状态维护能力的视频计数基准数据集。该数据集包含 4,574 个剪辑视频片段,总大小约 80 GB,视频格式为 MP4 (H.264)。数据集分为 8 个子类别,涵盖对象计数和事件计数两大任务。对象计数包括 O1-Snap(当前状态快照)、O1-Delta(当前状态变化)、O2-Unique(全局唯一计数)和 O2-Gain(窗口增益计数);事件计数包括 E1-Action(瞬时动作)、E1-Transit(状态转换)、E2-Periodic(周期性动作)和 E2-Episode(片段性动作)。视频来源于多个公开数据集,如 YouTube、RoomTour3D、Ego4D、ScanNet 等,并经过严格的质量验证,确保时长精度(±0.1秒)、帧率保持和无损剪辑。数据集适用于视频分类、问答、时空推理等任务,并提供了详细的标注信息(包括问题、查询点和真实答案)。使用 MIT 许可证发布。
VCBench is a video counting benchmark dataset for evaluating the spatio-temporal state maintenance capabilities of video understanding models. This dataset contains 4,574 clipped video segments with a total size of approximately 80 GB, and the video format is MP4 (H.264). The dataset is divided into 8 subcategories, covering two major tasks: object counting and event counting. Object counting includes O1-Snap (current state snapshot), O1-Delta (current state change), O2-Unique (global unique counting), and O2-Gain (window gain counting); event counting includes E1-Action (transient action), E1-Transit (state transition), E2-Periodic (periodic action), and E2-Episode (segmental action). The videos are sourced from multiple public datasets such as YouTube, RoomTour3D, Ego4D, ScanNet, etc., and have undergone strict quality validation to ensure duration accuracy (±0.1 second), consistent frame rates, and lossless clipping. The dataset is applicable to tasks such as video classification, question answering, spatio-temporal reasoning, and provides detailed annotation information including questions, query points, and ground truth answers. It is released under the MIT License.
VCBench数据集概述
数据集基本信息
- 数据集名称:VCBench: Clipped Videos Dataset
- 许可协议:MIT License
- 任务类别:视频分类、问答
- 语言:英语
- 标签:视频理解、时序推理、计数、基准测试
- 规模类别:1K<n<10K
数据集内容
- 视频总数:4,574个剪辑片段
- 总大小:约80 GB
- 视频格式:MP4 (H.264编码)
- 类别划分:包含8个子类别,分为对象计数和事件计数两大任务
类别详情
对象计数(共2,297个剪辑)
- O1-Snap:当前状态快照(252个剪辑)
- O1-Delta:当前状态增量(98个剪辑)
- O2-Unique:全局唯一计数(1,869个剪辑)
- O2-Gain:窗口增益计数(78个剪辑)
事件计数(共2,277个剪辑)
- E1-Action:瞬时动作(1,281个剪辑)
- E1-Transit:状态转换(205个剪辑)
- E2-Periodic:周期性动作(280个剪辑)
- E2-Episode:片段性事件(511个剪辑)
文件命名规范
- 多查询剪辑:
{category}_{question_id}_{query_index}.mp4(例如:e1action_0000_00.mp4) - 单查询剪辑:
{category}_{question_id}.mp4(例如:o1delta_0007.mp4)
视频属性
- 编码:H.264(使用
-c copy进行无损剪辑) - 帧率:保留源视频帧率(3fps、24fps、25fps、30fps、60fps)
- 时长精度:与标注时间戳误差在±0.1秒内
- 质量:保持原始质量(无重新编码)
源数据集
视频剪辑自多个源数据集:
- YouTube步行游览和体育视频
- RoomTour3D(室内导航)
- Ego4D(第一人称视角)
- ScanNet、ScanNetPP、ARKitScenes(3D室内场景)
- TOMATO、CODa、OmniWorld(时序推理)
- 模拟物理视频
标注信息
完整标注(包括问题、查询点和真实答案)请参考原始VCBench仓库:
- 对象计数标注:
object_count_data/*.json - 事件计数标注:
event_counting_data/*.json
每个标注文件包含:
id:问题标识符source_dataset:原始视频来源video_path:原始视频文件名question:计数问题query_time或query_points:查询时间戳count:真实答案
质量验证
所有视频均经过以下验证:
- 时长精度(100%在±0.1秒内)
- 帧率保留(保持原始fps)
- 无丢帧或速度变化
- 无损剪辑(无重新编码伪影)
数据集统计
| 类别 | 剪辑数量 | 平均时长 | 总大小 |
|---|---|---|---|
| O1-Snap | 252 | ~2分钟 | ~4.3 GB |
| O1-Delta | 98 | ~1分钟 | ~1.7 GB |
| O2-Unique | 1,869 | ~3分钟 | ~32 GB |
| O2-Gain | 78 | ~1分钟 | ~1.3 GB |
| E1-Action | 1,281 | ~4分钟 | ~28 GB |
| E1-Transit | 205 | ~2分钟 | ~3.5 GB |
| E2-Periodic | 280 | ~3分钟 | ~8.7 GB |
| E2-Episode | 511 | ~2分钟 | ~4.8 GB |
| 总计 | 4,574 | - | ~80 GB |
引用
使用本数据集时请引用VCBench论文:
@article{vcbench2026, title={VCBench: A Streaming Counting Benchmark for Spatial-Temporal State Maintenance}, author={[Authors]}, journal={[Journal/Conference]}, year={2026} }
联系方式
如有问题或疑问,请在数据集仓库中提交issue。




