遇见数据集

Alibaba-DAMO-Academy/InterVBench

收藏
Hugging Face2026-06-12 更新2026-06-14 收录
官方服务:

资源简介:

LV-Bench是一个精心策划的基准测试数据集,包含1000个时长一分钟的视频,旨在评估长时程生成。视频来源于DanceTrack、GOT-10k、HD-VILA-100M和ShareGPT4V,类别分布大约为67%以人类为中心、17%以动物为中心和16%以环境为中心的镜头。每个源视频被分割成2-3秒的片段,并使用GPT-4o生成字幕,随后在每个阶段(来源选择、分割、字幕审核)都经过人工验证以确保质量。该基准测试分为80/20的训练-评估分割,并结合VDE套件和标准VBench分数,为时间一致性提供全面的压力测试。

LV-Bench is a curated benchmark of 1,000 minute-long videos targeted at evaluating long-horizon generation. Videos are sourced from DanceTrack, GOT-10k, HD-VILA-100M, and ShareGPT4V, yielding a class distribution of roughly 67% human-focused, 17% animal-focused, and 16% environment-focused footage. Each source video is broken into 2–3 second segments and captioned with GPT-4o, followed by human validation at every stage (sourcing, chunking, caption review) to maintain quality. The benchmark is divided into an 80/20 train-eval split and pairs the VDE suite with standard VBench scores, providing a comprehensive stress test for temporal coherence.

提供机构:
Alibaba-DAMO-Academy
搜集汇总
数据集介绍
Alibaba-DAMO-Academy/InterVBench 数据集图片
构建方式
InterVBench数据集的构建基于对长时视频生成任务的深度考量。研究者从DanceTrack、GOT-10k、HD-VILA-100M及ShareGPT4V等多个公开数据源中精心筛选出1000段时长为一分钟的视频,内容涵盖人物(约67%)、动物(约17%)与环境(约16%)三大类。每个原始视频被切割为2至3秒的短片段,并利用GPT-4o模型生成描述性字幕。整个过程在数据来源、片段分割及字幕审核等关键环节均引入人工验证,以保证数据集的高质量与可靠性。最终,数据集按80:20的比例划分为训练集与评测集,为长时视频生成模型的训练与评估提供了坚实的数据基础。
特点
InterVBench数据集的核心特色在于其首创的视频漂移误差(Video Drift Error, VDE)评估体系。VDE基于加权平均绝对百分比误差(WMAPE),通过将长视频均匀切分为若干时间块,并以首个时间块的基准分数衡量后续块的质量偏移,从而精准量化视频在清晰度、运动流畅性、美学一致性、背景稳定性及主体身份一致性等维度上的时序稳定性。该指标值越低,代表视频的时序连贯性越强。此外,数据集天然集成了VBench标准评分与VDE套件,能够对视频生成模型进行全面的压力测试,尤其适用于检验模型在长时间跨度下的内容保持能力。
使用方法
使用InterVBench数据集进行评测时,用户需通过统一的入口脚本vde.py操作。首先配置Python环境,确保安装PyTorch、OpenCV、vbench等依赖,并保证metrics模块可导入。随后,在命令行中执行'python vde.py --video_dir <输入视频文件夹> --output_dir <输出结果文件夹>'指令,脚本将自动处理文件夹内所有.mp4文件,并为每种指标生成对应的JSON结果文件(命名格式为vde_<指标名>.json)。用户可根据需求调整SUPPORTED_METRICS列表以选择评测指标,或修改N_CHUNKS参数改变时间块划分粒度。默认情况下,VDE使用线性权重聚合,但支持切换为对数权重以强调后期时间块的稳定性表现。
背景与挑战
背景概述
InterVBench数据集由BlockVid研究团队于近年创建,旨在填补长时视频生成质量评估领域的空白。该数据集的核心研究问题聚焦于如何系统性地衡量视频在时间维度上的质量漂移,特别是针对分钟级长视频的连贯性、动态稳定性及语义一致性。通过整合DanceTrack、GOT-10k、HD-VILA-100M及ShareGPT4V等多源视频资源,并经过严格的GPT-4o自动标注与人工校验流程,InterVBench提供了涵盖人、动物、环境三大类别的1,000个一分钟长视频基准,推动了视频生成领域从静态帧评估向动态时序评估的范式转变。
当前挑战
InterVBench所面临的核心挑战在于解决长视频生成中时间维度上的质量漂移问题,即如何量化视频片段间清晰度、运动平滑度、美学一致性、主体身份及背景稳定性等指标的逐渐劣化。具体挑战包括:1)现有图像级或短视频评估指标无法捕捉分钟级视频中的细微质量退化;2)构建过程中需处理多源视频的格式、分辨率和内容分布差异,确保基准的公平性与代表性;3)自动标注生成的长视频描述易出现语义漂移,必须依赖人工逐段校验以维持标注质量;4)视频分块策略与评估指标权重设定需在敏感性与计算效率间取得平衡,以适应不同应用场景的稳定性要求。
常用场景
经典使用场景
InterVBench作为视频漂移误差评估的基准数据集,其核心应用场景在于量化长时视频生成中时间一致性的变化。研究者和工程师可利用该数据集对视频生成模型进行系统性的鲁棒性测试,通过将视频切分为均匀的时间块,计算各块相对于首块的指标偏移程度,从而评估模型在清晰度、运动流畅性、美学稳定性、主体保持及背景连贯性方面的长期表现。
解决学术问题
该数据集有效解决了长视频生成领域缺乏标准化时序稳定性评估方法的问题。传统指标往往聚焦于单帧质量而忽视帧间漂移,InterVBench通过引入视频漂移误差(VDE)框架,为学术界提供了一种量化时序退化的工具。其意义在于促使研究者从关注瞬时画面质量转向整体时间连贯性,推动了视频生成模型从短片段向长时、稳定化方向的演进。
衍生相关工作
InterVBench衍生工作主要体现在两方面:一是基于VDE指标改进的生成模型,如采用时序注意力机制或循环一致性损失以最小化帧间漂移;二是扩展的评估套件,如将VDE与光流复杂度、场景切换检测结合,形成更全面的稳定性分析工具。这些工作进一步揭示了时序漂移与人类感知质量之间的关联,为构建更符合视觉习惯的长视频生成系统奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务