遇见数据集

KeyFrame-Compass

收藏
github2026-07-16 更新2026-07-18 收录
官方服务:

资源简介:

KeyFrame-Compass是一个用于评估关键帧条件视频生成的基准数据集。模型接收文本提示和有序的视觉关键帧集,然后生成遵循这两者的视频。该基准包含386个案例,涵盖三个应用领域,包括多镜头和单镜头视频,以及两个提示级别。案例使用单独的图像或故事板网格,具有四种关键帧密度。评估分为关键帧执行和整体视频质量两部分,测量关键帧存在、视觉保真度、时间顺序、定位、持久性和响应独特性,以及使用基于证据的MLLM判断和专用感知模型评估视觉质量、时间连贯性、指令遵循和音频质量。

KeyFrame-Compass is a benchmark dataset for evaluating keyframe-conditioned video generation. Models receive text prompts and an ordered set of visual keyframes, then generate videos that adhere to both the prompts and the keyframes. This benchmark contains 386 cases spanning three application domains, including both multi-shot and single-shot videos, as well as two prompt levels. The cases use standalone images or storyboard grids, with four keyframe densities. The evaluation is divided into two parts: keyframe execution and overall video quality. It measures keyframe presence, visual fidelity, temporal order, localization, persistence and response uniqueness, while assessing visual quality, temporal coherence, instruction following and audio quality using evidence-based MLLM judgments and dedicated perceptual models.

创建时间:
2026-07-05
原始信息汇总

数据集概述:KeyFrame-Compass

KeyFrame-Compass 是一个用于评估关键帧条件视频生成模型的基准测试数据集。该数据集旨在衡量模型根据给定的文本提示和一组有序的视觉关键帧,生成符合两者要求的视频的能力。

核心评估内容

  • 输入:模型接收一个文本提示和一个有序的视觉关键帧集合。
  • 输出:模型生成一个视频,该视频需同时遵循文本提示和关键帧序列。
  • 评估目标:衡量模型在关键帧执行和整体视频质量两个方面的表现。

数据集规模与构成

  • 总案例数:386 个测试案例。
  • 应用领域:覆盖三个不同的应用领域。
  • 视频类型:包含多镜头(multi-shot)和单镜头(one-take)视频。
  • 提示级别:提供两种提示级别。
  • 关键帧格式:使用独立图像或分镜网格(storyboard grids)。
  • 关键帧密度:包含四种不同的关键帧密度设置。

评估框架

评估分为两个独立部分:

  1. 关键帧执行(Keyframe Execution):衡量模型对关键帧的执行情况,包括:
    • 关键帧存在性
    • 视觉保真度
    • 时间顺序
    • 定位准确性
    • 持久性
    • 响应独特性
  2. 整体视频质量(Overall Video Quality):通过基于证据的多模态大语言模型(MLLM)判断和专门的感知模型进行评估,包括:
    • 视觉质量
    • 时间连贯性
    • 指令遵循度
    • 音频质量(如有)

数据集可用性

  • 数据集(包含全部 386 个测试案例)已在 Hugging Face 上发布:https://huggingface.co/datasets/Vickyinmyheart824/KeyFrame-Compass

基准测试文件(Checklists)

  • 该基准测试提供了预先生成的清单文件(Checklists),用于标准化评估流程。
  • 清单文件包含两种提示模式:minimalspecific

相关资源

  • 代码仓库https://github.com/cactusqq/KeyFrame-Compass
  • 数据集页面https://huggingface.co/datasets/Vickyinmyheart824/KeyFrame-Compass
  • 许可证:Apache License 2.0
搜集汇总
数据集介绍
KeyFrame-Compass 数据集图片
构建方式
KeyFrame-Compass数据集的构建立足于对关键帧条件视频生成任务的系统性评估需求,涵盖了三个应用领域共计386个测试案例。每个案例均包含一段文本提示、一组有序的视觉关键帧以及对应的视频输出,旨在模拟多镜头与单镜头两种拍摄模式。数据集的构建过程充分考虑场景类型、关键帧数量、角色数目、相机运动与镜头尺度等多样性因素,并将关键帧以独立图像或分镜网格形式组织,提供了四种关键帧密度配置以覆盖不同复杂程度的生成任务。
特点
该数据集的核心特色在于将评估体系明确区分为关键帧执行与整体视频质量两大维度。关键帧执行方面,测量生成视频对关键帧的忠实度、视觉保真度、时序顺序、位置精准性、持久性及响应唯一性;整体视频质量方面,则借助多模态大语言模型与专业感知模型,综合评价视觉质量、时序连贯性、指令遵循度及音频效果。此外,数据集提供了最小化与镜头特定两种提示级别,支持灵活的评估粒度。
使用方法
使用者首先需克隆GitHub仓库并通过脚本完成环境配置与模型权重下载,随后从Hugging Face获取386个基准案例。评估流程包括使用构建脚本将提示、关键帧与模型生成的视频组织为标准输入,生成对应的评估清单,最后通过运行脚本启动评估。系统自动处理单卡或多卡环境,输出包含指标表格、模型摘要与排行榜在内的完整结果,支持评估已发布数据集或用户自定义数据集。
背景与挑战
背景概述
视频生成领域近年来取得了令人瞩目的进展,然而现有评估体系在关键帧条件约束下的视频生成任务中仍存在显著空白。为填补这一空缺,由某研究团队于近期推出的KeyFrame-Compass基准数据集应运而生,该数据集旨在系统性地评估模型在同时遵循文本提示与有序视觉关键帧时的视频生成能力。研究团队精心构建了涵盖多镜头与单次拍摄场景的386个测试用例,横跨三个应用领域,并设计了四种关键帧密度与两种提示粒度。该基准的发布为视频生成社区提供了首个聚焦于关键帧执行保真度与整体视频质量的双轨评估框架,其影响力在于确立了从关键帧留存、视觉保真度到时序连贯性等多维度的量化评测标准,推动了可控视频生成技术的规范化发展。
当前挑战
KeyFrame-Compass数据集面临的核心挑战源于多模态条件约束下的视频生成复杂性。在领域问题层面,模型需精准平衡文本指令与视觉关键帧之间的语义一致性,同时确保生成视频中关键帧的时序定位与持久性,这对现有生成架构在时空建模与条件融合能力上构成了严峻考验。在构建过程中,研究人员遭遇了关键帧密度与场景类型的多样性覆盖难题,需确保386个案例能有效表征真实应用中的动态变化;此外,评估框架的搭建涉及专用感知模型与多模态大语言模型的协同调用,而手动下载的四个模型权重与六个隔离计算环境的配置需求,进一步增加了基准复现与跨模型比较的工程门槛。
常用场景
经典使用场景
KeyFrame-Compass专注于评估基于关键帧条件的视频生成任务,其核心设计在于构建一个系统化的基准平台,用于度量模型在给定文本提示与有序视觉关键帧序列时,生成连贯视频的能力。该数据集包含386个精心设计的测试案例,覆盖多镜头与单次拍摄两种视频类型,并引入四种关键帧密度与两种提示级别,从而在场景类型、角色数量、镜头运动及景别变化等多个维度上形成丰富的评估空间。在经典使用场景中,研究者通过提交模型生成的视频,接受关键帧执行质量与整体视频质量的双重检验——前者衡量关键帧的存在性、视觉保真度、时序正确性、定位准确度、持久性及响应独特性,后者则借助多模态大语言模型与专业感知模型评估视觉质量、时间连贯性、指令遵循程度及音频品质。这一严谨的分层评估框架使得KeyFrame-Compass成为当前关键帧条件视频生成领域最具权威性的标准化测试工具,为模型性能的横向对比提供了可靠基准。
解决学术问题
KeyFrame-Compass的提出精准回应了视频生成领域中一个长期存在的学术难题——如何系统性地评估模型对关键帧条件的遵从能力。在传统视频生成评估中,研究者往往仅关注整体视觉质量或文本对齐度,而忽略了对关键帧序列的精确执行这一核心要求,导致生成的视频虽然视觉流畅却未能忠实反映用户的帧级控制意图。该数据集通过创新性地将评估拆解为关键帧执行与整体视频质量两大维度,并在关键帧执行中细粒度地测量时序顺序、空间定位、视觉持续性等量化指标,首次为这一交叉问题提供了可复现、多维度的解决方案。这一方法论上的突破不仅弥补了现有基准在帧级约束验证层面的空白,更促使学术社区重新审视可控视频生成的核心评价标准,推动了从单一美学判断向结构化、解耦式评估范式的转变,其影响力已辐射至图像到视频生成、故事板动画合成等相关研究方向。
衍生相关工作
KeyFrame-Compass的发布催生了一系列富有启发性的衍生工作,推动了关键帧条件视频生成领域的系统性进步。在评估方法论层面,受其双维度评估架构的启发,后续研究者开发了面向特定场景(如人物动作一致性、物体交互精确性)的细粒度评估插件,将关键帧执行指标进一步拓展至领域专属的下游任务。在模型优化方面,该数据集的公开案例集合成为训练策略的重要基准——多个工作利用其提供的时序错误模式分析,针对性改进了跨帧注意机制与位置编码设计,显著提升了生成视频对稀疏关键帧的响应精度。同时,基于KeyFrame-Compass中提示模式与关键帧密度的调控逻辑,学界构建了面向交互式视频编辑的适应性框架,实现了从用户输入稀疏关键帧到输出完整视频的即时生成管线,这些成果共同构成了以KeyFrame-Compass为起点的开源评估生态,持续驱动着可控视频生成从实验室原型向实用化工具的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务