遇见数据集

KeyFrame-Compass

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

KeyFrame-Compass是一个用于评估关键帧条件视频生成模型的基准数据集。给定一个有序的关键帧图像序列和一个文本提示,模型需要生成一个视频,该视频能在指定时间位置复现预设的视觉状态,并在连续锚点之间合成连贯的运动、过渡和事件。数据集包含386个精心策划的基础样本,涵盖短视频和长视频生成。每个样本以两种条件格式(多图像有序列表和包含相同序列的单一故事板网格图像)提供相同的排序关键帧序列,并为每种格式配对两种级别的文本控制(极简提示和分段特定提示)。这种设计支持在不同生成设置下对关键帧执行情况和整体视频质量进行受控评估。样本根据视频持续时间进一步组织为短视频子集(227个样本)和长视频子集(159个样本)。每个样本沿五个主要维度进行标注:输入格式、提示控制级别、视频结构(连续的一镜到底视频或多镜头视频)、关键帧数量(3、6、9或12个视觉锚点)和应用领域(日常捕捉、产品可视化或电影叙事)。任务定义根据视频结构有所不同:对于多镜头视频,每个关键帧被分配到一个特定的镜头并具有“起始”、“结束”或“代表”角色;对于一镜到底视频,每个关键帧被分配一个目标时间戳,相邻锚点界定时间片段。提示变体包括:极简提示(仅指定定义任务所必需的信息,如关键帧顺序、简要故事概要、目标视频结构和目标时长)和分段特定提示(额外描述每个关键帧的预期时间位置、主体状态及其演变、相机语言和镜头行为等)。比较这两种变体可以将弱文本指导下的生成与明确时间约束下的指令遵循区分开来。数据集文件结构包含一个全局样本索引(samples.jsonl)以及按持续时间划分的`short/`和`long/`目录,每个样本目录包含关键帧图像、故事板网格图像、提示文件和元数据文件。

KeyFrame-Compass is a benchmark dataset for evaluating keyframe-conditioned video generation models. Given an ordered sequence of keyframe images and a text prompt, models are required to generate a video that reproduces preset visual states at specified temporal positions, while synthesizing coherent motion, transitions and events between consecutive anchor points. The dataset contains 386 carefully curated base samples covering both short and long video generation. Each sample provides the same ordered keyframe sequence in two conditional formats: a multi-image ordered list and a single storyboard grid image containing the same sequence, and pairs each format with two levels of text control (minimal prompt and segment-specific prompt). This design enables controlled evaluation of keyframe execution performance and overall video quality across different generation settings. The samples are further organized into short video subset (227 samples) and long video subset (159 samples) based on video duration. Each sample is annotated along five main dimensions: input format, prompt control level, video structure (continuous single-take video or multi-shot video), number of keyframes (3, 6, 9 or 12 visual anchors), and application domain (everyday capture, product visualization or cinematic narrative). The task definition varies according to video structure: for multi-shot videos, each keyframe is assigned to a specific shot with a "start", "end" or "representative" role; for single-take videos, each keyframe is assigned a target timestamp, with adjacent anchors defining temporal segments. Prompt variants include: minimal prompts (only information necessary to define the task, such as keyframe order, brief story outline, target video structure and target duration) and segment-specific prompts (additional descriptions of the expected temporal position of each keyframe, subject state and its evolution, camera language and shot behavior, etc.). Comparing these two variants allows distinguishing generation under weak text guidance versus instruction following with explicit temporal constraints. The dataset file structure includes a global sample index (samples.jsonl) as well as `short/` and `long/` directories categorized by duration. Each sample directory contains keyframe images, storyboard grid images, prompt files and metadata files.

创建时间:
2026-07-15
原始信息汇总

数据集概述

KeyFrame-Compass 是一个用于评估关键帧条件视频生成(Keyframe-conditioned Video Generation)的基准测试(Benchmark)数据集。给定有序的关键帧图像序列和文本提示,模型需生成一段视频,该视频需在指定时间位置复现给定的视觉状态,并在相邻关键帧之间合成连贯的运动、过渡和事件。

核心构成

  • 样本总数:386 个精心策划的基础样本(Base Samples),覆盖短视频与长视频生成。
  • 子集划分
    • 短视频子集:227 个样本。
    • 长视频子集:159 个样本。

输入格式与提示变体

每个基础样本提供两种输入格式和两种提示文本控制水平,用于多维度评估:

  • 输入格式(Input Formats)
    1. 多图像列表(Multi-image List):将关键帧作为有序的独立图像序列输入,图像存储于 selected/ 目录,对应提示在 multi-image-list/ 目录。
    2. 故事板网格(Storyboard Grid):将关键帧按相同顺序排列成一张网格图像(storyboard_grid.png),对应提示在 storyboard-grid/ 目录。
  • 提示变体(Prompt Variants)
    1. 最小化提示(Minimal):仅指定关键帧顺序、简短故事概要、目标视频结构和时长,让模型从视觉序列推断运动与事件。
    2. 分段特定提示(Specific):在最小化提示基础上,进一步描述关键帧的预期时间位置、主体状态演化、镜头语言、镜头间事件及叙事进程。

样本标注维度

每个样本在五个主要维度上进行标注:

  1. 输入格式:多图像列表或故事板网格。
  2. 提示控制水平:最小化或分段特定。
  3. 视频结构:连续单镜头(One-take)或多镜头(Multi-shot)视频。
  4. 关键帧数量:3、6、9 或 12 个视觉锚点。
  5. 应用领域:日常拍摄(Daily capture)、产品展示(Product visualization)或电影叙事(Cinematic narrative)。

任务定义

  • 多镜头视频:每个关键帧被分配至特定镜头,并承担角色(如第一帧、最后一帧或代表性帧)。
  • 单镜头视频:每个关键帧沿连续轨迹分配目标时间戳,相邻关键帧之间需描述主体演化、相机运动和叙事进展。

数据组织

数据集根目录下包含 samples.jsonl 全局样本索引文件,并按时长分为 short/long/ 两个目录。每个样本目录结构如下:

路径 内容描述
selected/ 有序的独立关键帧图像(用于多图像列表输入)。
storyboard_grid.png 包含相同关键帧的单一网格图像。
multi-image-list/ 适配多图像列表输入的两种提示(minimal 和 specific)。
storyboard-grid/ 适配单网格图像输入的两种提示(minimal 和 specific)。
manifest.json 样本级元数据和时间规范。

其他信息

  • 语言:英语。
  • 任务类别:图像到视频(image-to-video)。
  • 许可协议:其他(license: other)。
  • 伦理考量:数据集样本经过多模态验证、人工审核和安全审查,但建议用户在使用前自行检查内容,遵守相关许可与使用政策。
搜集汇总
数据集介绍
KeyFrame-Compass 数据集图片
构建方式
KeyFrame-Compass作为评估关键帧条件视频生成的基准测试集,精心筛选了386个基础样本,并按照短视频与长视频两个子集进行组织。每个样本均以两种条件格式呈现相同的有序关键帧序列:其一为独立的多图像列表,其二为整合的故事板网格。同时,每个格式配以两种文本控制层级——简洁提示与分段特定提示,以此实现多维度可控评估。样本的标注维度涵盖输入格式、提示控制层级、视频结构(单次拍摄与多镜头拍摄)、关键帧数量(3、6、9、12)以及应用领域(日常拍摄、产品展示、电影叙事),从而构建起系统化的评测体系。
特点
该数据集的核心特色在于其精细化的多维度设计,能够全面检验模型在关键帧条件约束下的视频生成能力。输入格式的双重设计——独立图像列表与故事板网格——使得不同架构的模型均可参与评估。提示层级的差异化则有效区分模型在弱文本引导与明确时间约束下的表现差异。尤为突出的是,数据集针对视频结构定义了差异化的关键帧定位规则:多镜头拍摄中关键帧充当片段的首帧、尾帧或代表帧,单次拍摄中则对应特定时间戳,从而模拟真实世界的叙事逻辑。领域覆盖日常、产品和电影场景,确保了评估的生态效度。
使用方法
研究人员可通过HuggingFace下载按short/和long/组织的样本目录。每个样本包含独立关键帧图像集(selected/)、故事板网格图像(storyboard_grid.png)、以及对应两种输入格式的提示文件(multi-image-list/与storyboard-grid/分别存储minimal和specific提示)。全局索引文件samples.jsonl记录样本元数据与哈希值,便于批量调用。评估时,用户可根据模型接口特性选择多图像列表或单网格输入,并结合提示层级灵活配置实验条件,以量化分析模型在关键帧执行精度与整体视频连贯性方面的表现。
背景与挑战
背景概述
视频生成领域近年来取得了显著进展,然而现有基准测试多聚焦于文本到视频或图像到视频的简单条件生成,忽略了对关键帧时序控制能力的系统性评估。KeyFrame-Compass数据集于2026年由多所机构联合创建,旨在弥补这一空白。该数据集包含386个精心设计的样本,覆盖短时与长时视频生成场景,通过多图像列表和故事板网格两种输入格式,并结合最小化提示与片段特定提示,系统评估模型在既定视觉锚点间的运动连贯性、过渡合成与叙事推进能力。其发布为关键帧条件视频生成任务提供了标准化评测平台,推动相关研究从无序生成向精确时序控制演进。
当前挑战
该数据集所应对的核心挑战在于视频生成中关键帧时序执行的精确性与动态连贯性。领域层面,现有模型难以在保证视觉锚点位置正确的前提下,合成符合自然物理规律的运动与事件过渡。构建过程中,数据集的注释需精确标注关键帧在单次拍摄中的时间戳或在多镜头中的角色(如首帧、末帧或代表性帧),并确保不同输入格式与提示变体间语义对齐,这对数据质量与一致性提出了极高要求。此外,涵盖日常记录、产品展示与电影叙事等多领域场景,需平衡样本多样性与评估的可控性,进一步增加了构建复杂度。
常用场景
经典使用场景
在视频生成与计算机视觉的交汇领域,KeyFrame-Compass凭借其精细化的多模态基准设计,成为评估关键帧条件视频生成模型的核心工具。该数据集精心构建了386个标准样本,横跨简短与长视频生成任务,提供了多图像列表与故事板网格两种输入格式,并搭配最小文本提示与片段特定提示两种控制级别。研究者可通过这一平台,严谨检验模型在给定有序关键帧序列及文本描述条件下,是否能在准确复现预设视觉状态的同时,合成出连贯的动态、过渡与事件。其经典使用场景聚焦于对模型在时序锚点定位、跨片段叙事连贯性及视觉忠实度等维度上的系统性评测,为视频生成技术的量化对比提供了坚实的实验基础。
衍生相关工作
KeyFrame-Compass的发布催生了一系列围绕关键帧条件视频生成的前沿探索工作。在模型架构层面,研究者借鉴其分段文本控制设计,提出了时序感知的跨注意力机制,使得模型能更精确地将特定文本描述与对应的关键帧片段对齐。在训练策略上,后续工作利用该数据集的多种难度等级(如不同关键帧数量与提示细致程度),设计了课程学习方案,逐步提升模型对复杂时序约束的顺应能力。此外,部分研究以该基准为核心,开发了面向长视频生成的渐进式生成管线,通过逐段优化关键帧间的中间帧质量,实现了超过12帧锚点的长序列连贯输出。这些衍生工作不仅丰富了视频生成的技术体系,也进一步验证了KeyFrame-Compass作为评估工具的普适性与启发性,推动了整个领域向更高时序保真度与叙事复杂度的方向演进。
数据集最近研究
最新研究方向
当前,KeyFrame-Compass基准数据集聚焦于关键帧条件视频生成的前沿评估,其核心方向在于系统性地衡量模型在给定有序关键帧序列与文本提示下,精准复现视觉状态、融合连贯运动与过渡的能力。该数据集通过精心设计的386个样本,覆盖短时与长时生成场景,并创新性地引入多图列表与故事板网格两种输入格式,结合极简提示与分段特定提示,模拟现实应用中从弱到强的文本控制需求。这一设计直击视频生成领域的关键瓶颈,即如何平衡关键帧约束与动态叙事自由,为评估模型在复杂时序任务中的执行精度与泛化能力提供了标准化依据。随着多模态生成技术的爆发,KeyFrame-Compass的应用价值显著提升,它推动了视频生成从简单运动合成向精确构图与情节驱动的演进,尤其在自动化内容创作、影视预演等热点领域中,该基准为验证模型对叙事节奏与视觉锚点的把控力奠定了方法论基础,进而引导研究从粗粒度生成向精细化的可控视频合成范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务