遇见数据集

TengfeiLiuCoder/LongAV-Compass

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含LongAV-Compass的提示和事件级评估数据,LongAV-Compass是一个针对文本到音视频(T2AV)、图像到音视频(I2AV)和视频到音视频(V2AV)任务的分钟级音视频生成的系统基准。

This dataset contains prompt and event-level evaluation data for LongAV-Compass, a systematic benchmark for minute-long audio-visual generation across text-to-audio-video (T2AV), image-to-audio-video (I2AV), and video-to-audio-video (V2AV) tasks.

提供机构:
TengfeiLiuCoder
搜集汇总
数据集介绍
TengfeiLiuCoder/LongAV-Compass 数据集图片
构建方式
LongAV-Compass数据集的构建遵循了一条系统化的管线设计,旨在为分钟级视听生成任务提供统一的评测基准。数据集覆盖文本到音视频、图像到音视频以及视频到音视频三种核心任务范式,通过分阶段的事件级标注策略,为每个样本精心设计了全局提示、细粒度事件描述、音频预期及事件级问答对。数据以JSON格式存储,样本ID按任务类型顺序编号,并附有对应的参考图像或视频文件,确保数据结构的完整性与可复现性。
特点
该数据集最显著的特征在于其事件级(event-level)的精细标注架构,将长视频生成分解为多个连续且语义连贯的生成步骤,每个步骤均包含独立的语言提示、持续时间及参考信息。这种设计不仅支持链式分步生成,还兼容单次全量生成模式,赋予了模型评估以高度灵活性。此外,数据集在多任务范式下统一了评估标准,通过控制视觉、运动与时间连续性的参考规则,为衡量模型在长时域中的跨模态对齐能力提供了坚实支撑。
使用方法
使用者可通过Hugging Face的`load_dataset` API便捷加载数据索引,并根据需求选择事件级分步生成或单次全量生成两种调用方式。对于事件级生成,借助`generation_utils.py`中的工具函数,可依次构建生成计划、解析步骤引用并循环产出视频片段。单次生成则通过合并所有事件提示为统一输入,简化调用流程。无论是精细化控制还是快捷评测,数据集均提供了清晰的Python接口与示例代码,大幅降低了应用门槛。
背景与挑战
背景概述
随着多模态生成技术的迅猛发展,长时音视频联合生成逐渐成为学界和业界关注的焦点。然而,现有评测基准多聚焦于短视频或单一模态,缺乏对分钟级、多场景、多任务音视频生成能力的系统性评估。为填补这一空白,由北京大学等机构的研究团队于2026年发布了LongAV-Compass数据集,旨在构建一个涵盖文本到音视频(T2AV)、图像到音视频(I2AV)以及视频到音视频(V2AV)三大任务的统一评测基准。该数据集精心设计了128、115和41个样本,分别对应上述三类任务,每个样本均包含事件级细粒度描述与评估问题,为分钟级长视频的协同生成提供了标准化的测试平台。自发布以来,LongAV-Compass迅速成为相关领域的重要参考,推动了音视频联合生成在时长、跨模态一致性等维度上的深入探索。
当前挑战
LongAV-Compass数据集的构建面临若干核心挑战。其一,领域问题层面,现有模型在分钟级长视频生成中常出现视觉与音频不同步、事件逻辑断裂等缺陷,而该数据集通过事件级划分与逐段参考机制,力求解决长时生成中的模态对齐与时间一致性难题。其二,构建过程中,如何为每一事件设计既独立又连贯的文本描述、音频预期及视觉参考,同时兼顾T2AV、I2AV、V2AV三类任务在输入模态上的差异,是一大难点。此外,数据集规模的平衡——在保证评估全面性的同时控制样本数量以避免冗余——也需精细处理。特别地,对于V2AV任务,需为每个样本提供高质量的参考视频,而I2AV任务则需确保参考图像与后续事件的视觉延续性,这对数据采集与标注提出了较高要求。
常用场景
经典使用场景
LongAV-Compass数据集专为分钟级音频-视频联合生成任务设计,覆盖文本到音频-视频(T2AV)、图像到音频-视频(I2AV)以及视频到音频-视频(V2AV)三大经典范式。其核心使用场景在于为长时域、多模态生成模型提供系统化的评估基准,尤其注重事件级的时间连贯性与视听一致性。研究者可通过该数据集构建链式生成流程,以逐步生成包含多个语义事件的连贯长视频,并利用内置的事件级问答机制对生成内容进行细粒度评测。
解决学术问题
该数据集旨在解决现有视听生成领域缺乏统一、细致度高的分钟级基准这一核心学术难题。此前,大多数基准仅关注短片段或单一模态,难以评估生成模型在长时间尺度上的语义保持、跨模态对齐和事件过渡能力。LongAV-Compass通过引入事件级结构化标注与链式生成评测策略,使得研究者能够量化模型在维持视觉、音频与时间连续性方面的表现,从而推动长视频生成研究从定性展示走向定量分析。
衍生相关工作
基于LongAV-Compass的评测框架,研究者已衍生出多个方向的工作。一方面,有工作专注于改进链式生成中的上下文记忆机制,如引入跨事件注意力模块或动态条件注入策略;另一方面,部分研究围绕事件级评测指标展开,开发了自动化视听一致性评分工具。此外,该数据集还启发了针对V2AV任务的时序音频同步优化方法,以及基于潜在扩散模型的分段式长视频生成架构,进一步丰富了长时域多模态生成的工具链与理论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务