遇见数据集

LongAV-Compass

收藏
github2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

LongAV-Compass是一个分钟级音视频生成的基准和评估工具包,涵盖文本到音视频(T2AV)、图像到音视频(I2AV)和视频到音视频(V2AV)任务,通过事件级问答、生成质量、长时结构、过渡稳定性、整体呈现、文本-视频对齐、参考一致性和可选音频诊断来评估长视频。它包含284个精选测试用例,用于评估长视频生成的多粒度单元。

LongAV-Compass is a minute-level audio-visual generation benchmark and evaluation toolkit covering text-to-audio-visual (T2AV), image-to-audio-visual (I2AV), and video-to-audio-visual (V2AV) tasks. It evaluates long-form videos via event-level question answering, generation quality, long-term structure, transition stability, overall presentation, text-video alignment, reference consistency, and optional audio diagnostics. The toolkit includes 284 curated test cases for assessing multi-granularity units in long-form video generation.

创建时间:
2026-05-27
原始信息汇总

数据集概述

LongAV-Compass 是一个面向分钟级音视频生成的统一评测基准与工具包,旨在为文本到音视频(T2AV)、图像到音视频(I2AV)和视频到音视频(V2AV)三种任务提供系统的评估方案。

核心任务与评测焦点

任务 输入条件 目标输出 主要评测焦点
T2AV 长文本提示(Long-form text prompt) 分钟级音视频 事件完成度、视觉质量、长程结构、音视频一致性
I2AV 参考图像 + 提示 分钟级音视频 图像锚定、身份/参考一致性、事件质量、时序稳定性
V2AV 参考视频 + 提示 延续的音视频 视频延续、过渡稳定性、长程连贯性、语义忠实度

数据集规模

  • 包含 284个 精心策划的测试用例,覆盖 T2AV、I2AV 和 V2AV 三个任务。

数据格式与布局

Hugging Face 数据集结构: text LongAV-Compass/ T2AV/final_json/T2AV_001.json I2AV/final_json/I2AV_001.json I2AV/images/I2AV_001.jpg V2AV/final_json/V2AV_001.json V2AV/videos/V2AV_001.mp4

预处理后的样本结构: text samples/prepared/<sample_id>/ sample_index.json canonical_events.json event_checklists.json <model_name>/ full_video.mp4 events/ event_001.mp4 boundaries/ boundary_001.mp4

评测维度

评测器从每个生成的长视频中构建多粒度单元,包括:

  • 全视频视角(Full-video views)
  • 事件级片段(Event-level clips)
  • 过渡边界片段(Transition-boundary clips)
  • 采样帧(Sampled frames)

评估覆盖以下维度:

  • 事件完成度(Event fulfillment)
  • 生成质量(Generation quality)
  • 长格式结构(Long-form structure)
  • 过渡稳定性(Transition stability)
  • 整体呈现(Holistic presentation)
  • 文本-视频对齐(Text-video alignment)
  • 参考一致性(Reference consistency)
  • 可选的音频诊断(Optional audio diagnostics)

得分策略

论文级的聚合分析使用 balanced_score:将六个共享的视频指标归一化到 0-100 尺度,并等权平均。人类对齐通过维度级成对胜率比较(pairwise win-rate comparisons)报告,而非单一总分。

关键资源链接

  • 论文: https://arxiv.org/abs/2605.26244
  • 数据集 (Hugging Face): https://huggingface.co/datasets/TengfeiLiuCoder/LongAV-Compass
  • 数据格式说明: https://github.com/pkucs-Ltf/LongAV-Compass/blob/main/docs/dataset_format.md
  • 得分定义: https://github.com/pkucs-Ltf/LongAV-Compass/blob/main/docs/score_definition.md
搜集汇总
数据集介绍
LongAV-Compass 数据集图片
构建方式
在音视频生成领域,从文本、图像到视频的跨模态分钟级内容生成正逐步成为前沿热点,然而现有评测多聚焦于短片段,难以捕捉长时程中的结构连贯性与事件演化。LongAV-Compass数据集为此而设计,系统性地构建了涵盖文本到音视频(T2AV)、图像到音视频(I2AV)以及视频到音视频(V2AV)三大任务的284个精选测试案例。每个案例均包含精细标注的事件级问答、过渡边界剪辑及全景帧采样,形成从全视频到事件片段的多粒度评测单元,为分钟级音视频生成提供了统一的量化比较基础。
特点
该数据集的核心特色在于其多层次、多维度的评测体系。它不仅从生成质量、长程结构、过渡稳定性及整体呈现等维度进行量化打分,还引入了事件级文本-视频对齐、参考一致性等细粒度指标,并支持可选的音频诊断模块。此外,LongAV-Compass采用平衡分数聚合策略,将六项共享视频指标归一化至0-100分后等权平均,避免了单一总分带来的偏差,同时通过成对胜率比较来呈现人类对齐结果,确保了评测的全面性与公平性。
使用方法
使用LongAV-Compass进行评测时,首先需通过GitHub仓库配置环境并下载Hugging Face上的基准数据集。用户需将待评测模型生成的音视频文件按任务类别(t2av、i2av、v2av)存放于指定输出目录,随后运行制备脚本构建标准化样本。评测流程支持批量运行、按模型选择评估以及中断后恢复计算,最终输出包含事件级摘要、模型分数矩阵及聚合后的平衡分数,为研究社区提供了一套可复现、可对比的分钟级音视频生成性能验证工具。
背景与挑战
背景概述
随着多模态生成技术的迅猛发展,分钟级长视频与音频联合生成已成为人工智能领域的前沿研究方向,其应用场景覆盖影视制作、虚拟现实、智能教育等众多领域。由北京大学、北京大学计算机学院等多机构研究人员于2026年发布的LongAV-Compass基准数据集,旨在系统性地解决文本到音视频(T2AV)、图像到音视频(I2AV)以及视频到音视频(V2AV)三种生成任务的统一评估难题。该数据集精心设计了284个测试用例,通过事件级问答、生成质量、长程结构、过渡稳定性及整体呈现等多维度评价指标,为评估分钟级音视频生成模型提供了全面而严谨的评测框架。作为首个面向分钟级音视频生成统一评估的公开基准,LongAV-Compass填补了该领域缺乏标准化评测体系的空白,对推动长时多模态生成模型的研究进展与性能度量具有重要的学术价值和实践意义。
当前挑战
LongAV-Compass所应对的核心挑战在于分钟级音视频生成任务的多维度评估难题。领域层面,现有评测标准多聚焦于短视频生成,难以有效衡量长视频中的事件逻辑连贯性、视听一致性及长程结构稳定性,而分钟级生成要求模型在保持视觉质量的同时,确保音频与视频在时间轴上的精准对齐与语义匹配,这对生成模型的时空建模能力提出了极高要求。构建过程中,研究者需应对数据采集与标注的复杂性,包括为T2AV、I2AV、V2AV三种任务分别定制不同输入条件下的测试用例,设计事件级划分的精细化标注方案,以及构建跨模态、跨时间尺度的多层次评价指标体系。此外,如何确保评估的可重复性与公平性,避免模型对特定评价维度的过度拟合,亦是基准构建中必须克服的技术挑战。
常用场景
经典使用场景
LongAV-Compass是面向分钟级视听生成任务的统一评测基准,覆盖文本到视听(T2AV)、图像到视听(I2AV)以及视频到视听(V2AV)三类核心生成范式。该数据集通过284个精心设计的测试用例,构建了多粒度评估体系,包括事件级问答、生成质量、长程结构、过渡稳定性、整体呈现、文本-视频对齐、参考一致性以及可选的音频诊断等八个维度。研究者可利用该基准系统评估长视频生成模型在事件完成度、时序连贯性和跨模态一致性方面的表现,并通过平衡分数聚合方法获得公平可比的结果。
解决学术问题
该数据集解决了当前视听生成领域缺乏统一分钟级评估标准的学术困境。现有基准多聚焦于短片段(数秒)或单一模态生成质量评估,无法有效度量长视频生成中的长程依赖、跨事件一致性以及多模态对齐等核心挑战。LongAV-Compass通过引入事件级细粒度分解、时序边界分析和多维度平衡评分策略,为学术界提供了首个系统评估分钟级视听生成的标准化工具。其提出的六项共享视频指标归一化聚合方法,有效消除了因模型输入条件不同导致的评估偏差,推动了长视频生成研究从定性展示向定量评测的范式转变。
衍生相关工作
该数据集的发布已衍生出多项重要学术工作:基于其事件级评估框架,研究者开发了面向长视频的时间感知质量预测模型;其提出的过渡稳定性指标启发了边界感知的视听生成网络设计,显著改进了视频续写中的时序连贯性;此外,基于该基准的多维度评分体系,多项工作探索了自适应权重的聚合策略,以更精确地反映人类对长视频的主观感知偏好。该数据集还推动了大模型在视听联合生成中的长程上下文建模研究,催生了针对分钟级生成任务的时序注意力机制优化方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务