SynTVA
收藏资源简介:
SynTVA 是一个由昆士兰大学创建的合成视频-文本数据集,旨在评估合成视频在文本到视频检索(TVR)任务中的效用。该数据集基于从 MSRVTT 训练分割中提取的 800 个多样化的用户查询,使用先进的 T2V 模型生成了 2400 个视频,并沿四个关键语义对齐维度(对象和场景、动作、属性和提示保真度)对每个视频-文本对进行了标注。SynTVA 数据集通过评估框架将一般视频质量评估(VQA)指标与这些对齐分数相关联,并检验它们对下游 TVR 性能的预测能力。此外,该数据集还开发了一个自动评估器来估计现有指标的对齐质量。SynTVA 数据集适用于数据增强,并能够选择高实用性的合成样本,从而显著提高 TVR 的结果。
SynTVA is a synthetic video-text dataset developed by The University of Queensland, aimed at evaluating the utility of synthetic videos for the text-to-video retrieval (TVR) task. This dataset is built upon 800 diverse user queries extracted from the training split of MSRVTT, and uses state-of-the-art text-to-video (T2V) models to generate 2400 videos. Each video-text pair is annotated along four key semantic alignment dimensions: object and scene, action, attribute, and prompt fidelity. The SynTVA dataset associates general Video Quality Assessment (VQA) metrics with these alignment scores through an evaluation framework, and examines their predictive power for downstream TVR performance. Additionally, an automatic evaluator is developed for this dataset to estimate the alignment quality of existing metrics. The SynTVA dataset is suitable for data augmentation and enables the selection of high-utility synthetic samples, thereby significantly improving TVR performance.
SynTVA数据集概述
基本信息
- 数据集名称:SynTVA (Synthetic Text-to-Video Alignment)
- 作者:Zecheng Zhao, Selena Song, Tong Chen, Zhi Chen, Shazia Sadiq, Yadan Luo
- 机构:The University of Queensland
- 发表会议:ACM Multimedia Dataset Track 2025 Submission
研究背景
- 研究领域:文本到视频(T2V)合成
- 当前问题:现有评估指标主要关注视觉质量和时间一致性,缺乏对下游任务(如文本到视频检索/TVR)性能的评估
数据集内容
- 数据来源:基于MSRVTT训练集派生的800个多样化用户查询
- 生成方式:使用最先进的T2V模型生成合成视频
- 标注维度:
- 对象与场景(Object & Scene)
- 动作(Action)
- 属性(Attribute)
- 提示保真度(Prompt Fidelity)
评估框架
- 将通用视频质量评估(VQA)指标与语义对齐分数相关联
- 检验这些指标对下游TVR性能的预测能力
- 开发Auto-Evaluator自动评估对齐质量
应用价值
- 数据集增强:可选择高质量合成样本显著改善TVR结果
- 基准测试:评估合成视频在检索任务中的实用性
示例文本提示
- 高科技展厅中展示创新功能的时尚机器人
- 阳光后院中毛茸茸的小狗与主人玩接球游戏
- 厨师在砧板上用锋利刀具切蔬菜
- 希拉里·克林顿在大型竞选活动舞台上发表总统演讲
- 教师在教室环境中逐步讲解数学问题
视频生成模型
- Cosmos
- Mochi
- Wan2.1
主题类别
包含动物、烹饪、纪录片、教育、家庭、时尚、食品、游戏、教程、电影、音乐、人物、政治、节目、体育、技术、旅行、车辆等多样化主题

- 1Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos昆士兰大学,澳大利亚布里斯班 · 2025年



