VALOR-1M
收藏官方服务:
资源简介:
包含1M可听视频,带有人工标注的视听字幕的大规模高质量三模态数据集
A large-scale high-quality tri-modal dataset containing 1 million listenable videos paired with manually annotated audio-visual subtitles
创建时间:
2023-04-17
搜集汇总
数据集介绍

构建方式
VALOR-1M数据集从AudioSet中筛选出约100万个可下载的开放域视频片段,这些视频同时包含视觉与音频轨道。为了获得高质量的视听描述,研究团队设计了三阶段人工标注流程:首先对500名标注员进行培训,强调描述需涵盖主体、活动、场景、物体及声音等要素;随后对VALOR-32K子集的视频进行首轮标注并反馈修正;最终对VALOR-1M视频进行第二轮标注,每条描述由三名标注员交叉审核以确保质量。整个标注与校验周期约两个月,最终每个视频均获得一条同步描述视觉与音频内容的人工标注字幕。
特点
VALOR-1M是首个大规模、强关联的视觉-音频-语言三模态数据集,其核心优势在于丰富的音频概念与高质量的视听字幕。通过音频概念密度(ACD)指标量化评估,VALOR-1M的ACD值(9.7%)显著高于WebVid-2.5M(3.3%)等现有视频-语言数据集,表明其字幕中蕴含更密集的音频语义。同时,该数据集的平均字幕长度达16.4词,长于多数同类数据集,这得益于对音频信息的详细描述与严格的标注质量控制。与依赖ASR转录或alt-text的数据集相比,VALOR-1M的字幕能同时准确反映视觉与听觉线索,消除了模态间的语义鸿沟。
使用方法
VALOR-1M专为三模态预训练设计,可直接用于训练视觉-音频-语言联合感知模型。使用时,研究者可将视频帧、音频波形与对应字幕作为输入,通过多模态分组对齐(MGA)与多模态分组字幕生成(MGC)等预训练任务,学习跨模态的细粒度关联。该数据集支持多种下游任务的迁移,包括文本到视频/音频/视听检索、视频/音频/视听字幕生成以及视觉/音频/视听问答。模型在VALOR-1M上预训练后,可在MSRVTT、AudioCaps等公开基准上微调,并实现当前最优性能。
背景与挑战
背景概述
多模态感知是人类理解世界的重要方式,而构建能够同时处理视觉、听觉与语言信息的智能系统一直是人工智能领域的核心追求。在此背景下,中国科学院自动化研究所的刘静团队于2023年提出了VALOR-1M数据集,旨在推动视觉-音频-语言三模态预训练研究的发展。该数据集包含100万段开放领域的可听视频,每段视频均配有由人工标注的视听描述文本,同时涵盖了视觉与音频内容。VALOR-1M的创建弥补了现有视频-语言数据集缺乏音频-语言强关联的不足,为训练具备跨模态理解与生成能力的统一模型提供了高质量的数据基础,在多项公开基准测试中刷新了最优性能记录。
当前挑战
VALOR-1M数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,现有视觉-语言预训练模型忽略了音频模态的语义互补作用,导致在多模态场景下的感知能力受限。VALOR-1M需解决如何有效建模视觉、音频与语言三者间复杂关联的核心难题,以支持检索、描述生成及问答等多样化下游任务。其次,在数据构建过程中,挑战尤为突出:一方面,现有视频数据集或缺乏音频信号,或仅包含与语音转录重叠的文本,难以满足三模态强关联需求;另一方面,人工标注视听描述的任务新颖且复杂,需设计多步骤交互式标注流程,包括对标注员的专业培训、两阶段标注与质量复核,整个过程耗时约两个月,以确保描述同时涵盖视觉与音频概念的高质量产出。
常用场景
经典使用场景
在视觉与语言预训练模型蓬勃发展的背景下,VALOR-1M数据集作为首个大规模、高质量的人工标注三模态(视觉-音频-语言)数据集,开辟了多模态感知与生成的新范式。该数据集包含100万段开放域可听视频,每段视频均配有同时描述视觉内容与音频事件的人工标注描述文本。其最经典的使用场景在于支撑三模态联合预训练,即通过视觉、音频与文本三种模态的协同学习,使模型能够捕获跨模态的细粒度语义关联。例如,研究者可基于VALOR-1M训练统一的端到端模型,使其同时具备视觉-语言、音频-语言以及视听-语言的理解与生成能力,从而为后续多样化的下游任务提供强大的基础表征。
解决学术问题
VALOR-1M数据集精准地解决了当前多模态预训练领域中一个核心学术难题:现有大规模视频-语言数据集(如HowTo100M、WebVid-2.5M)要么缺乏音频模态,要么其文本标注来自自动语音识别转录或网页替代文本,与音频内容缺乏强相关性,导致模型无法有效学习音频与文本之间的映射关系。该数据集通过人工标注的方式,确保了文本描述与视频中视觉及音频事件的高度一致性,从而为构建真正的三模态对齐与生成模型提供了关键数据基础。其意义在于,它使得研究者能够系统性地探索音频模态如何增强视频理解,并推动了从双模态(视觉-语言)到三模态(视觉-音频-语言)预训练范式的跨越式发展,显著提升了模型在检索、描述和问答等任务上的泛化性能。
衍生相关工作
VALOR-1M数据集的出现直接催生了一系列具有影响力的后续研究工作。其最直接的衍生工作是VALOR模型的提出,该模型利用多模态分组对齐与分组描述生成两大预训练任务,在视觉-语言、音频-语言及视听-语言三大类下游任务上均取得了当时最优的性能。该数据集还促进了针对视听语言联合理解与生成的新型基准测试(VALOR-32K)的建立,为学术社区提供了标准化的评估平台。此外,受VALOR-1M中高质量三模态标注的启发,后续研究开始探索更高效的跨模态融合机制、更强大的三模态编码器架构,以及利用该数据集进行零样本或少样本学习的可能性,从而持续推动着多模态人工智能领域的边界拓展。
以上内容由遇见数据集搜集并总结生成



