遇见数据集

awesome-audio-visual

收藏
github2026-05-31 更新2026-06-04 收录
官方服务:

资源简介:

该合集是一个精选的音频-视觉处理领域论文和数据集资源列表,涵盖了音频-视觉定位、音频-视觉分离、音频-视觉表示/分类/检索、音频-视觉动作识别、音频-视觉空间/深度、音频-视觉房间脉冲响应、音频-视觉深度伪造/鲁棒性、轻量级音频-视觉模型、音频-视觉导航/强化学习、音频-视觉人脸/语音、音频-视觉问答、音频-视觉风格化/生成、跨模态生成以及多模态架构等多个主题领域,旨在为研究人员提供系统化的资源索引。

This collection is a curated list of papers and dataset resources in the field of audio-visual processing, covering multiple thematic areas including audio-visual localization, audio-visual separation, audio-visual representation/classification/retrieval, audio-visual action recognition, audio-visual spatial/depth, audio-visual room impulse response, audio-visual deepfake/robustness, lightweight audio-visual models, audio-visual navigation/reinforcement learning, audio-visual face/speech, audio-visual question answering, audio-visual stylization/generation, cross-modal generation, and multimodal architectures. It aims to provide researchers with a systematic resource index.

创建时间:
2019-03-30
原始信息汇总

数据集与论文综述:Awesome Audio-Visual

该项目是一个精选的论文与数据集列表,涵盖了多种音频-视觉(Audio-Visual)任务。内容按研究主题分类,主要包含以下领域:

  • 音频-视觉定位:包括密集事件定位、声源定位、跨模态背景抑制、弱监督解析等。涉及CVPR、ECCV、NeurIPS、AAAI、ICASSP等顶会论文,部分附有项目页面或代码。
  • 音频-视觉分离:涵盖乐器和语音分离、语言引导分离、主动式分离、场景图辅助分离等。论文来源包括CVPR、ICLR、ECCV、NeurIPS、ICCV等,部分提供代码与数据集。
  • 音频-视觉表示/分类/检索:涉及参数高效学习、零样本学习、弱监督视频解析、跨模态掩码自编码器、视频检索等。收录CVPR、ICLR、ECCV、NeurIPS论文,部分有开源代码。
  • 其他类别(列表中部分已列出但内容未完整显示):
    • 音频-视觉动作识别
    • 音频-视觉空间/深度
    • 音频-视觉RIR
    • 音频-视觉深度伪造/鲁棒性
    • 轻量级音频-视觉模型
    • 音频-视觉导航/强化学习
    • 音频-视觉人脸/语音
    • 音频-视觉问答
    • 音频-视觉风格化/生成
    • 跨模态生成(音频-视频/视频-音频)
    • 多模态架构
    • 未分类论文

该列表受awesome-computer-vision启发而创建,旨在为音频-视觉研究领域提供系统化的资源索引。

搜集汇总
数据集介绍
awesome-audio-visual 数据集图片
构建方式
该数据集以精选论文与数据集的集合形式构建,系统梳理了视听多模态研究领域的核心进展。其构建方式依托于对计算机视觉与音频处理交叉领域的深度文献调研,通过分类整理音频-视觉定位、分离、表征学习、动作识别、深度伪造检测等十余个子方向的前沿工作,整合了来自CVPR、ECCV、NeurIPS、ICLR等顶级学术会议的论文及其配套代码、项目页面与数据集链接,形成了一个结构清晰、内容全面的知识资源库。
特点
该数据集具有高度的系统性与时效性,覆盖了从经典方法到最新突破的广泛研究主题。其显著特点在于细粒度的任务分类体系,每个子类别下均收录了代表性论文,并附有官方代码与项目链接,便于研究者快速定位与复现。此外,数据集还特别关注了弱监督学习、跨模态生成、轻量化模型等前沿方向,体现了当前视听融合领域的技术趋势与挑战。
使用方法
使用者可通过目录索引快速定位感兴趣的研究主题,如音频-视觉定位或分离。每个条目均提供了论文标题、作者、发表会议及可下载的PDF链接,部分还包含代码仓库与项目页面。研究者可直接访问相关链接获取原始资源,或通过交叉引用探索不同子任务间的关联。该数据集亦适合作为教学与综述研究的参考基准,帮助学者系统把握视听多模态领域的发展脉络。
背景与挑战
背景概述
近年来,多模态学习领域蓬勃发展,其中视听联合学习因其模拟人类感知方式的独特优势而备受关注。该领域的研究旨在融合视觉与听觉信息,以提升机器对复杂场景的理解能力。在此背景下,awesome-audio-visual数据集应运而生,由一群来自全球顶尖研究机构(如牛津大学、麻省理工学院、Facebook AI研究院等)的学者于2018年至2023年间持续构建与维护。该数据集并非单一实体,而是一个系统梳理了视听定位、分离、表征学习、动作识别、深度伪造检测等十余个核心研究方向的论文与资源宝库。其核心研究问题聚焦于如何有效建模视听数据间的时空对应关系,实现跨模态信息的协同理解与生成。该数据集对相关领域产生了深远影响,不仅为研究者提供了全面的文献索引与基准,更推动了自监督学习、弱监督学习等范式在视听任务中的广泛应用,成为该领域不可或缺的参考基石。
当前挑战
awesome-audio-visual数据集所涵盖的领域面临多重挑战。首先,在核心任务层面,如视听事件定位与源分离,模型需应对真实世界中视听信号的高度异步性与噪声干扰,例如背景杂音与视觉遮挡导致的对齐困难。其次,数据的异质性构成严峻考验,不同模态(如音频频谱与视频帧)在采样率、时间分辨率及语义粒度上的差异,亟需设计精巧的跨模态融合架构。此外,构建过程中的挑战亦不容忽视:大规模标注视听数据成本高昂,且弱监督场景下标签噪声易引发误判;同时,现有基准多局限于简化场景,难以泛化至开放域中的多源混合与动态变化环境。这些挑战共同制约着模型在鲁棒性、可解释性及实际部署中的表现。
常用场景
经典使用场景
在视听智能领域,该数据集被广泛用于音源定位与分离任务,其经典场景在于从混合音频信号中精准辨别并定位视觉场景中的发声物体。研究者利用其提供的多模态标注,开发出能够同时处理音频与视觉信息的深度学习模型,如在嘈杂环境中识别特定乐器的音源位置,或从多人对话中分离出目标说话人的语音。该数据集的高质量配对数据为模型训练提供了坚实基础,推动了视听融合技术在复杂场景下的鲁棒性提升。
衍生相关工作
该数据集催生了诸多具有里程碑意义的学术工作,包括提出从粗到细的多源音源定位框架(ECCV 2020)、基于场景图的音频分离方法(NeurIPS 2022),以及融合语言引导的三模态一致性分离模型(CVPR 2023)。此外,衍生工作如视听事件解析中的跨模态背景抑制网络(CVPR 2022)和基于视觉变换器的参数高效学习器(CVPR 2023),均以该数据集为基准,推动了视听联合建模的理论边界与工程实践。
数据集最近研究
最新研究方向
在视听融合研究领域,前沿方向正从传统的声源定位与分离任务,向更复杂的跨模态理解与生成范式演进。随着自监督学习与对比学习框架的成熟,研究者致力于在无需密集标注的条件下,构建能够精准感知视听事件时空关联的智能模型。近期,基于Transformer架构的参数高效学习方法、跨模态掩码自编码器以及弱监督事件解析技术成为焦点,这些工作通过挖掘视觉与音频模态间的深层语义对应关系,显著提升了模型在复杂场景下的泛化能力。同时,针对深度伪造检测、轻量化模型设计以及主动视听导航等新兴课题的探索,不仅回应了多媒体内容安全与机器人交互的现实需求,也推动了多模态感知从实验室走向真实世界应用,为该领域奠定了从感知智能迈向认知智能的关键基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务