awesome-audio-visual
收藏资源简介:
该合集是一个精选的音频-视觉处理领域论文和数据集资源列表,涵盖了音频-视觉定位、音频-视觉分离、音频-视觉表示/分类/检索、音频-视觉动作识别、音频-视觉空间/深度、音频-视觉房间脉冲响应、音频-视觉深度伪造/鲁棒性、轻量级音频-视觉模型、音频-视觉导航/强化学习、音频-视觉人脸/语音、音频-视觉问答、音频-视觉风格化/生成、跨模态生成以及多模态架构等多个主题领域,旨在为研究人员提供系统化的资源索引。
This collection is a curated list of papers and dataset resources in the field of audio-visual processing, covering multiple thematic areas including audio-visual localization, audio-visual separation, audio-visual representation/classification/retrieval, audio-visual action recognition, audio-visual spatial/depth, audio-visual room impulse response, audio-visual deepfake/robustness, lightweight audio-visual models, audio-visual navigation/reinforcement learning, audio-visual face/speech, audio-visual question answering, audio-visual stylization/generation, cross-modal generation, and multimodal architectures. It aims to provide researchers with a systematic resource index.
数据集与论文综述:Awesome Audio-Visual
该项目是一个精选的论文与数据集列表,涵盖了多种音频-视觉(Audio-Visual)任务。内容按研究主题分类,主要包含以下领域:
- 音频-视觉定位:包括密集事件定位、声源定位、跨模态背景抑制、弱监督解析等。涉及CVPR、ECCV、NeurIPS、AAAI、ICASSP等顶会论文,部分附有项目页面或代码。
- 音频-视觉分离:涵盖乐器和语音分离、语言引导分离、主动式分离、场景图辅助分离等。论文来源包括CVPR、ICLR、ECCV、NeurIPS、ICCV等,部分提供代码与数据集。
- 音频-视觉表示/分类/检索:涉及参数高效学习、零样本学习、弱监督视频解析、跨模态掩码自编码器、视频检索等。收录CVPR、ICLR、ECCV、NeurIPS论文,部分有开源代码。
- 其他类别(列表中部分已列出但内容未完整显示):
- 音频-视觉动作识别
- 音频-视觉空间/深度
- 音频-视觉RIR
- 音频-视觉深度伪造/鲁棒性
- 轻量级音频-视觉模型
- 音频-视觉导航/强化学习
- 音频-视觉人脸/语音
- 音频-视觉问答
- 音频-视觉风格化/生成
- 跨模态生成(音频-视频/视频-音频)
- 多模态架构
- 未分类论文
该列表受awesome-computer-vision启发而创建,旨在为音频-视觉研究领域提供系统化的资源索引。




