awesome-audiovisual-learning
收藏资源简介:
该数据集合集是一个精心策划的音频-视觉学习方法和数据集的列表,基于相关综述论文。它涵盖了音频-视觉识别、跨模态感知和音频-视觉协作等多个领域,包括语音识别、动作识别、情感识别、声音分离、深度估计、音频-视觉定位、事件解析和问答等任务的数据集资源。该合集旨在为研究人员提供全面的音频-视觉学习数据集索引和推荐。
This curated collection is a list of audio-visual learning methods and datasets compiled based on relevant review papers. It covers multiple domains including audio-visual recognition, cross-modal perception and audio-visual collaboration, with dataset resources for tasks such as speech recognition, action recognition, emotion recognition, sound separation, depth estimation, audio-visual localization, event parsing and question answering. This collection aims to provide researchers with comprehensive indexing and recommendations for audio-visual learning datasets.
数据集详情总结
该页面是一个音频-视觉学习方法和数据集的精选列表,基于综述论文《Learning in Audio-visual Context: A Review, Analysis, and New Perspective》。该列表将持续更新,欢迎通过Pull Requests推荐优秀相关工作。
主要研究方向
音频-视觉增强 (Audio-visual Boosting)
音频-视觉识别 (Audio-visual Recognition)
- 语音识别 (Speech Recognition):包含大量相关工作,时间跨度从2015年至2024年,涵盖深度学习方法、多模态融合、自监督学习、鲁棒语音识别等方向。
- 说话人识别 (Speaker Recognition):涉及说话人分离、说话人验证、活跃说话人检测等任务。
单模态增强 (Uni-modal Enhancement)
- 语音增强与分离
- 目标声音分离
- 人脸超分辨率与重建
跨模态感知 (Cross-modal Perception)
跨模态生成 (Cross-modal Generation)
- 单声道声音生成:包括语音、音乐、自然声音
- 空间声音生成
- 视频生成:包括说话人脸、姿态、舞蹈、图像操作
- 深度估计
音频-视觉迁移学习 (Audio-visual Transfer Learning)
跨模态检索 (Cross-modal Retrieval)
音频-视觉协作 (Audio-visual Collaboration)
音频-视觉表示学习 (Audio-visual Representation Learning)
音频-视觉定位 (Audio-visual Localization)
- 视频中声音定位
- 音频-视觉显著性检测
- 音频-视觉导航
音频-视觉事件定位与解析 (Audio-visual Event Localization and Parsing)
- 定位
- 解析
音频-视觉问答与对话 (Audio-visual Question Answering and Dialog)
- 问答
- 对话
数据集 (Datasets)
页面中包含数据集部分,但README内容中未具体列出数据集名称或详细信息。




