遇见数据集

awesome-audiovisual-learning

收藏
github2026-05-25 更新2026-06-04 收录
官方服务:

资源简介:

该数据集合集是一个精心策划的音频-视觉学习方法和数据集的列表,基于相关综述论文。它涵盖了音频-视觉识别、跨模态感知和音频-视觉协作等多个领域,包括语音识别、动作识别、情感识别、声音分离、深度估计、音频-视觉定位、事件解析和问答等任务的数据集资源。该合集旨在为研究人员提供全面的音频-视觉学习数据集索引和推荐。

This curated collection is a list of audio-visual learning methods and datasets compiled based on relevant review papers. It covers multiple domains including audio-visual recognition, cross-modal perception and audio-visual collaboration, with dataset resources for tasks such as speech recognition, action recognition, emotion recognition, sound separation, depth estimation, audio-visual localization, event parsing and question answering. This collection aims to provide researchers with comprehensive indexing and recommendations for audio-visual learning datasets.

创建时间:
2022-07-28
原始信息汇总

数据集详情总结

该页面是一个音频-视觉学习方法和数据集的精选列表,基于综述论文《Learning in Audio-visual Context: A Review, Analysis, and New Perspective》。该列表将持续更新,欢迎通过Pull Requests推荐优秀相关工作。

主要研究方向

音频-视觉增强 (Audio-visual Boosting)

音频-视觉识别 (Audio-visual Recognition)

  • 语音识别 (Speech Recognition):包含大量相关工作,时间跨度从2015年至2024年,涵盖深度学习方法、多模态融合、自监督学习、鲁棒语音识别等方向。
  • 说话人识别 (Speaker Recognition):涉及说话人分离、说话人验证、活跃说话人检测等任务。

单模态增强 (Uni-modal Enhancement)

  • 语音增强与分离
  • 目标声音分离
  • 人脸超分辨率与重建

跨模态感知 (Cross-modal Perception)

跨模态生成 (Cross-modal Generation)

  • 单声道声音生成:包括语音、音乐、自然声音
  • 空间声音生成
  • 视频生成:包括说话人脸、姿态、舞蹈、图像操作
  • 深度估计

音频-视觉迁移学习 (Audio-visual Transfer Learning)

跨模态检索 (Cross-modal Retrieval)

音频-视觉协作 (Audio-visual Collaboration)

音频-视觉表示学习 (Audio-visual Representation Learning)

音频-视觉定位 (Audio-visual Localization)

  • 视频中声音定位
  • 音频-视觉显著性检测
  • 音频-视觉导航

音频-视觉事件定位与解析 (Audio-visual Event Localization and Parsing)

  • 定位
  • 解析

音频-视觉问答与对话 (Audio-visual Question Answering and Dialog)

  • 问答
  • 对话

数据集 (Datasets)

页面中包含数据集部分,但README内容中未具体列出数据集名称或详细信息。

搜集汇总
数据集介绍
awesome-audiovisual-learning 数据集图片
构建方式
该数据集以综述性论文《Learning in Audio-visual Context: A Review, Analysis, and New Perspective》为核心支撑,通过系统梳理和整理视听学习领域的代表性方法与数据集,构建了一个结构化、持续更新的资源清单。构建过程中,研究团队从音频-视觉增强、跨模态感知和视听协作三大主题出发,将相关文献按任务类型(如语音识别、说话人识别、动作识别、声音分离、跨模态生成、视听定位等)进行细致分类,并收录了每篇论文的标题、作者、机构和发表会议信息,从而形成层次分明、内容全面的知识图谱。
特点
该数据集最显著的特征在于其高度的组织性和覆盖广度。它不仅囊括了从经典方法到前沿成果的数百篇文献,还通过三级目录结构(如“Audio-visual Boosting”→“Audio-visual Recognition”→“Speech Recognition”)实现了对复杂研究领域的精细划分。此外,数据集采用开放协作的维护机制,鼓励研究者通过Pull Requests贡献新工作,确保了内容的时效性与动态演进能力。这种结构既便于新手快速入门,也为资深学者提供了系统的文献索引,彰显了其在学术探索中的实用价值。
使用方法
使用者可直接通过GitHub仓库访问该数据集,利用内置的表格目录快速定位感兴趣的子领域。每个条目均附带论文标题、作者、机构和发表会议,并提供了指向原文的链接(如arXiv、IEEE Xplore等),便于直接获取详细资料。研究者可据此进行文献调研、追踪技术脉络或比较不同方法的性能。对于希望贡献新工作的用户,可通过提交Pull Requests的方式参与维护,共同丰富这一资源。此外,数据集还关联了配套的综述网站和arXiv论文,提供更全面的背景解读与交叉引用。
背景与挑战
背景概述
视听学习作为多模态感知领域的前沿方向,旨在通过融合视觉与听觉信息,提升机器对复杂环境的理解能力。该数据集(awesome-audiovisual-learning)由gewu-lab团队于2022年整理发布,基于其综述论文《Learning in Audio-visual Context: A Review, Analysis, and New Perspective》,系统梳理了视听学习领域的核心方法、数据集及研究进展。其核心研究问题聚焦于如何利用视觉与听觉的互补性,解决单一模态难以应对的挑战,如噪声环境下的语音识别、跨模态内容生成及协同定位等。自发布以来,该数据集已成为该领域的重要参考资源,推动了对视听增强、跨模态感知及协作机制等方向的深入探索,对多媒体分析、人机交互及智能机器人等应用产生了显著影响。
当前挑战
视听学习面临的核心挑战在于多模态数据间的异构性与动态对齐问题。在领域层面,如何有效融合视觉与听觉特征以提升识别鲁棒性(如嘈杂环境中的语音识别)仍是难点,同时跨模态生成(如视频驱动的音频合成)需解决时空一致性。构建过程中,数据集的整合面临标注质量参差、模态缺失(如无声视频)及场景多样性不足等挑战,例如视听语音识别数据集常受限于实验室环境,难以泛化至真实场景。此外,跨语言、跨文化的数据稀缺性进一步制约了模型的通用性,而动态事件(如多人对话)中的多源同步与解析亦增加了数据处理的复杂度。
常用场景
经典使用场景
该数据集广泛应用于视听融合学习领域,经典使用场景涵盖视听语音识别、说话人识别与动作识别等任务。在视听语音识别中,研究者借助音视频双模态信息,在嘈杂环境中显著提升识别鲁棒性;在说话人识别中,通过融合面部动态与声学特征,实现更精准的身份确认。此外,动作识别任务利用视听协同线索,增强对复杂人体行为的理解。这些场景推动了多模态感知系统的性能飞跃。
解决学术问题
该数据集有效解决了单一模态在噪声环境下的性能退化问题,例如在强背景噪声中,纯音频识别准确率大幅下降,而视觉信息(如唇动)可提供互补线索。同时,它攻克了跨模态对齐与融合的学术难题,如时序同步与特征异构性。这些突破为多模态学习理论奠定了实证基础,推动了视听表征学习的范式革新,并在鲁棒性、泛化性评估上树立了新标杆。
衍生相关工作
该数据集衍生了一系列经典工作,如基于Transformer的视听融合模型(AV-Former)、自监督视听语音表征学习(AV-HuBERT)以及跨模态知识蒸馏方法。这些研究不仅深化了对视听协同机制的理解,还催生了视听导航、视听问答等新兴方向。代表性工作如《Deep Audio-visual Speech Recognition》开创了端到端视听识别范式,后续工作在此基础上持续优化,形成了丰富的学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务