遇见数据集

A2I-Set

收藏
arXiv2026-08-10 更新2026-08-12 收录
官方服务:

资源简介:

A2I-Set是一个统一的高质量三模态数据集,由音频、图像及精细文本描述构成,涵盖323K条数据,涉及241个典型音频类别,包括音乐、自然声音和语音。数据集通过多阶段流水线构建,包括视觉增强音频描述、真实图像提取与合成图像生成,并经过严格的CLAP过滤和人类专家校验,确保高保真图像与精确的跨模态对齐。该数据集旨在解决现有音频-图像数据集缺乏高质量图像和细粒度对齐的问题,为音频到图像生成等跨模态研究提供坚实基础,推动模型在表达力和忠实度上的突破。

A2I-Set is a unified high-quality tri-modal dataset composed of audio, images, and fine-grained textual descriptions. It contains 323K data instances spanning 241 representative audio categories including music, natural sounds, and speech. The dataset is constructed via a multi-stage pipeline, which encompasses vision-enhanced audio description, real image extraction and synthetic image generation. It has undergone stringent CLAP-based filtering and human expert validation to ensure high-fidelity images and precise cross-modal alignment. This dataset addresses the critical gap in existing audio-image datasets that lack high-quality images and fine-grained alignment, providing a robust foundation for cross-modal research such as audio-to-image generation and advancing breakthroughs in model expressiveness and faithfulness.

创建时间:
2026-08-10
原始信息汇总

A2I-Set 数据集概述

基本信息

  • 数据集名称:A2I-Set
  • 论文标题:Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework
  • 发布时间:2026年4月29日
  • 论文状态:已被 ACM International Conference on Multimedia (ACMMM 2026) 接收
  • 许可协议:MIT License
  • 作者单位:中国科学技术大学、Tele AI、西北工业大学

数据集规模

  • 总音频数:260,060 条(包含241个层级标签和文本描述)
  • 合成图像:193,653 张
  • 真实图像:129,793 张
  • 评估音频:3,280 条(人工标注的混合来源测试集)

数据集结构

数据集包含以下主要目录:

  • A2I_audio:音频文件(.wav/.flac格式)
  • A2I_real:真实图像文件(.png格式)
  • A2I_syn:合成图像文件(.png格式,从视频帧中提取)
  • eval_audio_all:评估用音频,文件名中带有类别标签(以|分隔)
  • caption.json:包含所有音频的文本描述文件

数据特点

  • 三模态对齐:音频、图像、详细文本描述三者配对,专门为音频视觉研究设计
  • 层级标签体系:音频带有241个层级类别标签
  • 文本描述结构:每条caption包含三个字段:
    • [Main Subject]:主要主体描述
    • [Visual Generation Instruction]:视觉生成指令
    • [Top Level]:音频的顶级类别

研究方法(AudioCanvas模型)

  • 预对齐阶段:单独训练Audio Projector(10个epoch)
  • 风格学习阶段:在数据集的合成图像部分微调Stable Diffusion 1.4(25个epoch)
  • 全量微调阶段:在完整数据集上训练100个epoch
  • 基础模型:SD1.4(Stable Diffusion 1.4)
  • 音频编码器:CLAP(clap-htsat-unfused)

评估指标

使用的评估指标包括FID和HPSv3,评估数据集包括:

  • A2I-Eval:作者构建的人工监督混合来源测试集
  • Landscape:额外下载的风景评估数据集

下载地址

  • 数据集:https://huggingface.co/datasets/gdx123/A2I_Set
  • 论文:http://arxiv.org/abs/2608.09529
  • FID权重:https://openaipublic.blob.core.windows.net/diffusion/jul-2021/ref_batches/imagenet/256/VIRTUAL_imagenet256_labeled.npz
  • HPSv3权重:https://huggingface.co/MizzenAI/HPSv3

技术环境

  • 操作系统:Ubuntu 22.04
  • 硬件要求:8 × NVIDIA H100 80GB GPUs
  • Python版本:3.12.12
  • 框架:PyTorch,使用accelerate进行分布式训练

致谢项目

该工作参考并整合了以下开源项目:

  • MACS
  • AudioToken(https://github.com/guyyariv/AudioToken)
  • FusionAudio-1.2M(https://github.com/FreedomIntelligence/FusionAudio)
  • AudioSet(https://research.google.com/audioset/)
  • VGGSound(https://github.com/hche11/VGGSound)
搜集汇总
数据集介绍
构建方式
A2I-Set的构建依托于一套多阶段、对象级别的音视频对齐流水线,首先从AudioSet和VGGSound两大经典音频数据集中筛选出高分辨率、低抖动的视频源,并通过场景分割与图像质量评估提取了约15万张真实图像候选。与此同时,借助先进的多模态大模型,如PLLaVA和Qwen-audio-2,对音视频内容进行双重描述,再经GPT-4o-mini融合生成增强的音频描述,并利用CLAP进行一致性过滤。为了弥补真实帧与音频之间难以完全对齐的缺陷,研究团队还采用FLUX.1-Krea-dev模型根据音频描述生成约24万张高质量合成图像,这些合成图像经过两个视觉大模型的严格筛选,最终与真实图像一同通过Sam Audio和视觉定位模型的对象级对齐验证,形成了包含32万余图像、26万余音频的大规模数据集。
使用方法
A2I-Set专为音频到图像生成及更广泛的音视频多模态研究设计。研究者可直接利用其音频-图像-文本三元组进行端到端模型的训练,如论文中提出的AudioCanvas基线,通过预对齐的音频投影器与FiLM加权融合模块,将音频特征无缝注入预训练的文本到图像扩散模型,实现高保真且语义一致的图像生成。数据集中丰富的音频描述还可用于开发音频字幕生成模型,其对象级标注则支持音源定位与分离研究。此外,A2I-Set内置了人工审核的评估子集A2I-eval与均衡子集A2I-balanced,便于公平评测模型性能及缓解长尾分布影响。该数据集以开源形式发布,配套代码与模型可复现,为跨模态生成领域提供了坚实的实验基础。
背景与挑战
背景概述
A2I-Set数据集由中国电信人工智能研究院与中国科学技术大学等机构的研究人员于2026年构建,旨在解决音频到图像(A2I)跨模态生成领域数据匮乏与质量不足的瓶颈。该数据集包含323K组音频-图像-文本三元组,覆盖241类层级化音频类别,通过多阶段流水线整合真实图像提取与合成图像生成,显著提升了视觉保真度与跨模态对齐精度。其发布为音频条件图像生成提供了大规模高质量训练资源,推动了A2I模型向高表达力与高可信度方向发展,在多媒体研究领域具有重要影响力。
当前挑战
A2I-Set面临的挑战集中于两大维度:其一,领域核心难题在于音频与图像间的语义鸿沟——传统数据集多源自视频抽帧,常出现音频主体与画面不匹配、图像质量参差等问题,难以支撑细粒度跨模态对齐;其二,数据集构建过程需克服多源数据清洗、音频-视觉对齐的精确检测、合成图像的真实性筛选等工程障碍,例如通过VLM交叉验证与声源分离技术保障数据质量,同时需平衡数据规模与标注精度,确保多源混合音频场景下的训练有效性。
常用场景
经典使用场景
A2I-Set作为首个大规模、高质量的音-图-文三模态对齐数据集,在跨模态生成研究领域开辟了崭新的研究路径。其核心应用场景聚焦于音频引导的图像生成任务,研究者可借助该数据集对预训练的文本到图像扩散模型进行微调,从而赋予模型从声音信号直接合成可视化场景的能力。该数据集包含323K精细配对样本,覆盖241个层次化音频类别,不仅支持单一音源的场景重建,亦能处理多音源混合的复杂声学环境,为生成具有表现力且忠实于音频内容的图像提供了坚实的数据基础。
解决学术问题
该数据集直面音频到图像生成领域长期存在的两大核心瓶颈:视觉质量不足与跨模态对齐薄弱。传统数据集或缺失高保真图像,或难以确保音频与画面内容在语义层面上的精确对应,致使既有方法在微调强文本到图像模型时性能受限。A2I-Set通过严谨的多阶段构建管道,融合真实帧提取与合成图像生成技术,并引入对象级音频分离与视觉定位校验,有效解决了音频与图像间细粒度对齐的难题,为学术研究提供了可靠的训练与评估基准,显著推动了音频引导图像生成任务的发展。
实际应用
在现实应用层面,A2I-Set展现出了广泛的适用潜力。它可以赋能智能内容创作工具,例如根据现场录制的环境音自动生成配图,辅助音乐制作人快速实现视觉化概念设计,或为听觉障碍人群提供实时的场景图像描述。此外,该数据集还可用于开发沉浸式多媒体交互系统,在虚拟现实或增强现实环境中,依据用户的语音指令或环境声实时生成匹配的虚拟场景,提升用户体验。其平衡子集A2I-balanced亦为资源受限的工业应用提供了便捷的微调数据来源。
数据集最近研究
最新研究方向
A2I-Set数据集的提出,标志着音频到图像生成领域迈向高质量跨模态对齐的新阶段。该研究聚焦于构建大规模、精细化的音频-图像-文本三模态数据集,通过多阶段流水线整合真实图像提取与合成图像生成,并借助先进视觉语言模型进行严格筛选,确保数据的高保真与语义一致性。其前沿方向在于利用合成数据增强模型的美学表现力与泛化能力,同时通过对象级音频分离与视觉定位技术实现细粒度的跨模态对齐。这一创新不仅突破了传统数据集在质量与对齐上的局限,更推动了音频驱动图像生成从单一类别向多源、复杂场景的演进,为构建更具表达力与忠实度的生成模型奠定了坚实基础,对多媒体内容创作与智能交互领域具有深远影响。
相关研究论文
  • 1
    Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework中国科学技术大学; 中国电信人工智能研究院; 西北工业大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务