A2I-Set
收藏资源简介:
A2I-Set是一个统一的高质量三模态数据集,由音频、图像及精细文本描述构成,涵盖323K条数据,涉及241个典型音频类别,包括音乐、自然声音和语音。数据集通过多阶段流水线构建,包括视觉增强音频描述、真实图像提取与合成图像生成,并经过严格的CLAP过滤和人类专家校验,确保高保真图像与精确的跨模态对齐。该数据集旨在解决现有音频-图像数据集缺乏高质量图像和细粒度对齐的问题,为音频到图像生成等跨模态研究提供坚实基础,推动模型在表达力和忠实度上的突破。
A2I-Set is a unified high-quality tri-modal dataset composed of audio, images, and fine-grained textual descriptions. It contains 323K data instances spanning 241 representative audio categories including music, natural sounds, and speech. The dataset is constructed via a multi-stage pipeline, which encompasses vision-enhanced audio description, real image extraction and synthetic image generation. It has undergone stringent CLAP-based filtering and human expert validation to ensure high-fidelity images and precise cross-modal alignment. This dataset addresses the critical gap in existing audio-image datasets that lack high-quality images and fine-grained alignment, providing a robust foundation for cross-modal research such as audio-to-image generation and advancing breakthroughs in model expressiveness and faithfulness.
A2I-Set 数据集概述
基本信息
- 数据集名称:A2I-Set
- 论文标题:Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework
- 发布时间:2026年4月29日
- 论文状态:已被 ACM International Conference on Multimedia (ACMMM 2026) 接收
- 许可协议:MIT License
- 作者单位:中国科学技术大学、Tele AI、西北工业大学
数据集规模
- 总音频数:260,060 条(包含241个层级标签和文本描述)
- 合成图像:193,653 张
- 真实图像:129,793 张
- 评估音频:3,280 条(人工标注的混合来源测试集)
数据集结构
数据集包含以下主要目录:
A2I_audio:音频文件(.wav/.flac格式)A2I_real:真实图像文件(.png格式)A2I_syn:合成图像文件(.png格式,从视频帧中提取)eval_audio_all:评估用音频,文件名中带有类别标签(以|分隔)caption.json:包含所有音频的文本描述文件
数据特点
- 三模态对齐:音频、图像、详细文本描述三者配对,专门为音频视觉研究设计
- 层级标签体系:音频带有241个层级类别标签
- 文本描述结构:每条caption包含三个字段:
[Main Subject]:主要主体描述[Visual Generation Instruction]:视觉生成指令[Top Level]:音频的顶级类别
研究方法(AudioCanvas模型)
- 预对齐阶段:单独训练Audio Projector(10个epoch)
- 风格学习阶段:在数据集的合成图像部分微调Stable Diffusion 1.4(25个epoch)
- 全量微调阶段:在完整数据集上训练100个epoch
- 基础模型:SD1.4(Stable Diffusion 1.4)
- 音频编码器:CLAP(clap-htsat-unfused)
评估指标
使用的评估指标包括FID和HPSv3,评估数据集包括:
- A2I-Eval:作者构建的人工监督混合来源测试集
- Landscape:额外下载的风景评估数据集
下载地址
- 数据集:https://huggingface.co/datasets/gdx123/A2I_Set
- 论文:http://arxiv.org/abs/2608.09529
- FID权重:https://openaipublic.blob.core.windows.net/diffusion/jul-2021/ref_batches/imagenet/256/VIRTUAL_imagenet256_labeled.npz
- HPSv3权重:https://huggingface.co/MizzenAI/HPSv3
技术环境
- 操作系统:Ubuntu 22.04
- 硬件要求:8 × NVIDIA H100 80GB GPUs
- Python版本:3.12.12
- 框架:PyTorch,使用accelerate进行分布式训练
致谢项目
该工作参考并整合了以下开源项目:
- MACS
- AudioToken(https://github.com/guyyariv/AudioToken)
- FusionAudio-1.2M(https://github.com/FreedomIntelligence/FusionAudio)
- AudioSet(https://research.google.com/audioset/)
- VGGSound(https://github.com/hche11/VGGSound)
- 1Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework中国科学技术大学; 中国电信人工智能研究院; 西北工业大学 · 2026年



