Auto-ACD音频-语言表示学习数据集
收藏国家基础学科公共科学数据中心2026-06-03 收录
官方服务:
资源简介:
Auto-ACD数据集主要面向音频-语言表征学习及多模态模型训练的研究需求建设,旨在解决现有数据集规模小、描述简单及人工标注成本高的问题。该数据集基于开源的AudioSet和VGGSound音视频数据产生,采用创新的自动化流水线,利用多种预训练视觉与音频模型提取多模态线索,并借助大语言模型进行推理整合生成。其主要内容记录了音频片段及对应的高质量长文本描述,详细涵盖了发声物体、声学属性及声音发生的具体环境场景等丰富信息。该数据集体量庞大,共包含150万个音频-文本对,文本平均长度18个单词,是目前首个包含丰富环境信息的大规模百万级音频-语言数据集。
提供机构:
上海交通大学


