遇见数据集

Auto-ACD音频-语言表示学习数据集

收藏
官方服务:

资源简介:

Auto-ACD数据集主要面向音频-语言表征学习及多模态模型训练的研究需求建设,旨在解决现有数据集规模小、描述简单及人工标注成本高的问题。该数据集基于开源的AudioSet和VGGSound音视频数据产生,采用创新的自动化流水线,利用多种预训练视觉与音频模型提取多模态线索,并借助大语言模型进行推理整合生成。其主要内容记录了音频片段及对应的高质量长文本描述,详细涵盖了发声物体、声学属性及声音发生的具体环境场景等丰富信息。该数据集体量庞大,共包含150万个音频-文本对,文本平均长度18个单词,是目前首个包含丰富环境信息的大规模百万级音频-语言数据集。

提供机构:
上海交通大学
二维码
社区交流群
二维码
科研交流群
商业服务