ConceptCaps
收藏资源简介:
ConceptCaps是一个基于概念的音乐字幕数据集,源自MusicCaps,专为文本到音频(TTA)生成系统的可解释性研究设计。该数据集提供了结构化的音乐概念注释和自然语言字幕,支持对TTA模型如何表示和生成音乐概念进行细粒度分析。
ConceptCaps is a concept-based music captioning dataset derived from MusicCaps, specifically designed for interpretability research on Text-to-Audio (TTA) generation systems. This dataset provides structured musical concept annotations and natural language captions, enabling fine-grained analysis of how TTA models represent and generate musical concepts.
ConceptCaps 数据集概述
数据集简介
ConceptCaps 是一个源自 MusicCaps 的音乐描述数据集,专为文本到音频(TTA)生成系统中的基于概念的可解释性研究而设计。该数据集提供了来自蒸馏分类法(200个独特标签)的分类音乐概念注释以及自然语言描述,支持对 TTA 模型如何表示和生成音乐概念进行细粒度分析。
核心目标
解决现有音乐数据集缺乏清晰、分离的正负概念示例结构的问题,以满足如 TCAV 等基于概念的可解释性方法的需求。
关键特征
- 数据规模:包含 21,000 个音乐-描述-音频三元组,带有来自 200 个属性分类法的显式标签。
- 音频内容:提供 178 小时的音频内容,并与文本描述配对。
- 概念类别:涵盖四种概念类别:流派、情绪、乐器、节奏。
- 方法特点:将语义建模与文本生成分离——VAE 学习属性共现模式,LLM 生成描述。
- 验证指标:通过 CLAP 对齐、BERTScore、MAUVE 和 TCAV 分析等多种指标进行验证。
生成流程
- 使用**变分自编码器(VAE)**学习合理的属性共现模式。
- 微调大语言模型(LLM),将属性列表转换为专业描述。
- 使用MusicGen合成音频。
数据集获取与使用
- 访问地址:https://huggingface.co/datasets/bsienkiewicz/ConceptCaps
- 快速加载:
python
from datasets import load_dataset
仅加载描述
dataset = load_dataset("bsienkiewicz/ConceptCaps", "default")加载包含音频的数据
dataset = load_dataset("bsienkiewicz/ConceptCaps", "audio")
项目结构
项目目录包含配置、数据、文档、模型、笔记本、脚本和源代码模块,结构清晰,便于复现与研究。
分析笔记本
项目包含一系列 Jupyter 笔记本,演示了生成流程的每个阶段,涵盖从分类法创建、VAE 建模、数据集质量分析、描述生成、音频合成到最终数据集准备和 TCAV 可解释性分析的完整流程。
许可信息
本项目采用 CC-BY-4.0 许可协议。
引用
如果使用 ConceptCaps,请引用: bibtex @article{sienkiewicz2026conceptcaps, title={ConceptCaps -- a Distilled Concept Dataset for Interpretability in Music Models}, author={Sienkiewicz, Bruno and Neumann, Łukasz and Modrzejewski, Mateusz}, journal={arXiv preprint arXiv:2601.14157}, year={2026} }
作者
- Bruno Sienkiewicz
- Łukasz Neumann
- Mateusz Modrzejewski




