universeset
收藏资源简介:
UniVerseSet 是 UniVerse(同谣)项目的训练语料库,专门用于世界民间音乐领域的大型音频-语言模型后训练。数据集包含自动语音识别(ASR)转录文本、音频描述、基于音频的多轮对话以及自动生成的 ABC 乐谱。数据来自 YouTube 上的民间音乐录音,涵盖中文、韩语、英语等多语言。数据集规模约为 174k 个音频 ID,对应约 173k 份歌词文件、152k 份描述文件、115k 份对话文件以及 174k 份 ABC 乐谱文件。对话采用 JSON 格式,包含用户与助手的多轮交互,并支持音频引用。该数据集旨在训练模型真正聆听民间音乐,而非依赖语言先验知识进行回答,适用于后训练大型音频-语言模型,提升其在低资源、文化包容性音乐理解任务上的表现。数据集仅限学术研究使用,许可证为 CC BY-NC 4.0。
UniVerseSet is a training corpus for the UniVerse project, specifically designed for post-training large audio-language models in the domain of world folk music. The dataset includes automatic speech recognition (ASR) transcriptions, audio descriptions, audio-based multi-turn dialogues, and automatically generated ABC notation scores. The data comes from folk music recordings on YouTube, covering multiple languages such as Chinese, Korean, and English. The dataset comprises approximately 174k audio IDs, corresponding to about 173k lyric files, 152k description files, 115k dialogue files, and 174k ABC notation files. Dialogues are in JSON format, containing multi-turn interactions between users and assistants, with support for audio references. The dataset aims to train models to truly listen to folk music rather than relying on linguistic priors, suitable for post-training large audio-language models to improve their performance on low-resource, culturally inclusive music understanding tasks. The dataset is for academic research only, licensed under CC BY-NC 4.0.
UniVerseSet 数据集概述
基本信息
- 数据集名称:UniVerseSet(同谣)
- 语言:中文、韩语、英语及多语言
- 许可证:CC BY-NC 4.0(仅限学术研究,禁止商业使用)
- 数据规模:100K < n < 1M
- 任务类型:音频文本到文本、自动语音识别、文本生成
数据集内容
UniVerseSet是UniVerse(同谣)项目的训练集,专注于世界民间音乐的大型音频-语言模型后训练语料,包含以下核心组件:
| 文件 | 内容说明 | 规模 |
|---|---|---|
lyrics.tar.gz |
由Qwen3-ASR转写的歌词文本 | 约173k文件 |
captions.tar.gz |
由Qwen3-Omni-Captioner生成的音频描述 | 约152k文件 |
dialogues.tar.gz |
由Qwen3-Next-80B-A3B-Instruct生成的多轮音频对话 | 约115k文件 |
audio_ids.txt |
音频ID列表(YouTube ID) | 约174k行 |
abc.tar.gz |
SheetSage ABC乐谱转写 | 约174k个.abc文件 |
数据用途
- 用于大型音频-语言模型的后训练,使模型能够“聆听”民间音乐录音而非仅依赖语言先验知识
- 默认SFT思考集约113k示例(过滤后)
- 支持语言加权交叉熵、文本DPO和多模态音频对比DPO等训练方法
对话格式
对话数据包含多轮用户-助手消息,其中用户消息包含音频占位符,助手回复包含思考过程和正式回答;音频文件通过audio_ids.txt索引,ABC乐谱按YouTube ID命名。
获取与评估
- 通过Hugging Face
snapshot_download下载并解压 - 评估数据集使用姊妹数据集 UniVerseBench(位于
universe-team/universebench) - 实况博物馆演示可访问 http://143.89.224.8:8790/
版权与引用
- 底层民间录音和YouTube来源音频保留原始版权,不授予重新分发或商业利用权利
- 数据集整体仅限非商业学术研究用途
- 引用时需注明论文信息(arXiv预印本,待发布)





