遇见数据集

universeset

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

UniVerseSet 是 UniVerse(同谣)项目的训练语料库,专门用于世界民间音乐领域的大型音频-语言模型后训练。数据集包含自动语音识别(ASR)转录文本、音频描述、基于音频的多轮对话以及自动生成的 ABC 乐谱。数据来自 YouTube 上的民间音乐录音,涵盖中文、韩语、英语等多语言。数据集规模约为 174k 个音频 ID,对应约 173k 份歌词文件、152k 份描述文件、115k 份对话文件以及 174k 份 ABC 乐谱文件。对话采用 JSON 格式,包含用户与助手的多轮交互,并支持音频引用。该数据集旨在训练模型真正聆听民间音乐,而非依赖语言先验知识进行回答,适用于后训练大型音频-语言模型,提升其在低资源、文化包容性音乐理解任务上的表现。数据集仅限学术研究使用,许可证为 CC BY-NC 4.0。

UniVerseSet is a training corpus for the UniVerse project, specifically designed for post-training large audio-language models in the domain of world folk music. The dataset includes automatic speech recognition (ASR) transcriptions, audio descriptions, audio-based multi-turn dialogues, and automatically generated ABC notation scores. The data comes from folk music recordings on YouTube, covering multiple languages such as Chinese, Korean, and English. The dataset comprises approximately 174k audio IDs, corresponding to about 173k lyric files, 152k description files, 115k dialogue files, and 174k ABC notation files. Dialogues are in JSON format, containing multi-turn interactions between users and assistants, with support for audio references. The dataset aims to train models to truly listen to folk music rather than relying on linguistic priors, suitable for post-training large audio-language models to improve their performance on low-resource, culturally inclusive music understanding tasks. The dataset is for academic research only, licensed under CC BY-NC 4.0.

创建时间:
2026-08-17
原始信息汇总

UniVerseSet 数据集概述

基本信息

  • 数据集名称:UniVerseSet(同谣)
  • 语言:中文、韩语、英语及多语言
  • 许可证:CC BY-NC 4.0(仅限学术研究,禁止商业使用)
  • 数据规模:100K < n < 1M
  • 任务类型:音频文本到文本、自动语音识别、文本生成

数据集内容

UniVerseSet是UniVerse(同谣)项目的训练集,专注于世界民间音乐的大型音频-语言模型后训练语料,包含以下核心组件:

文件 内容说明 规模
lyrics.tar.gz 由Qwen3-ASR转写的歌词文本 约173k文件
captions.tar.gz 由Qwen3-Omni-Captioner生成的音频描述 约152k文件
dialogues.tar.gz 由Qwen3-Next-80B-A3B-Instruct生成的多轮音频对话 约115k文件
audio_ids.txt 音频ID列表(YouTube ID) 约174k行
abc.tar.gz SheetSage ABC乐谱转写 约174k个.abc文件

数据用途

  • 用于大型音频-语言模型的后训练,使模型能够“聆听”民间音乐录音而非仅依赖语言先验知识
  • 默认SFT思考集约113k示例(过滤后)
  • 支持语言加权交叉熵、文本DPO和多模态音频对比DPO等训练方法

对话格式

对话数据包含多轮用户-助手消息,其中用户消息包含音频占位符,助手回复包含思考过程和正式回答;音频文件通过audio_ids.txt索引,ABC乐谱按YouTube ID命名。

获取与评估

  • 通过Hugging Face snapshot_download 下载并解压
  • 评估数据集使用姊妹数据集 UniVerseBench(位于 universe-team/universebench
  • 实况博物馆演示可访问 http://143.89.224.8:8790/

版权与引用

  • 底层民间录音和YouTube来源音频保留原始版权,不授予重新分发或商业利用权利
  • 数据集整体仅限非商业学术研究用途
  • 引用时需注明论文信息(arXiv预印本,待发布)
搜集汇总
数据集介绍
universeset 数据集图片
构建方式
UniVerseSet是UniVerse(同谣)项目的训练语料库,专为大型音频-语言模型(LALMs)在民间音乐领域的后续训练而设计。该数据集通过多种自动化流程构建,包括使用Qwen3-ASR进行歌词转写(约173k个文件)、利用Qwen3-Omni-Captioner生成音频描述(约152k个文件),以及借助Qwen3-Next-80B-A3B-Instruct生成多轮音频-文本对话(约115k个文件)。此外,还包含通过改良的SheetSage系统自动生成的ABC乐谱转写(约174k个文件),并提供了对应的音频ID索引文件。所有数据均以压缩包形式存储,用户需下载后自行解压使用。
使用方法
使用UniVerseSet需通过Hugging Face的snapshot_download下载压缩包,解压后获取歌词、描述、对话、音频ID及ABC乐谱等文件。对话采用OpenAI格式的messages结构,音频通过audios字段关联,便于直接用于微调。该数据集主要面向LALMs的后训练,支持构建音频-文本到文本的生成任务,也可用于自动语音识别和文本生成。评估时建议配合姊妹基准数据集UniVerseBench使用,该基准包含材料与问答两个子集,以全面衡量模型在跨文化低资源音乐理解上的性能。
背景与挑战
背景概述
UniVerseSet,亦名“同谣”,是由universe-team研究团队于2026年发布的一个面向世界民间音乐的大型音频-语言多模态数据集。该数据集旨在解决大型音频-语言模型(LALMs)在低资源文化语境下音乐理解能力不足的问题,其核心研究问题聚焦于如何使模型能够真正“聆听”民间音乐,而非依赖语言先验进行应答。作为UniVerse项目的一部分,UniVerseSet提供了约17.4万个音频样本的歌词、描述、多轮对话及ABC乐谱等丰富标注,为模型的后期训练提供了坚实基础。其姊妹基准UniVerseBench则用于评估模型性能,共同推动了跨文化音乐理解领域的研究进展,对多模态学习与计算音乐学具有重要的学术影响力。
当前挑战
当前挑战主要体现在两个方面。首先,在领域问题层面,民间音乐因其文化多样性、语言复杂性及低资源特性,给音频-语言模型的语音识别、内容描述及跨模态对话带来了显著困难,模型需在有限标注下学习文化包容性的音乐理解。其次,在数据构建过程中,UniVerseSet面临了多重技术难题:从YouTube等来源获取音频需处理版权与平台合规问题;自动生成的歌词、对话及ABC乐谱需经过严格的过滤与质量控制,以确保数据的准确性和一致性;此外,语言分布的不均衡性要求设计精细的采样与权重调整策略,以平衡不同语言和文化背景下的模型性能。这些挑战促使团队开发了语言加权交叉熵、文本DPO及音频DPO等创新训练方法。
常用场景
经典使用场景
UniVerseSet作为全球民间音乐领域的大规模音频-语言多模态语料库,其经典使用场景聚焦于大型音频-语言模型(LALMs)的后训练阶段。该数据集精心整合了约17.4万条音频剪辑,并配套自动生成的歌词、描述性字幕、多轮音频-文本对话以及ABC乐谱转录,为模型提供了丰富的、贴近真实民间音乐聆听体验的监督信号。研究者依托此数据集,能够系统性地微调模型,使其超越单纯依赖语言先验的应答模式,真正学会从音频信号中提取文化意蕴与音乐细节,从而显著提升模型在低资源、文化包容性强的音乐理解任务上的泛化能力与鲁棒性。
解决学术问题
该数据集直面当前大型音频-语言模型在非西方、低资源音乐理解领域表现欠佳的学术挑战,有效缓解了现有模型对英语及主流音乐形式的过度拟合问题。通过提供大规模、多语言(中文、韩语、英语等)的民间音乐配对数据,UniVerseSet为构建文化包容性的音乐理解基准奠定了数据基石,解决了以往研究因缺乏高质量训练语料而难以评估和增强模型跨文化音乐感知能力的困境,推动了多模态学习与计算民族音乐学交叉领域的实证研究。
实际应用
在实际应用层面,UniVerseSet所驱动的模型可广泛服务于民族音乐档案馆的数字化整理与智能检索,为音乐教育平台提供互动式、多轮对话的民歌学习助手,并支撑文化传播类应用中的自动歌词转录与音乐内容描述生成。其衍生的音频-文本对话能力还可赋能无障碍辅助技术,为听障人群或音乐爱好者提供基于语音的音乐解释与背景知识问答,展现了从学术研究到文化科技产品的显著转化潜力。
数据集最近研究
最新研究方向
UniVerseSet数据集聚焦于世界民族音乐领域的大型音频-语言模型后训练研究,通过整合自动语音识别转录、图像描述、多轮音频对话及ABC乐谱自动转写等多模态资源,推动模型在低资源音乐理解上的文化包容性提升。其前沿研究方向包括语言加权SFT、文本DPO和跨模态音频对比DPO等训练策略,旨在强化模型从音频内容而非语言先验中获取信息的能力。该数据集与UniVerseBench配套使用,为评估模型在真实民族音乐场景下的表现提供了基准,对促进多元文化音乐的数字保存与智能交互具有重要学术意义和应用前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务