midi-svs
收藏官方服务:
资源简介:
midisvs 是一个精心标注的英文 Suno 人声+MIDI 数据集,包含 3000 多个经过筛选的曲目,并提供分轨、转录、歌词和结构元数据。该数据集主要用于歌声合成(SVS)音乐人工智能和音乐信息检索(MIR)研究。数据涵盖音频到音频和音频分类任务,采用 CC BY-NC-SA 4.0 许可证,样本数量在 1,000 到 10,000 之间。
midisvs is a carefully annotated English Suno vocal+MIDI dataset, containing over 3,000 filtered tracks, with multitrack, transcription, lyrics, and structural metadata. It is primarily used for singing voice synthesis (SVS) music AI and music information retrieval (MIR) research. The data covers audio-to-audio and audio classification tasks, licensed under CC BY-NC-SA 4.0, with sample sizes between 1,000 and 10,000.
创建时间:
2026-08-18
原始信息汇总
数据集概述:MIDI SVS
该数据集是一个**正在开发中(WIP)**的、带丰富标注的英文 Suno 人声与 MIDI 数据集,旨在服务于 SVS(歌唱语音合成)音乐 AI 和 MIR(音乐信息检索)研究。
基本信息
- 名称:midisvs
- 许可证:CC BY-NC-SA 4.0(仅限非商业用途)
- 任务类型:音频到音频(audio-to-audio)、音频分类(audio-classification)
- 语言:英语
- 标签:SVS、MIDI、music-ai、MIR
- 规模:约 3,000 至 10,000 条(1K<n<10K)
数据内容
- 包含 3,000+ 条精选曲目
- 每条曲目提供:
- 分轨音频(stems)
- 转录(transcriptions)
- 歌词(lyrics)
- 结构元数据(structural metadata)
数据来源与工具
该数据集基于以下公开资源构建:
- Suno Various 94k 数据集作为基础语料
- Facebook Demucs:用于音频分离
- ASLP-lab SongFormer:用于音频转录
- LinTO AI Whisper Timestamped:用于时间戳标注
- ROSVOT:用于相关处理
其他信息
- 由 Project Los Angeles 维护
- 发布年份标注为 2026(Tegridy Code)
搜集汇总
数据集介绍

构建方式
midi-svs数据集是一个精心构建的英文Suno人声与MIDI联合数据集,其构建流程融合了多源数据采集与先进的音频处理技术。该数据集基于Suno Various 94k这一大规模音频集合,通过Facebook Demucs进行高质量的源分离,提取出清晰的人声和伴奏轨道。随后,利用ASLP-lab SongFormer模型对音频进行自动转录,生成精确的MIDI序列,同时借助LinTO AI Whisper Timestamped工具进行带时间戳的歌词对齐,确保歌词与音乐的同步。此外,还引入了ROSVOT进行结构标注,最终形成了包含超过3000首经过策划的曲目,每个样本均附带分轨音频、转录结果、歌词及结构元数据,为音乐AI研究提供了丰富而全面的信息。
特点
该数据集的核心特点在于其丰富性和精细标注。每个样本不仅包含原始音频,还提供了分离后的声乐和伴奏分轨,这使得研究者能够独立处理或重组音频元素。MIDI转录和歌词时间戳的提供,使得音乐信息检索(MIR)任务得以深入进行,如和弦识别、旋律提取和歌词对齐。数据集的规模超过3000首精心挑选的曲目,覆盖了广泛的音乐风格,确保了数据多样性。其cc-by-nc-sa-4.0许可协议保护了创作者权益,同时促进了非商业性研究的开展。此外,数据集的构建整合了最先进的开源工具,确保了标注质量的高度一致性和准确性,为SVS(歌唱声音合成)和音乐AI领域提供了宝贵的训练与评估资源。
使用方法
使用midi-svs数据集时,研究者可直接通过HuggingFace平台加载数据,利用其task_categories中的audio-to-audio和audio-classification接口进行模型训练或评估。对于SVS任务,可将人声分轨与对应的MIDI和歌词输入生成模型,训练歌声合成系统。在MIR领域,可利用转录和结构元数据进行音乐结构分析、旋律提取或歌词识别等研究。数据集的分轨设计支持灵活的预处理流程,如数据增强或特征提取。建议研究者首先阅读README文档,了解具体的文件格式和标注规范,然后根据研究目标选择相应的数据子集。此外,由于数据集遵循cc-by-nc-sa-4.0许可,使用时应遵守许可证条款,并在发表成果中适当引用原始数据源和工具。
背景与挑战
背景概述
midi-svs数据集由Project Los Angeles与Tegridy Code于2026年创建,旨在推动歌声合成(SVS)与音乐信息检索(MIR)领域的发展。该数据集汇集了超过3000条经过精心策划的英文Suno人声与MIDI曲目,提供了包括分轨音频、转录、歌词及结构元数据在内的丰富标注,为音乐AI研究提供了高质量的语料资源。其构建依托于Suno Various 94k、Demucs、SongFormer等多个开源工具链,展现了跨机构协作的成果。该数据集的发布填补了兼具MIDI与歌声合成场景的公开数据集空白,有望促进歌声合成模型的鲁棒性提升与多模态音乐理解研究。
当前挑战
该数据集面临的挑战主要在于领域问题与构建过程两方面。领域层面,SVS与MIR研究长期受限于标注稀缺、曲目风格单一及音频与符号信息对齐困难,midi-svs虽提供了丰富标注,但如何利用其结构化信息提升歌声合成质量及跨模态检索性能仍是关键难题。构建层面,数据清洗需从大规模Suno曲库中筛选高质量样本,涉及去噪、源分离(Demucs)及歌词转录(Whisper)的精度与效率平衡;此外,版权合规(CC-BY-NC-SA-4.0)与跨工具链集成也增加了复杂性和潜在的误差累积,为后续版本迭代带来挑战。
常用场景
经典使用场景
midi-svs数据集在歌声合成(Singing Voice Synthesis, SVS)与音乐信息检索(Music Information Retrieval, MIR)领域扮演着基石角色。其丰富的标注信息,包括人声干声、MIDI序列、歌词及结构元数据,使其成为训练端到端歌声合成模型、音符级音高与节奏标注系统以及歌声与伴奏分离算法的理想数据源。研究者常利用此数据集进行多模态音乐理解研究,探索音频与符号表示之间的映射关系,从而推动歌声合成技术从实验室走向实用化。
衍生相关工作
围绕midi-svs数据集,学术界与工业界衍生出了一系列开创性工作。基于其注释,研究者提出了多任务学习框架,联合优化音高、音素和节奏预测,显著提升了合成歌声的表现力。针对数据集中的人声干声,有研究开发了高精度的自动标注工具链,实现了从歌曲到结构化乐谱的端到端转换,促进了符号音乐与音频音乐之间的互操作。此外,该数据集也催生了若干预训练模型,如源自ASLP-lab的SongFormer在歌声合成方面展现出卓越性能,而为该数据净化而发展的源分离技术亦为其他语音处理任务提供了新的解决思路。
数据集最近研究
最新研究方向
该数据集聚焦于歌唱语音合成(SVS)与音乐信息检索(MIR)的交叉前沿,以其丰富的英文标注和结构化元数据,为多模态音乐AI研究提供了高价值基准。当前研究趋势侧重于利用大规模、细粒度标注数据提升歌声合成的自然度和表现力,同时探索歌声与MIDI信号的联合建模,以增强音乐生成的交互性与可控性。该数据集的发布响应了音乐AI领域对高质量、可复现训练语料的迫切需求,尤其在生成式模型快速演进的背景下,其3k+策展曲目及分离音轨、逐字歌词和时间戳等精细注释,为跨模态对齐、歌词到歌声合成以及音乐结构分析等热点任务提供了坚实的数据支撑,有望推动SVS系统从实验室走向实际应用,并促进音乐创作与研究的数字化变革。
以上内容由遇见数据集搜集并总结生成



