遇见数据集

SynthGT

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

SynthGT(合成真实标注)是一个合成的英语独唱数据集,包含4,900个歌唱表演,并附有自动生成的音素边界注释。该数据集通过乐谱生成和歌声合成流程创建,主要用于歌唱导向的强制对齐研究。此外,它还提供丰富的标注信息,支持多种歌声和音乐信息检索(MIR)任务,包括歌词、音素序列、音素边界、和弦进行、MIDI乐谱、音符级时间信息以及来自歌声合成管道的中间表示。数据集包含3位合成歌手,音频为44.1kHz采样的WAV格式,MIDI为标准MIDI格式,元数据为JSONL格式。数据集的生成管道包括:使用OpenAI GPT模型生成歌词与和弦,使用Microsoft Muzic TeleMelody生成MIDI声乐旋律,使用三个基于DiffSinger的歌手模型预测声学特征,最后通过OpenVPI PC-NSF-HiFiGAN进行声码合成。数据集目录结构包含waveforms、midi、metadata和splits文件夹,其中splits文件夹提供了预定义的训练、验证和测试划分,每个划分包含每位歌手的CSV文件,记录唯一标识符、音素序列及每个音素的持续时间。该数据集采用CC BY-NC-SA 4.0许可协议。

SynthGT (Synthetic Ground Truth) is a synthetic English solo singing dataset containing 4,900 singing performances with automatically generated phoneme boundary annotations. It is created through a music score generation and singing synthesis pipeline, primarily designed for singing-oriented forced alignment research. Additionally, it provides rich annotations supporting various singing and music information retrieval (MIR) tasks, including lyrics, phoneme sequences, phoneme boundaries, chord progressions, MIDI scores, note-level temporal information, and intermediate representations from the singing synthesis pipeline. The dataset features three synthetic singers, with audio in 44.1kHz WAV format, MIDI in standard MIDI format, and metadata in JSONL format. The generation pipeline involves: using OpenAI GPT models to generate lyrics and chords, Microsoft Muzic TeleMelody for MIDI vocal melody, three DiffSinger-based singer models for acoustic feature prediction, and OpenVPI PC-NSF-HiFiGAN for vocoding. The dataset directory structure includes waveforms, midi, metadata, and splits folders. The splits folder provides predefined train/validation/test splits, with each split containing CSV files per singer recording unique identifiers, phoneme sequences, and phoneme durations. The dataset is licensed under CC BY-NC-SA 4.0.

创建时间:
2026-07-23
原始信息汇总

数据集概述

SynthGT(Synthetic Ground Truth)是一个合成的英文独唱数据集,包含 4,900 个歌唱表演,并配有自动生成的音素边界标注。该数据集通过乐谱生成和歌声合成流程创建,主要面向歌唱导向的强制对齐研究,同时提供丰富的标注以支持多种歌声和音乐信息检索(MIR)任务。

基本信息

  • 许可证:CC BY-NC-SA 4.0(知识共享署名-非商业性使用-相同方式共享 4.0 国际)
  • 任务类别:自动语音识别
  • 语言:英语
  • 规模:1K < n < 10K
  • 标签:歌唱、歌声合成、强制对齐、语音、音频、MIDI、音素对齐、歌词、歌词对齐、合成
  • 音频格式:WAV,采样率 44.1 kHz
  • MIDI 格式:标准 MIDI
  • 元数据格式:JSONL

规模统计

  • 乐谱和歌唱表演:4,900 个
  • 歌手数量:3 位
  • 语言:英语

应用场景

主要应用

  • 歌唱导向的强制对齐
  • 歌声合成

次要应用

  • 自动歌词转写
  • 自动音乐转写
  • 乐谱到音频的对齐

生成流程

数据集通过以下流水线生成:

  1. 歌词生成:使用 OpenAI GPT-5 mini
  2. 和弦进行生成:使用 OpenAI GPT-5.1
  3. MIDI 人声旋律生成:使用 Microsoft Muzic TeleMelody
  4. 声学特征预测:由三个基于 DiffSinger(OpenVPI 维护)的歌手模型完成(Dominiq Oblivion V1.2、NGYY CHN&JPN&ENG&IND V2.0、戯白メリー DiffSinger V2.0)
  5. 声码化:使用 OpenVPI PC-NSF-HiFiGAN

注意:生成过程中因处理失败丢弃了 100 个样本 ID,数据集规模从 5,000 个表演缩减至 4,900 个。少量元数据和 MIDI 文件没有对应的合成波形。预训练合成模型不包含在仓库中,仅共享生成的输出。

目录结构

SynthGT/ ├── metadata/ ├── midi/ ├── splits/ │ ├── train │ ├── valid │ └── test ├── waveforms ├── LICENSE └── README.md

每个波形、MIDI 文件和元数据条目共享唯一的样本标识符。

各目录说明

  • waveforms:包含所有合成的歌唱 .wav 文件
  • midi:包含波形中演奏的所有 MIDI 旋律
  • metadata
    • GPT_request_chords.jsonlGPT_request_lyrics.jsonl:发送给 GPT 模型的和弦/歌词生成提示词
    • GPT_response_chords.jsonlGPT_response_lyrics.jsonl:GPT 模型的生成输出
    • chords.jsonllyrics.jsonl:从 GPT 响应中提取的和弦和歌词
    • syllable.json:音节化/音素化的歌词
    • rhythm_patterns.jsonl:TeleMelody 中歌词到模板模型生成的节奏模式
    • waveforms_metadata:歌声合成流水线的输入输出,以及乐谱的细粒度表示,包括音符时长、音素时长、音素到音符分布、音高曲线、方差特征及帧级合成参数
  • splits:包含论文中使用的预定义训练、验证和测试划分。每个划分中为三位歌手各提供一个 .csv 文件,包含样本 ID、音素序列和每个音素的时长

引用信息

若使用 SynthGT 或相关资源,请引用:

@unpublished{Antonisen2026SynthGT, author = {Silas Antonisen and Iván López-Espejo}, title = {Synthesizing Ground Truth Phoneme Boundaries with SynthGT: A Synthetically Generated Solo-Singing Corpus}, note = {Submitted to IEEE Transactions on Audio, Speech and Language Processing}, year = {2026} }

二维码
社区交流群
二维码
科研交流群
商业服务