255doesnotexist/GreendamOpencpop
收藏官方服务:
资源简介:
Opencpop是一个高质量的中文流行歌曲语料库,专为歌唱声音合成(SVS)系统设计。该数据集包含100首独特的中文歌曲,由一位专业女歌手在专业录音室环境中以44,100 Hz的采样率录制。所有歌唱录音都已进行了音素注释,包括话语/音符/音素边界和音高类型。数据集共包含3,756个话语,总时长约5.2小时。测试集由5首随机选择的歌曲组成,并提供了基线合成结果。
Opencpop是一个高质量的中文流行歌曲语料库,专为歌唱声音合成(SVS)系统设计。该数据集包含100首独特的中文歌曲,由一位专业女歌手在专业录音室环境中以44,100 Hz的采样率录制。所有歌唱录音都已进行了音素注释,包括话语/音符/音素边界和音高类型。数据集共包含3,756个话语,总时长约5.2小时。测试集由5首随机选择的歌曲组成,并提供了基线合成结果。
提供机构:
255doesnotexist原始信息汇总
数据集概述
数据集名称
- Opencpop
数据集描述
- Opencpop 是一个公开的高质量普通话歌唱语料库,专为歌唱声音合成(SVS)系统设计。该语料库包含100首独特的普通话歌曲,由一位专业女歌手录制。所有音频文件均以44,100 Hz的采样率在专业录音室环境中录制。
数据集内容
- 所有歌唱录音均已进行语音学标注,包括话语/音符/音素边界和音高类型。
- 最终数据集包含3,756个话语,总时长约5.2小时。
- 测试集由5首随机选择的歌曲组成,并提供基线合成结果。
文件格式
- midis: MIDI文件。
- textgrids: 原始标签文件,可使用Praat或Python打开。
- wavs: 原始音频wav文件。
- segments:
- wavs: 话语级别的wav文件。
- transcriptions.txt: 话语级别标签。
- train.txt: 训练集标签。
- test.txt: 测试集标签。
标签格式
- 标签以|分隔,包括:
- 话语wav名称
- 文本
- 音素
- 音符
- 音符持续时间
- 音素持续时间
- 当前音符是否为连音,0表示否,1表示是。
许可证
- 该数据集可用于非商业目的,遵循CC BY-NC-ND 4.0许可证。
- 数据集版权归Opencpop团队所有。
- 如需商业使用,请通过电子邮件联系(zpcoftts@gmail.com)。
音节到音素映射表
- 提供了一个详细的音节到音素的映射表,用于语音合成中的音素转换。
搜集汇总
数据集介绍

构建方式
GreendamOpencpop数据集是基于公开的高质量中文流行歌曲语料库Opencpop构建的专门化数据集,旨在服务于歌声合成(SVS)系统。原始Opencpop语料库包含100首独特的中文歌曲,由一位专业女歌手在专业录音室环境下以44,100 Hz采样率录制,总时长约5.2小时,涵盖3,756个语音片段。该数据集在构建过程中,对每段歌唱录音进行了精细的音素标注,包括发音边界、音符边界及音高类型,并提供了拼音到音素的映射表。此外,数据集的目录结构清晰,包含midi文件、TextGrid标注文件、原始音频wav文件以及按话语切分的音频和标注文件,训练集和测试集标签分别存储于train.txt和test.txt中。
特点
该数据集最显著的特点在于其高质量的标注信息与专业录音环境保障。每段音频均附带详细的音素、音符、音符时长、音素时长及连音标记,标签格式以竖线分隔,便于解析。数据集仅面向已获得Opencpop原始访问权限的用户开放,确保了使用的合规性。此外,GreendamOpencpop继承了Opencpop的CC BY-NC-ND 4.0非商业许可协议,同时提供商业使用联系渠道,体现了开放与合规并重的特性。数据集的歌曲多样性高,涵盖100首流行歌曲,且由专业歌手演绎,确保了训练数据的声学稳定性和表现力。
使用方法
使用GreendamOpencpop数据集时,用户需首先确保已获得Opencpop原始数据集访问权限。数据集可直接用于训练歌声合成模型,通过读取segments目录下的wavs和对应标注文件,结合拼音到音素的映射表,构建声学特征与文本标签的配对。训练时,可依据train.txt和test.txt划分训练集与测试集,利用midi文件辅助音符对齐。用户也可借助Praat等工具查看TextGrid标注,或通过Python解析标签文件。建议在非商业研究场景下遵循CC BY-NC-ND 4.0协议,商业用途需联系版权方获取授权。
背景与挑战
背景概述
Opencpop是由西北工业大学与腾讯AI Lab等机构于2022年联合发布的高质量中文流行歌曲语料库,专为歌声合成(SVS)系统设计。该数据集由一位专业女歌手录制100首中文歌曲而成,采样率为44.1kHz,包含约5.2小时的录音数据,并提供了详细的音素、音符、音高标注信息。作为首个开源的中文流行歌声合成数据集,opencpop填补了该领域高质量标注数据的空白,为歌声合成技术的研究提供了标准化的训练与测试基准,推动了SVS系统在中文场景下的发展。
当前挑战
歌声合成领域面临的核心挑战在于如何精准建模人声的复杂声学特征,包括音高、音长、颤音及情感表达等细微变化,而opencpop通过精细的音素与音符对齐标注为模型训练提供了基础。然而,数据集构建过程中面临多重困难:需协调专业歌手录制百首风格多样的歌曲,确保录音环境的高保真度;手工标注音素边界与音符时长需耗费大量人力与时间,且需保证标注一致性;此外,数据集的非商业许可限制了其广泛应用,而衍生版本如GreendamOpencpop更要求用户具备原始数据访问权限,进一步增加了获取门槛。
常用场景
经典使用场景
Opencpop作为首个公开的高质量中文流行歌曲演唱语料库,其最经典的使用场景在于支撑基于深度学习的歌声合成(Singing Voice Synthesis, SVS)系统的研发与评测。该数据集由专业女声录制100首中文流行歌曲,涵盖约5.2小时的精细标注音频,包括音素边界、音符时长、音高类型及连音标记等关键信息,为端到端歌声合成模型提供了标准化的训练与测试基准。研究人员常以此数据集为基石,探索从文本或乐谱到自然歌声的映射关系,尤其在中文声学特征建模与韵律控制领域,Opencpop已成为不可或缺的参考语料。
衍生相关工作
Opencpop的发布催生了一系列具有影响力的学术工作。在模型架构方面,研究者基于该数据集提出了诸如FastSVC、DiffSinger等高效合成框架,将扩散模型与歌声生成相结合,提升了音质与训练效率。在声学建模上,衍生工作探索了音素级与帧级对齐的联合优化策略,以及基于预训练语言模型的歌词-旋律对齐方法。此外,该数据集还被用于歌声质量评估基准的构建,为客观评价指标的制定提供了标准化测试平台,促进了歌声合成领域的可重复性研究。
数据集最近研究
最新研究方向
在歌声合成(SVS)领域,高质量、精细标注的中文歌唱语料库始终是推动技术突破的核心瓶颈。Opencpop作为首个公开可用的专业级中文流行歌曲语料库,凭借其100首独唱歌曲、5.2小时录音时长及逐音符/音素级别的标注粒度,已成为当前中文歌声合成研究的关键基准。前沿研究方向聚焦于利用该语料库训练端到端歌声合成模型,以弥合自然语言与音乐表达之间的鸿沟,探索音高轮廓、音符时长与音素对齐的联合建模策略。同时,随着AIGC音乐创作热潮的兴起,该数据集被广泛用于开发可控性更强的歌声合成系统,例如实现从文本到带有情感色彩的演唱的跨模态生成。其精细的标注体系还为研究连音(slur)、颤音等演唱技巧的数字化表达提供了宝贵资源,对推动中文语音合成技术向更自然、更具表现力的音乐人工智能方向演进具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成



