遇见数据集

古风女声歌曲戏腔程度标注训练数据

收藏
浙江省数据知识产权登记平台2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

本数据集聚焦古风女声歌曲的戏腔程度建模,服务于古风虚拟歌手、国风音乐AI创作、武侠/仙侠题材影视配乐、戏曲元素电子音乐制作等对传统唱腔有特殊需求的AI任务。古风歌曲常借鉴京剧、昆曲等戏曲的“依字行腔”“真假声转换”“尾音拖腔”等演唱技巧,其戏腔程度直接影响作品的古典韵味和辨识度。现有歌声合成模型缺乏对戏腔这一技巧性维度的量化标注,导致生成的古风歌曲往往“有古词无古韵”。本数据在专业录音棚采集女歌手演唱的古风歌曲片段,每段音频附人工转写的歌词,并独创性地标注了戏腔程度(无/少量/明显),同时记录转音位置、拖腔时长等声学特征。该数据集可用于训练能够精准控制戏腔程度的AI歌手,适用于古风虚拟偶像养成、国风游戏主题曲生成、以及传统戏曲数字化保护与创新等垂直领域。 独立性与必要性 目前公开歌声数据集普遍缺乏针对戏腔这一中国传统演唱技巧的标注,本数据集填补了这一空白,具有独立存在价值,是推动古风音乐AI化、传统戏曲创新传承的重要基础资源。一、数据采集与预处理 原始数据来源于杭州万像循声科技有限公司在专业录音棚内录制的古风女声歌曲片段,均为WAV格式,采样率48kHz。演唱者,风格为古风,涵盖仙侠、武侠、宫闱等主题。预处理阶段,使用音频处理工具批量读取时长,统一命名,进行音量归一化、静音段切除等标准化处理。 二、特征标注 由专业音乐标注人员对每段音频进行精细化人工标注,针对古风女声特点设计差异化标注方案: 歌词转写:逐字转写为标准汉字歌词; 戏腔程度标注:根据真假声转换频率、尾音拖腔长度、戏曲咬字特征(尖团音、上口字),将戏腔程度分为无、少量、明显三级。 无:完全流行唱法,无戏曲技巧; 少量:个别字句采用戏腔处理,整体仍以流行唱法为主; 明显:大面积戏曲唱腔,真假声切换频繁,拖腔明显,咬字戏曲化。 该标注用于训练模型在不同戏腔程度下的歌声合成参数(真假声比例、拖腔时长、共振峰调整)预测; 曲风标注:统一标注“古风”; 演唱者属性:标注演唱者标识及性别(女)。 三、数据结构化与打包 将技术参数与标注结果汇总为结构化表格文件,字段包括:歌曲文件名、时长(秒)、采样率(kHz)、曲风、录制场景、演唱者、性别、类型、来源与授权、文本、戏腔程度。 四、数据应用说明 本数据集可直接用于训练古风女声风格的戏腔可控歌声合成模型、古风虚拟偶像声音定制系统等AI任务。

创建时间:
2026-06-26
搜集汇总
数据集介绍
古风女声歌曲戏腔程度标注训练数据 数据集图片
背景与挑战
背景概述
本数据集包含专业录音棚录制的古风女声歌曲片段,采样率48kHz,格式为WAV,规模167.54MB。数据独创性地对戏腔程度进行三级标注(无/少量/明显),并附加歌词转写、转音位置、拖腔时长等声学特征,旨在为古风虚拟歌手、AI音乐创作、影视配乐等场景提供可控戏腔的歌声合成训练数据,弥补现有歌声合成模型在戏腔量化标注方面的空白。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务