萝莉角色语音标注训练数据
收藏资源简介:
本数据集聚焦萝莉角色语音合成与二次元情感交互,服务于虚拟主播、动漫配音、有声小说童声角色、儿童陪伴型AI等场景。萝莉角色语音特征为音调偏高、语速偏快、语气活泼,且常带有稚嫩感与撒娇表达。通用语音模型难以精准复现萝莉的稚嫩音色与调皮语气。本数据在专业录音棚采集一位女性说话人模拟萝莉人设的自然对话,涵盖日常交流、学习吐槽、情感表达、撒娇卖萌等丰富场景,每段语音附人工转写,并标注稚嫩度(弱/中/强),完整保留萝莉特有的稚气话术及活泼可爱的语气。 独立性与必要性 本数据集的特征——高音调、快语速、频繁的语气词与稚嫩表达——是训练萝莉角色语音合成的关键资源。目前面向二次元童声人设的高质量语音语料较为稀缺,本数据集填补了这一空白,具有明确的独立存在价值,是推动虚拟偶像互动、有声童声角色配音及儿童陪伴型AI人设塑造的重要基础数据。一、数据采集与预处理 原始数据来源于杭州万像循声科技有限公司在专业录音棚内录制的萝莉角色扮演语音,均为WAV格式,采样率48kHz。录音环境为强吸声、高信噪比的专业声学环境,确保音频质量。采集内容为一位女性说话人(VRT013)模拟萝莉人设的自发对话,话题涵盖日常生活、学习吐槽、情侣互动、撒娇卖萌等,要求说话人保持“音调偏高、语气活泼、偶尔调皮”的萝莉音色,无预设脚本。预处理阶段,使用音频处理工具批量读取每段语音的时长(秒),统一文件命名格式,并对音频进行音量归一化、静音段切除,保证数据一致性。 二、特征标注 由熟悉角色配音的标注人员对每段语音进行精细化人工标注,针对萝莉角色特点增加差异化标注项: 语音转写:将音频内容逐字转写为标准汉字,完整保留萝莉特有的稚气词汇、撒娇式表达及语气词,忠实记录重复、拖长音等幼儿化特征; 稚嫩度分级:根据说话人的音色、咬字方式和语气语调,将每句语音的稚嫩程度分为弱、中、强三级,用于训练模型在不同稚嫩程度下的语音合成控制; 场景标注:统一标注场景为“萝莉”; 说话人属性:标注说话人标识(VRT013)及性别(女)。 三、数据结构化与打包 将上述技术参数(时长、采样率)与人工标注结果汇总为结构化表格文件,每行对应一段语音,字段包括:语音文件名、时长(秒)、采样率(kHz)、场景、说话人/音色、性别、类型、来源与授权、文本、稚嫩度。 四、数据应用说明 本数据集可直接用于训练萝莉角色语音合成模型、二次元虚拟偶像交互引擎、儿童陪伴型AI语音系统等AI任务。数据集中每段语音均包含完整的转写文本及稚嫩度标注,标注规范、结构清晰,可作为萝莉人设智能化应用的基准训练数据,尤其适用于需要控制稚嫩程度的虚拟主播配音、动漫游戏NPC语音生成及儿童陪伴型语音交互等垂直场景。




