遇见数据集

御姐角色语音标注训练数据

收藏
浙江省数据知识产权登记平台2026-08-11 更新2026-08-12 收录
官方服务:

资源简介:

本数据集聚焦御姐角色语音合成与情感交互,服务于有声小说、广播剧、虚拟偶像、游戏NPC、职场助手等场景。御姐角色语音特征为音调略低、语速平稳、语气成熟自信,常有调侃、宠溺、冷静命令式表达。通用语音模型难以精准还原御姐的从容感与轻微慵懒。本数据在专业录音棚采集一位女性说话人模拟御姐人设的自然对话,涵盖工作指导、情感交流、日常调侃、生活建议等丰富场景,每段语音附人工转写,并标注情感强度分级(轻度/中度/重度),完整保留御姐特有的调侃式、宠溺式话术及成熟冷静的语气。 独立性与必要性 本数据集的特征——中低音调、平稳语速、宠溺与冷静并存——是训练御姐角色语音合成的关键资源。目前面向成熟女性人设的高质量语音语料较为稀缺,本数据集填补了这一空白,具有明确的独立存在价值,是推动御姐角色语音合成、有声内容角色配音及虚拟形象互动的重要基础数据。一、数据采集与预处理 原始数据来源于杭州万像循声科技有限公司在专业录音棚内录制的御姐角色扮演语音,均为WAV格式,采样率48kHz。录音环境为强吸声、高信噪比的专业声学环境,确保音频质量。采集内容为一位女性说话人(VRT014)模拟御姐人设的自发对话,话题涵盖工作、情感、日常调侃等,要求说话人保持“音调略低、语速平稳、成熟自信”的御姐音色,无预设脚本。预处理阶段,使用音频处理工具批量读取每段语音的时长(秒),统一文件命名格式,并对音频进行音量归一化、静音段切除等标准化处理,保证数据一致性。 二、特征标注 由熟悉角色配音的标注人员对每段语音进行精细化人工标注,针对御姐角色特点增加差异化标注项: 语音转写:将音频内容逐字转写为标准汉字,完整保留御姐特有词汇及调侃式、冷静命令式句式; 情感强度分级:根据说话人的语气强弱、用词力度和情感浓度,将每句语音的情感表达分为轻度、中度、重度三级。轻度对应平淡陈述或轻微情感;中度对应明显情感但不过激;重度对应强烈情感表达。该分级用于训练模型在不同情感强度下的语音合成控制; 场景标注:统一标注场景为“御姐”; 说话人属性:标注说话人标识(VRT014)及性别(女)。 三、数据结构化与打包 将上述技术参数(时长、采样率)与人工标注结果汇总为结构化表格文件,每行对应一段语音,字段包括:语音文件名、时长(秒)、采样率(kHz)、场景、说话人/音色、性别、类型、来源与授权、文本、情感强度分级。 四、数据应用说明 本数据集可直接用于训练御姐角色语音合成模型、角色情感语音识别系统、虚拟偶像交互引擎等AI任务。数据集中每段语音均包含完整的转写文本及情感强度分级标注,标注规范、结构清晰,可作为御姐人设智能化应用的基准训练数据,尤其适用于需要控制情感强度的有声小说角色配音、虚拟职场助手及游戏NPC语音生成等垂直场景。

创建时间:
2026-06-25
搜集汇总
数据集介绍
御姐角色语音标注训练数据 数据集图片
背景与挑战
背景概述
该数据集由杭州万像循声科技有限公司采集,包含一位女性说话人在专业录音棚模拟御姐人设的自然对话语音,涵盖工作、情感、日常调侃等场景,每段语音均提供人工转写文本及情感强度分级(轻度/中度/重度)标注。数据采用48kHz采样率的WAV格式,经标准化预处理,结构化为包含文件名、时长、采样率、场景、说话人属性等字段的表格,适用于御姐角色语音合成、情感语音识别及虚拟偶像交互等AI任务,尤其为需要精细情感控制的角色配音提供高质量训练资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务