遇见数据集

温柔女生语音标注训练数据

收藏
浙江省数据知识产权登记平台2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

本数据集聚焦温柔女生风格的语音合成与情感交互,服务于虚拟女友、有声内容配音、情感陪伴类AI、聊天机器人等场景。温柔女生语音特征为语调柔和、语速舒缓、情感细腻,常用宠溺、安慰式表达。本数据在专业录音棚采集一位女性说话人模拟温柔人设的自然对话,涵盖日常关怀、情感交流、生活陪伴等丰富场景,每段语音附人工转写,并标注语气类型(安慰/撒娇/日常),完整保留温柔女生特有的语气词、撒娇式表达及情感词汇。 独立性与必要性 本数据集的特征——音色温柔、语气体贴、情感正向——是训练温柔女生角色语音合成的关键资源。目前面向治愈系女性人设的高质量语音语料较为稀缺,本数据集填补了这一空白,具有明确的独立存在价值,适用于情感陪伴型AI、虚拟伴侣、儿童故事配音等场景。一、数据采集与预处理 原始数据来源于杭州万像循声科技有限公司在专业录音棚内录制的温柔女生角色扮演语音,均为WAV格式,采样率48kHz。录音环境为强吸声、高信噪比的专业声学环境,确保音频质量。采集内容为一位女性说话人(VRT005)模拟温柔人设的自然对话,话题涵盖情感关怀、工作生活、日常问候等,要求保持“语调柔和、语气体贴”的温柔音色,无预设脚本。预处理阶段,使用音频处理工具批量读取每段语音的时长(秒),统一文件命名格式,并对音频进行音量归一化、静音段切除等标准化处理,保证数据一致性。 二、特征标注 由专业标注人员对每段语音进行精细化人工标注,针对温柔女生角色特点增加差异化标注项: 语音转写:将音频内容逐字转写为标准汉字,完整保留温柔女生特有的语气词、撒娇式表达及情感词汇; 语气类型标注:根据语音的语用功能和情感倾向,将每句语音的语气分为安慰、撒娇、日常三类。该分类用于训练模型在不同语气类型下的语音合成控制,提升温柔女生的表达丰富度; 场景标注:统一标注场景为“温柔女生”; 说话人属性:标注说话人标识(VRT005)及性别(女)。 三、数据结构化与打包 将上述技术参数(时长、采样率)与人工标注结果汇总为结构化表格文件,每行对应一段语音,字段包括:语音文件名、时长(秒)、采样率(kHz)、场景、说话人/音色、性别、类型、来源与授权、文本、语气类型。 四、数据应用说明 本数据集可直接用于训练温柔女生风格语音合成模型、情感陪伴AI、虚拟伴侣对话系统等AI任务。数据集中每段语音均包含完整的转写文本及语气类型标注,标注规范、结构清晰,可作为温柔女生角色智能化应用的基准训练数据,尤其适用于虚拟女友聊天、情感关怀类语音交互、有声内容角色配音等垂直场景。

创建时间:
2026-06-25
搜集汇总
数据集介绍
温柔女生语音标注训练数据 数据集图片
背景与挑战
背景概述
本数据集为温柔女生风格的语音标注训练数据,由专业录音棚采集一位女性说话人(VRT005)的自然对话,包含日常关怀、情感交流等场景,每段语音提供人工转写文本和语气类型(安慰、撒娇、日常)标注。数据采用WAV格式、48kHz采样率,总规模161.12MB,旨在用于训练温柔女生语音合成、情感陪伴AI及虚拟伴侣等应用,填补了治愈系女性人设高质量语音语料的稀缺空白。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务