多情感AI人声合成与音色迁移模型数据集合
收藏官方服务:
资源简介:
以JSON格式存储,采用分层目录结构组织多情感AI人声合成与音色迁移所需的语音训练数据及模型推理数据。数据涵盖六类对象,主要字段如下 1、多情感多说话人语音语料数据包含音频唯一标识、音频名称、时长、采样率、位深度、声道数、编码格式、脱敏说话人ID、性别年龄段标签、情感标签及强度等级、文本转写、录音环境、语音风格标签和存储路径。 2、语音声学特征工程数据包含特征样本标识、关联音频ID、帧序号、声学特征、韵律特征、频谱特征、音色特征、情感特征及语音活动检测标记。 3、情感人声合成与音色迁移训练数据包含训练样本标识、源和目标说话人特征ID、源目标情感标签及强度、音色迁移参数、质量评估指标、音色相似度评分、情感准确率及数据集分割标识。 4、零样本语音克隆与风格迁移训练数据包含样本标识、参考语音片段ID、目标文本、生成语音路径、音色相似度、情感一致性、自然度及跨语言质量指标。 5、人声合成推理与效果评估数据包含推理记录唯一标识、模型版本号、输入文本内容及情感控制参数、参考音色样本ID、生成语音存储路径、推理延迟、计算资源消耗、生成质量实时评估指标、用户满意度评分与反馈。
提供机构:
上海蒙鹏科技有限公司创建时间:
2026-09-03
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集合围绕多情感AI人声合成与音色迁移模型构建,以JSON格式和分层目录结构组织语音训练及模型推理数据。数据涵盖多情感多说话人语料、语音声学特征工程、模型训练样本、零样本语音克隆风格迁移以及推理效果评估六类对象,其字段详细描述了音频属性、说话人画像、情感与文本标注、声学及韵律特征、训练与迁移参数,以及用于评价合成质量的相似度、自然度等指标,可支撑从基础语料到最终推理评估的全链路任务。
以上内容由遇见数据集搜集并总结生成



