遇见数据集

NCSOFT/Designed-Vocalizations-Dataset

收藏
Hugging Face2026-07-10 更新2026-07-22 收录
官方服务:

资源简介:

Designed Vocalizations Dataset(设计人声数据集)支持针对设计人声(如怪物咆哮、机器人声音和其他声音设计音色)的语音转换,这一领域在专注于自然人类语音的基准测试中尚未充分探索。该数据集整理了多样化的原始声音来源(包括语音和动物/非语言声音),并应用专业的人声效果处理来生成相应的效果修改变体。一个标准化的测试集,在源音色组和预设风格上具有明确的可见/不可见分割,使得在受控条件下进行泛化评估成为可能。

The **Designed Vocalizations Dataset** supports voice conversion for *designed* vocalizations — monster growls, robotic voices, and other sound-designed timbres — an area left underexplored by benchmarks that focus on natural human speech. It curates diverse raw vocal sources (speech and animal / non-linguistic sounds) and applies professional vocal-effects processing to produce corresponding effect-modified variants. A standardized test set with explicit seen/unseen splits over source-timbre groups and preset styles enables generalization evaluation under controlled conditions.

提供机构:
NCSOFT
搜集汇总
数据集介绍
NCSOFT/Designed-Vocalizations-Dataset 数据集图片
构建方式
该数据集专为声音设计中的非自然语音转换任务而构建,聚焦于怪兽嘶吼、机械音效等经专业音效处理的发声样本。其构建过程首先采集多元化的原始声源,涵盖人类言语与动物/非语言声音,随后通过专业音效处理流水线对每种声源施加预设的效果链,生成对应的效果修改版本。数据集被组织为原始音频与效果处理音频两个配置,每个配置均划分训练集与测试集。训练集采用非平行结构,而测试集则显式区分源音色组与预设风格在训练中是否出现,从而为泛化性能评估提供受控条件。
特点
该数据集的一大特色在于其系统化的测试集设计,通过源音色与预设风格的显式交叉组合,定义了从“见过-见过”到“未见-未见”四种评估条件,便于严谨衡量模型对未见声源或未见效果的泛化能力。数据集包含近24万条音频样本,采样率为44.1kHz,16位单声道WAV格式。配套详尽的预设元数据,包括预设类型、DSP模块链及其参数,以及17个内部预设的完整可复现效果链描述,为可解释性分析与方法复现提供了坚实支撑。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据,指定配置参数为原始或效果处理、训练或测试集即可获取相应分割。每条样本包含解码为NumPy数组的音频波形及其采样率,同时附带文件路径、预设名称与源文件标识等元数据列。对于效果处理配置,源列直接关联对应的原始音频文件路径,便于构建平行评估对。完整的训练与测试工作流程示例代码已在仓库中提供,可帮助用户快速开展非平行训练与平行评估实验。
背景与挑战
背景概述
在语音转换研究领域,多数基准数据集聚焦于自然人类语音的转换任务,而面向设计化发声(如怪兽咆哮、机器人声音等经过声音设计的音色)的语音转换研究长期处于被忽视的境地。为填补这一空白,韩国NCSOFT研究团队于2026年发布了Designed Vocalizations Dataset,由Seolhee Lee、Minsu Kang等学者在Interspeech 2026会议上正式提出。该数据集整合了源自VCTK、HiFi-TTS及Freesound平台的多样化原始音频素材(包含语言性与非语言性声音),并通过专业音效处理生成对应的效果修改版本,系统性地支持非人类声音转换的研究。其标准化测试集设计了显式的已知/未知音色组与预设风格划分,为泛化能力评估提供了可控条件,对声音设计、人机交互等领域的非自然语音转换技术发展具有重要推动作用。
当前挑战
该数据集的核心挑战在于解决设计化发声语音转换的领域问题,即现有模型在处理经过专业音效处理、音色高度异化的非自然人类声音时表现不佳,难以从原始语音中有效分离并重构出目标设计音色。此外,数据集构建过程中面临多重困难,包括需确保原始素材的多样性覆盖语言性与非语言性声音,以及设计专业级音效处理链(如Dehumaniser插件、Cubase效果器)的复杂参数配置以实现可重复的效果修改。训练集非平行结构的设置进一步增加了模型学习原始与效果版本间映射关系的难度,同时需严格管理不同来源音频的许可协议(CC0、CC BY等)以保障合规发布。
常用场景
经典使用场景
Designed Vocalizations Dataset 专为语音转换领域中的“设计性发声”任务而构建,涵盖怪物咆哮、机器人声音等经过音效设计的非自然音色。该数据集的经典使用场景包括:基于非平行语料库的语音转换模型训练,即利用原始录音(raw)与经过专业效果处理的音频(designed)之间的映射关系,学习从自然语音或动物声音到特定设计音色的转换函数。研究者可通过其标准化的测试集(包含已见/未见音源组和预设风格)系统评估模型在不同声学条件下的泛化能力,从而推动非人类语音转换技术的发展。
实际应用
在实际应用中,该数据集为游戏开发、影视后期制作和虚拟角色交互提供了关键的数据基础。例如,游戏音效设计师可借助预训练的语音转换模型,将演员的配音一键转化为符合特定怪物或机器人设定的独特音色,大幅缩短音效制作的迭代周期。在虚拟助手或元宇宙场景中,它可赋予数字角色更具表现力的非人类发声能力,如从人类语音生成科幻感十足的变声效果。此外,基于该数据集训练的系统能应用于语音合成中的风格迁移,实现从广告配音到舞台效果音频的快速定制化生产。
衍生相关工作
Designed Vocalizations Dataset 的出现催生了一系列后续研究。例如,Lee 等人(2026)在 Interspeech 上提出基于该数据集的非人类语音转换基准,并设计了结合音色分离与效果参数预测的复合模型。随后,有工作探索了基于扩散模型的非平行设计性语音转换,利用数据集中的预设链信息实现可控的音色编辑。另一方向则聚焦于域适应技术,通过利用数据集的“未见”条件划分,研究源域与目标域差异显著的场景下的特征对齐方法。此外,部分研究者将其与多模态学习结合,尝试从文本描述直接生成对应的设计性音色,进一步拓展了数据集的学术影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务