遇见数据集

emotional-roleplay-finetuning-dataset

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

人工语音角色扮演数据集是一个完全合成的多语言语音数据集,专门为语音方向文本到语音(TTS)训练而设计。该数据集包含67,711个语音片段(约184小时),覆盖德语、英语、西班牙语和法语四种语言,其中德语数据占主导。数据集的核心特点是其丰富的表达性角色扮演和角色语音,特别强调夸张的幻想/生物语音(如兽人、地精、巨魔、僵尸、龙、恶魔、女巫、机器人等)以及高唤醒度的情感表达(如愤怒、恐惧、悲伤、威胁)。所有音频均由微调后的MOSS-TTS-Local v1.5模型机器生成,并采用CC-BY-4.0许可发布。每个样本包含多个字段:audio(单声道MP3格式,24kHz采样率的合成音频)、voice_description(由gemini-3.5-flash根据实际生成的音频编写的描述语音听感的标签,是主要训练标签)、text(语音内容文本)、language(语言标识)、realized_gender(音频中实际感知到的性别:女性/男性/模糊)、instruction(用于生成音频的原始语音方向提示词)、adherence_score(音频与提示词匹配度的1-5分评分)以及req_character、req_gender、req_volume、req_emotion等请求属性字段。数据构成方面,约57%的语音被感知为男性,33%为女性,10%为模糊;约41%的片段属于非人类角色语音,涵盖18种以上原型,其中包括约9,000个女性生物语音片段。情感范围涵盖平静、愤怒、恐惧、悲伤、威胁、喜悦、嘲讽等。该数据集适用于训练能够理解和生成具有特定角色特征、情感和风格的语音的TTS模型。其主要优势在于标签是“法官验证”的,即根据实际生成的音频编写,避免了TTS模型漂移导致的标签不匹配。局限性包括生成模型对女性语音和大声/喊叫语音存在抵抗,导致数据集中男性和平静语音占主导;语言分布偏向德语和英语;以及合成语音可能存在的伪影。

Artificial Voice Roleplay Dataset is a fully synthetic multilingual speech dataset specifically designed for voice-directed text-to-speech (TTS) training. It contains 67,711 speech clips (approximately 184 hours), covering four languages: German, English, Spanish, and French, with German data being dominant. The core feature of the dataset is its rich expressive role-playing and character voices, with a particular emphasis on exaggerated fantasy/creature voices (such as orcs, goblins, trolls, zombies, dragons, demons, witches, robots, etc.) and high-arousal emotional expressions (such as anger, fear, sadness, threat). All audio is machine-generated using a fine-tuned MOSS-TTS-Local v1.5 model and is released under the CC-BY-4.0 license. Each sample includes multiple fields: audio (mono MP3 format, synthetic audio at 24kHz sampling rate), voice_description (a label describing the auditory perception of the voice, written by gemini-3.5-flash based on the actual generated audio, serving as the primary training label), text (speech content text), language (language identifier), realized_gender (perceived gender in the audio: female/male/ambiguous), instruction (original voice direction prompt used to generate the audio), adherence_score (a 1-5 score rating the match between the audio and the prompt), and request attribute fields such as req_character, req_gender, req_volume, req_emotion. In terms of data composition, approximately 57% of the voices are perceived as male, 33% as female, and 10% as ambiguous; about 41% of the clips belong to non-human character voices, covering over 18 archetypes, including approximately 9,000 female creature voice clips. The emotional range covers calm, anger, fear, sadness, threat, joy, sarcasm, etc. This dataset is suitable for training TTS models capable of understanding and generating speech with specific character traits, emotions, and styles. Its main advantage is that the labels are judge-verified, meaning they are written based on the actual generated audio, avoiding label mismatches due to TTS model drift. Limitations include the generation models resistance to female voices and loud/shouting voices, leading to a predominance of male and calm voices in the dataset; a language distribution biased towards German and English; and potential artifacts in the synthetic speech.

提供机构:
LAION eV
创建时间:
2026-07-11
原始信息汇总

数据集概述

Artificial Voice Roleplay Dataset 是一个大规模、完全合成的语音数据集,包含 67,711 个语音片段(约 184 小时),专注于角色扮演和情感表达。该数据集由 MOSS-TTS-Local v1.5 模型微调生成,并经过自动标注与质量审核。

核心特征

  • 语言:德语(主导)、英语、西班牙语、法语(西班牙语和法语数据量较小)。
  • 角色种类:约 41% 的片段为奇幻/生物角色声音(如兽人、哥布林、龙、恶魔、女巫、机器人等 18 种以上原型),包含约 9,000 个女性生物角色声音片段。
  • 情感范围:从中性工作室语音到强烈情感表演(愤怒、恐惧、悲伤、威胁、喜悦、嘲讽等),涵盖喊叫和低语。
  • 音频格式:单声道 MP3,采样率 24 kHz。
  • 许可证:CC-BY-4.0。

数据模式(Schema)

数据集以 Hugging Face AudioFolder 格式组织,主要字段如下:

字段 描述
audio / file_name 合成的音频文件
voice_description 主要标签——由自动评判模型(gemini-3.5-flash)根据实际音频写出的声音描述
text 语音中的文字内容
language 语言(德语/英语/西班牙语/法语)
realized_gender 音频中实际听到的性别(female/male/ambiguous
instruction 生成该片段时使用的原始声音方向提示
adherence_score 评判者对音频与 instruction 匹配程度的 1–5 评分
req_character / req_gender / req_volume / req_emotion 生成时请求的属性(用于目标生成行,未经验证音频)
source 提示的来源
duration / id 时长(秒)和唯一 ID

数据构成

按语言分布(共 67,711 个片段):

语言 片段数
德语 40,303
英语 23,279
西班牙语 2,106
法语 2,023

按实际性别分布

性别 片段数(占比)
男性 38,270(57%)
女性 22,369(33%)
模糊 7,072(10%)

生成流程

  1. 提示来源:从 DramaBox 风格的声音方向数据集中提取,并补充目标网格(角色 × 性别 × 音量 × 情感)和强制最佳-N 遍历,针对困难分布(如女性生物角色、喊叫)进行增强。
  2. 音频合成:使用 MOSS 微调模型(creatures_p9,温度 1.7,top_p 0.8)在 2× RTX 3090 上生成。对于分布外的属性,模型进行 N 次采样,并通过 VoiceCLAP 性别/强度评分器过滤,保留女性/大声候选。
  3. 标注与质量检查:由 gemini-3.5-flash 为每个音频片段生成 voice_description,同时验证文字内容与可懂度,失败片段被丢弃。

使用示例

python from datasets import load_dataset ds = load_dataset("laion/artificial-voice-roleplay-dataset", split="train") ex = ds[0] print(ex["voice_description"], "||", ex["text"], "||", ex["language"], "||", ex["realized_gender"]) ex["audio"] # {array: ..., sampling_rate: 24000}

已知限制

  • 性别与情感偏差:生成模型默认倾向于男性/平静声音,对分布外的女性角色和喊叫表现不佳。尽管通过目标生成与本地过滤改善了女性生物角色覆盖(约 9k 片段),整体仍约 57% 为男性音频。req_* 字段可能夸大了女性/大声属性,应以 voice_descriptionrealized_gender 为准。
  • 音量标签:“喊叫”通过强度词语(激进/有力/命令式)描述,而非实际音量标签;音频振幅因 MOSS 归一化处理并非更高。
  • 合成语音:尽管经过可懂度过滤,仍可能存在 TTS 伪影。
  • 标签准确性voice_description 来自单一自动评判模型,未经人工验证。
  • 语言偏斜:德语和英语占主导,西班牙语和法语数据量很小。
搜集汇总
数据集介绍
emotional-roleplay-finetuning-dataset 数据集图片
构建方式
该数据集基于MOSS-TTS-Local v1.5模型微调版本全合成生成,包含67,711条语音片段(约184小时)。构建流程始于从DramaBox风格语音指令数据集中提取提示词,并辅以目标属性网格(生物类型×性别×音量×情感)及面向困难分布组合的强化优选采样。音频生成后,使用VoiceCLAP评分器对性别和强度进行局部筛选,最终由gemini-3.5-flash模型基于音频内容撰写语音描述标签,并验证文本准确性与可懂度,未通过质检的样本被剔除。
特点
数据集覆盖德语、英语、西班牙语和法语四种语言,其中德语占比最高。其显著特点在于对夸张奇幻生物声音的丰富刻画,涵盖兽人、哥布林、龙、恶魔等18余种原型,约41%的片段为非人类角色声音,并包含约9,000条女性生物语音。情感表达跨度极大,从中性工作室级发音到愤怒、恐惧、悲伤、威胁等高唤醒度演绎应有尽有。每条语音均附带经过法官验证的`voice_description`标签,确保描述与音频实际内容一致,避免了文本漂移问题。
使用方法
用户可通过HuggingFace Datasets库轻松加载该数据集:`load_dataset("laion/artificial-voice-roleplay-dataset", split="train")`。每条样本包含`audio`字段(24 kHz单声道MP3)及其元数据。核心标签`voice_description`可直接用于语音方向文本转语音模型的训练,结合`text`字段提供待朗读文本。`realized_gender`字段可用于过滤实际呈现的性别特征,而`req_*`字段虽记录了生成意图,但因模型遵从度有限,建议优先信任`voice_description`与`realized_gender`。
背景与挑战
背景概述
在语音合成领域,实现富有情感表现力与角色化特征的多语种语音生成始终是一项艰巨挑战。该数据集由LAION团队于2023年创建,旨在通过全合成方式构建一个覆盖德语、英语、西班牙语和法语的高质量角色语音语料库,核心研究问题聚焦于如何让文本到语音模型精准捕捉并再现诸如怒吼、低语、恐惧等极端情感,以及兽人、妖精、龙族等幻想生物的声音特质。作为首个大规模公开的指令驱动型情感角色扮演语音数据集,其67,711个音频片段(约184小时)为多语种语音风格迁移与细粒度情感控制研究提供了宝贵资源,显著推动了语音合成向更富戏剧性与沉浸式体验方向的演进。
当前挑战
该数据集所应对的领域挑战主要源于传统语音合成在处理非人类角色声音与高唤醒度情感(如愤怒、恐惧)时的表现力不足,尤其缺少覆盖多语种幻想生物语音的标注资源。在构建过程中,团队面临生成模型对女性及高音量角色语音的自然抗拒——基础模型默认偏向男性与平静风格,为此采用了针对性最优采样策略与VoiceCLAP性别/强度分类器进行局部过滤,方将女性角色语音覆盖提升至约9,000条;同时,自动标注器对音量感知存在局限,致使“呼喊”类描述无法对应实际音频振幅的增高。合成语音固有的伪影与单一自动裁判标注的主观性,亦构成质量控制上的显著障碍。
常用场景
经典使用场景
情感角色扮演微调数据集(Emotional Roleplay Finetuning Dataset)专为文本到语音(TTS)领域的情感化与角色化语音合成而设计。其经典使用场景在于驱动语音模型学习如何根据精细化的角色描述(如兽人、哥布林、龙、女巫等奇幻生物)以及高唤醒度的情感标签(如愤怒、恐惧、悲伤、威胁)生成富有表现力的语音。该数据集包含了超过6.7万条合成语音片段,覆盖德语、英语、西班牙语和法语四种语言,其中约41%的样本为非人类角色语音,为TTS模型提供了稀缺的异类角色和极端情感表达的训练素材。研究者通常利用其核心字段`voice_description`与`text`组合,训练模型实现从文本描述到富有角色性格与情感色彩的语音的端到端映射,从而突破传统TTS中平淡、中性的语音风格界限。
解决学术问题
该数据集解决了多语言、多角色、高情感表达语音合成中训练数据严重匮乏的学术难题。传统TTS数据集多集中于中性、标准化的朗读语音,难以支撑对奇幻生物、非人类嗓音以及强烈情感(如怒吼、阴森低语)的逼真模拟。此数据集的提出,为研究者提供了大规模、细粒度标注的合成语音资源,使得探索语音的情感可控性、角色个性保持、跨语言迁移以及罕见角色(如女性龙、女妖)的语音生成成为可能。其核心意义在于推动了TTS技术从单一语言、单一风格向多元化、高表现力方向的范式转变,为构建能够理解并复现复杂语音指令(如“用低沉而充满威胁的兽人声音咆哮”)的智能语音系统奠定了数据基础,对语音合成、人机交互以及虚拟角色配音等学术领域产生了深远影响。
衍生相关工作
围绕该数据集已衍生出一系列经典研究与实践工作。最直接的相关工作是针对MOSS-TTS-Local v1.5模型的角色扮演微调,该数据集本身即为此微调过程的训练与验证产物。研究者基于此数据集,进一步发展了VoiceCLAP评分器用于对生成语音的性别与强度进行自动筛选和过滤,形成了高效的数据增强与质量控制流水线。此外,该数据集催生了对TTS模型在多情感维度、跨角色一致性以及罕见属性组合(如女性+咆哮)生成能力上的系统性评估工作。在应用层面,DramaBox式的语音方向标注方法被广泛借鉴,用于构建更丰富的人机对话语音指令集。同时,该数据集的构建范式(合成+评委验证)为后续大规模、低成本、高多样性的TTS数据集创建提供了可复现的范例和基线方法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务