遇见数据集

emotional-roleplay-finetuning-dataset-flattened

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集是laion/emotional-roleplay-finetuning-dataset的格式标准化版本(v5,多任务,speakfix),专为情感角色扮演对话系统的微调设计。它包含269,836条训练记录,源自67,459个源样本(合成TTS语音片段及文本),每个源样本扩展为4个任务:任务A(生成:文本指令预测语音token)、任务B(ASR:语音转文本)、任务C(语音转语音描述,生成语气/风格描述)、任务D(纯文本指令生成语音描述)。数据集采用2层聊天模板:英语且一致性评分≥4的行使用ChatML格式(<|im_start|>user),其余行使用基础USER:/ASSISTANT:格式。v5版本修复了speak标记的使用,确保仅英语任务A的助手侧包含<speak>音频token,非英语任务A被替换为听力理解任务(用户侧使用<listen>音频,助手回答文本),其他任务中speak被降采样为listen。数据集包含字段:id(行ID)、source_id(源行ID)、task(任务类型A/B/C/D)、tier(模板层级,如ChatML或base)、text(实际对话文本)。所有数据均经过SNAC token化(7 token/帧),仅包含训练集分割。适用于多任务语音角色扮演模型训练,包括语音合成、语音识别、情感与语气描述生成等任务,许可证为Apache 2.0。

This dataset is a standardized version (v5, multi-task, speakfix) of the laion/emotional-roleplay-finetuning-dataset, specifically designed for fine-tuning emotional role-play dialogue systems. It contains 269,836 training records derived from 67,459 source samples (synthetic TTS speech clips and text), with each source sample expanded into four tasks: Task A (generation: text instruction predicts speech tokens), Task B (ASR: speech to text), Task C (speech to speech description, generating tone/style descriptions), and Task D (pure text instruction generating speech description). The dataset uses a two-tier chat template: rows with English and consistency score ≥4 use ChatML format (<|im_start|>user), while others use the basic USER:/ASSISTANT: format. The v5 version fixes the use of speak tokens, ensuring only English Task A includes <speak> audio tokens on the assistant side; non-English Task A is replaced with a listening comprehension task (user side uses <listen> audio, assistant answers text); in other tasks, speak is downsampled to listen. The dataset includes fields: id (row ID), source_id (source row ID), task (task type A/B/C/D), tier (template level, e.g., ChatML or base), text (actual dialogue text). All data is SNAC tokenized (7 tokens/frame) and contains only the training split. Suitable for multi-task speech role-play model training, including speech synthesis, speech recognition, emotion and tone description generation, etc. Licensed under Apache 2.0.

创建时间:
2026-08-01
原始信息汇总

数据集概述

名称: emotional-roleplay-finetuning-dataset-flattened

发布者: EmpathicRobotics

许可证: Apache-2.0

数据集大小: 约1.22GB(下载大小约583.7MB)

样本数量: 训练集共269,836条记录(由67,459个源数据行 × 4个任务生成)


数据特征

每条记录包含以下字段:

字段名 类型 说明
id string 唯一标识符
source_id string 源数据行标识符
task string 任务类型(A/B/C/D)
tier string 分层模板类型(ChatML或base)
text string 文本内容

任务结构

每个源数据行生成4个不同的任务:

  • 任务A(主任务/生成): 根据指令、语音描述和语言提示生成<speak>音频
  • 任务B: 音频转文本(ASR,自动语音识别)
  • 任务C: 文本+音频 → 语音特征描述(语气/风格)
  • 任务D: 仅指令 → 语音特征描述(纯文本,低成本)

模板分层机制

根据质量指标将数据分为两层:

  • ChatML层<|im_start|>user格式): 仅当语言为英语且adherence_score ≥ 4时使用,共20,659行(占30.63%)
  • Base层USER:/ASSISTANT:格式): 其余46,800行

所有数据行均被保留,未丢弃任何样本。


v5版本关键修复

本版本(2026-08-02)针对v4进行了两项重要修正:

  1. 非英语任务A替换: 原版本中所有行都会生成<speak>音频,但因仅34.4%的源数据行为英语,导致大量非英语音频被用于训练。v5将44,241条非英语行替换为"听力理解"任务——用户侧使用降采样的<listen>音频,助手侧以纯文本回答,复用原有真实转录和语音描述。

  2. <speak>不进入用户侧: 所有任务中,用户侧不再出现<speak>块,统一降采样为<listen>格式(每帧从7个token降至3个token,保留L0/L1a/L1b频段,数学上精确无损)。


数据验证结果

  • <speak>出现次数: 23,218次(恰好等于英语任务A的行数)
  • <listen>出现次数: 179,159次(= 67,459×2 + 44,241,算术完全匹配)
  • 用户侧任何任务中<speak>出现次数: 0

基础来源

数据源自laion/emotional-roleplay-finetuning-dataset(67,491个合成TTS语音片段及对应文本,其中67,459条有效行被采用),音频使用SNAC进行分词(完整L0+L1a+L1b+L2频段,每帧7个token)。

搜集汇总
数据集介绍
emotional-roleplay-finetuning-dataset-flattened 数据集图片
构建方式
该数据集源自LAION团队构建的emotional-roleplay-finetuning-dataset,经过格式标准化处理,形成v5多任务版本。构建过程以67,459条源数据行为基础,针对每条记录生成四项任务:A为根据指令生成<speak>音频,B为音频转文本(ASR),C为结合文本与音频推断语音风格描述,D为仅基于指令生成风格描述。任务分配采用双层聊天模板,依据语言与质量分数将英文且高质量样本归入ChatML格式,其余使用基础格式,确保所有数据均被利用。针对音频标记,采用SNAC分词器编码,并在v5版本中修复了<speak>标记在用户侧出现的问题,确保助手仅输出英文音频,用户侧统一使用<listen>标记。
使用方法
使用者可依据任务类型选择相应数据子集进行模型微调。对于文本至语音生成任务,可聚焦于任务A中的英文样本,利用<speak>音频标记学习克隆语音输出;针对语音识别或情感分析,任务B和C提供了丰富的语音-文本对及风格描述;任务D则为纯文本模式提供低成本训练选项。数据集已按训练分割提供,可直接用于监督式微调。使用时应遵循Apache-2.0许可,并结合SNAC分词器处理音频标记,注意区分<listen>与<speak>的使用场景,以确保模型符合既定设计规范。
背景与挑战
背景概述
该数据集由LAION机构于2026年发布,旨在支持情感角色扮演场景下的多模态对话生成研究。其核心研究问题在于如何将文本指令、语音描述与情感表达融合,生成自然且富有情感的语音响应。作为情感计算与语音交互领域的创新资源,该数据集通过标准化格式和任务设计,显著推动了语音助手、虚拟角色等应用的发展,为多模态学习提供了高质量的训练样本,具有重要的学术与应用价值。
当前挑战
该数据集面临多重挑战:领域上,情感语音生成需精准建模语音的韵律、音色与情感表达,而现有模型常难以平衡文本语义与情感细微差异;多模态对齐(文本、语音、情感标注)的复杂性也易导致生成结果缺乏连贯性。构建中,需处理67,459条源数据并生成四类任务,面临数据量庞大、标注一致性维护及非英语样本的有效利用等问题;同时,保证语音令牌(<speak>)在用户侧绝不出现,要求严格的后处理校验,增加了工程实现的复杂度。
常用场景
经典使用场景
该数据集作为情感角色扮演语音对话系统的微调语料,其经典使用场景在于构建具备情感表达能力的多模态对话代理。依托SNAC音频分词技术,数据以多任务格式组织,涵盖语音生成(任务A)、语音识别(任务B)、语音风格描述(任务C)及文本到风格映射(任务D),为训练模型实现从指令到情感语音、从语音到情感理解的端到端映射提供了高质量基准。其精细的对话模板划分(基于语言和遵从度评分)及对非英语行的听力理解任务重构,使其成为研究情感语音合成、跨语言情感理解以及人机情感交互的核心数据集,广泛应用于训练具备拟人化语音特征的聊天机器人、虚拟助手及有声内容生成系统。
解决学术问题
该数据集旨在解决情感对话生成中语音与文本模态对齐的学术难题,尤其在多语言、多情感场景下,传统TTS系统难以捕捉细腻的情感语调。通过提供严格处理的<speak>和<listen>标记,确保语音内容不泄露到用户侧,并利用SNAC令牌化实现高保真音频表示,其数据划分策略解决了训练中情感一致性、任务多样性及数据稀疏性问题。该数据集推动了情感语音合成、多模态对话理解及跨语言情感迁移等领域的研究,为构建更自然、更富情感的人机交互模型提供了数据支撑,其精细的标注和任务设计也为情感计算、对话系统评估等方向树立了新的数据标准。
实际应用
在实际应用中,该数据集可用于训练情感语音助手,使其在客服、心理健康支持等场景中通过语音传达共情和情感回应;也可用于开发个性化语音角色,如在游戏、虚拟偶像及有声读物中生成性格化、情绪化的语音输出。其多任务设计支持构建语音到文本、文本到语音的双向映射系统,助力智能设备的无障碍交互、语言学习工具及娱乐内容创作。此外,数据集的英语与非英语混合处理方案使其适应全球化产品需求,为跨语言情感语音应用(如多语言语音翻译、情感语音搜索)提供了可靠训练基础,并已在相关开源社区取得显著性成效。
数据集最近研究
最新研究方向
该数据集的最新研究聚焦于多任务学习与语音交互的精细化建模,通过标准化格式并引入四个衍生任务(生成、语音识别、语音风格描述及纯文本指令理解),强化了情感角色扮演中语音与文本的无缝衔接。尤为关键的是,v5版本彻底修正了非英语样本的语音角色分配,将音频限制于用户侧并降采样为<listen>标记,确保了助手仅以英语发声的严格设计原则,同时大幅提升了多语言场景下的语义理解与情感捕捉能力。这一演进不仅优化了训练数据的质量分层,还为低资源语言的情感语音合成与跨模态对齐提供了可复现的范式,推动了TTS与NLP交叉领域在细腻情感表达和动态交互上的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务