遇见数据集

laion/moss-character-voices-top3-captioned

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

MOSS角色语音数据集——每组前三名,带标注(训练就绪版)是基于laion/moss-character-voices-bestof64数据集中所有约12,900组数据的每组前三名样本(根据奖励模型排名0/1/2),总计约38,700个样本。每个样本都使用LAION语音表演标注流水线进行了两种标注:caption_procedural(程序化语音标注,提供简洁标签和内联确认的语音爆发)和caption_llm(基于LLM的全面语音表演标注,将程序化草稿重写为自然语言并保留语音爆发位置)。数据集包含所有分数和元数据,可直接用于训练,数据以分片Parquet格式(data/train-*-of-00129.parquet)提供。字段包括音频、标注、文本、转录、角色、语言、主题、指令等元数据,以及奖励分数、排名、种子、持续时间、VoiceNet维度、EmoNet情绪、真实性、语音爆发混合、性别等评分和特征。许可证为CC-BY-4.0。

MOSS Character Speech Dataset – Top 3 per Group with Annotations (Training-Ready Version) is derived from the top 3 samples per group (ranked 0/1/2 by the reward model) across approximately 12,900 groups of data in the laion/moss-character-voices-bestof64 dataset, totaling approximately 38,700 samples in total. Each sample has undergone two types of annotations via the LAION Speech Performance Annotation Pipeline: caption_procedural (procedural speech annotation, which provides concise labels and inline-confirmed speech bursts) and caption_llm (comprehensive speech performance annotation based on LLM, which rewrites procedural drafts into natural language while retaining the positions of speech bursts). The dataset includes all scores and metadata, and is ready for direct training. The data is provided in sharded Parquet format (data/train-*-of-00129.parquet). The fields cover metadata such as audio, annotations, text, transcription, character, language, topic, instruction, as well as various scores and features including reward score, rank, seed, duration, VoiceNet dimensions, EmoNet emotion, authenticity, speech burst mixture, gender, and more. The license for this dataset is CC-BY-4.0.

提供机构:
laion
原始信息汇总

数据集概述

  • 数据集名称:MOSS Character Voices — Top-3 per Group, Captioned (training-ready)
  • 数据集维护者:LAION eV
  • 许可证:CC-BY-4.0
  • 规模:12.8 GB,包含 38,400 行数据(约 10K - 100K 样本量级)

任务与模态

  • 任务:文本转语音 (Text-to-Speech)、音频分类 (Audio Classification)
  • 模态:表格 (Tabular)、文本 (Text)
  • 格式:Parquet
  • 语言:英语、德语、法语 (+2种)
  • 标签:voice-acting, captions, vocal-bursts, character-voices

数据集构成

该数据集是 laion/moss-character-voices-bestof64 的一个子集,从中选取了每个组的 Top-3 (根据奖励模型排名 rank 0/1/2),总计约 12,900 个组,共约 38,700 个样本。数据被切分为 data/train-*-of-00129.parquet 文件。

核心字段说明

字段 描述
audio FLAC 格式的音频片段
caption_procedural 程序化语音描述:包含强度、维度标签,并内联插入已确认的嗓音爆发点(vocal burst);同时包含基于 Empathic-Insight 的性别门控。
caption_llm 全面语音表演注释:基于程序化描述,由 Gemma-4-E4B 改写为自然语言,嗓音爆发点位置与程序化描述一致。每条注释包含 GENERAL: 语音描述和 SCRIPT: 逐句内容(含 (delivery cue)(Burst Name))。
text / transcript 目标文本 / ASR 转写文本 (Parakeet)
character, lang, topic, instruction 生成元数据(角色、语言、主题、指令)
reward, rank, seed, duration_s 奖励模型分数、组内排名 (0/1/2)、随机种子、音频时长
voicenet_dims, emonet JSON:57 维 VoiceNet 特征 (0–6) 和 40 维 EmoNet 情感特征
genuineness, burst_blend, ei_gender, gender_gated 真实性评分 (0–6)、嗓音爆发混合度、Empathic-Insight 性别评分 (−2 男性化至 +2 女性化)、性别是否被门控过滤
vocal_bursts JSON 列表,包含已确认的嗓音爆发点 {label, start, end, dur, prob}
src_* 源数据集 (moss-character-voices-bestof64) 的奖励模型子分数及元数据
搜集汇总
数据集介绍
laion/moss-character-voices-top3-captioned 数据集图片
构建方式
该数据集源自LAION团队发布的moss-character-voices-bestof64语料库,通过奖励模型对每个分组内的语音片段进行排序,并遴选排名前三的优质样本,最终汇聚约38,700条音频片段。每条样本均配备两套独立的标注流水线:其一为过程化语音标注(Procedural Voice Captions),以紧凑标签形式记录强度与维度信息,并将确认的爆发音在词级时间戳位置内联插入;其二为综合语音表演标注(Comprehensive Voice-Acting Annotation Pipeline),借助Gemma-4-E4B模型将过程化草稿改写为自然流畅的叙述性文本,同时保留爆发音的精确位置。数据以Parquet格式分片存储,便于直接接入训练流程。
特点
该数据集的核心特色在于双管道标注机制的协同设计:过程化标注提供结构化、高精度的标签信息,而大语言模型生成的叙述性标注则赋予文本更强的可读性与语义连贯性,二者互为补充。每条样本均包含丰富的元数据字段,涵盖奖励模型得分、组内排名、语音特征向量(VoiceNet 57维)、情感维度(EmoNet 40维)、真实度评分、爆发音列表及性别门控信息等,为多模态语音合成与情感分析研究提供了多维度的标注支撑。此外,数据集覆盖英语、德语、法语、日语、韩语等多种语言,角色类型多样,具备跨语言与跨角色的泛化潜力。
使用方法
该数据集可直接用于文本到语音(TTS)模型的微调训练,通过读取captions字段中的结构化标注(GENERAL描述与SCRIPT分句脚本)作为条件输入,驱动模型生成带有指定情感与爆发音的语音。同时,音频分类任务可借助reward、voicenet_dims、emonet等数值型标签进行监督学习,评估不同语音表演维度的质量。研究者可依据rank字段筛选特定排名的样本,或根据lang、character字段按子集进行跨语言与角色适配的实验。数据以Parquet格式存储,推荐使用HuggingFace Datasets库加载,结合transformers或espnet等框架开展端到端建模。
背景与挑战
背景概述
MOSS Character Voices Top-3 Captioned数据集由LAION团队于近期创建,旨在解决文本到语音合成与音频分类领域中角色语音数据稀缺的问题。该数据集从原始的moss-character-voices-bestof64中精选约12900组语音片段,每组保留奖励模型评分最高的三份样本,总计约38700条,并配备两种互补的标注管线:一种是基于程序化规则的标签式描述,另一种由大型语言模型Gemma-4-E4B将标签转化为自然语言,同时精确保留语音爆发点的位置信息。这种双标注策略不仅提升了数据的可用性,还为语音合成中情感表达与角色一致性的研究提供了新的基准。数据集涵盖英语、德语、法语、日语和韩语等多语言场景,并附带丰富的元信息,包括VoiceNet维度、EmoNet情感评分及性别门控特征,为跨语言、多模态的语音生成模型训练奠定了坚实基础。
当前挑战
当前数据集面临的核心挑战在于多维度标注的一致性与语音生成的细粒度控制。首先,领域问题方面,文本到语音合成需要生成具有角色特定情感和爆发点的自然语音,而现有模型往往难以捕捉细微的语调变化与非言语声音(如笑声、叹息)的精确时机;该数据集通过提供高精度的程序化与LLM标注试图解决这一瓶颈,但双管线之间的差异可能引入标注歧义。其次,构建过程中,从约80000条原始数据中筛选出奖励模型排名前三的样本,需确保排名模型的公正性与泛化能力,避免因评分偏差导致优质样本被遗漏;此外,语音爆发点的注释依赖于多标签确认算法与时间戳对齐,这一步骤在处理快速变化的非言语要素时容易产生误差,尤其是在跨语言场景下,不同语言中爆发点的时间分布和语义角色差异显著,增加了标注一致性的维护难度。
常用场景
经典使用场景
该数据集的核心用途在于驱动文本到语音合成与语音情感分类的前沿研究。凭借其囊括近三万九千条精选角色语音样本的规模,每一条音频均配有程序化生成与大型语言模型润色的双通道描述文本,研究团队得以在精细粒度的语音控制与表达性合成任务上展开探索。具体而言,数据集内嵌的声带爆发音标注、情感维度分数以及角色属性元数据,使其成为训练具备丰富情感传递能力的语音合成模型的理想基石。研究者可直接利用其开箱即用的格式,在语音克隆、角色配音生成等场景中快速迭代模型,从而显著降低数据预处理的门槛并提升实验的可重复性。
解决学术问题
此数据集精准针对学术界在语音合成中发音表现力匮乏与控制力不足的长期痛点。传统数据集往往局限于中性情感的朗读风格,难以捕捉角色配音中多样的情感层次与突发声音事件。该集合通过引入奖励模型排序机制与专业配音标注管线,系统性地解决了如何量化并复现细腻语音表达这一核心难题。其双轨描述体系不仅为情感语音合成提供了监督信号,更为多模态情感识别研究开辟了新路径,使得模型能够从听觉与文本描述双重维度学习情感映射。这一突破极大地推动了从单一语音生成向语义与情感深度融合的范式转变。
衍生相关工作
该数据集的发布催生了多个经典的衍生研究工作。首当其冲的是基于双通道描述文本的对比学习框架,研究者将程序化描述的精确标签与大语言模型描述的流畅语句对齐,提出了一种新型的多视图语音表征学习方法,在语音情感检索与零样本情感合成任务中取得显著成效。另一项影响深远的工作是围绕声带爆发音的精确定位与插入机制,衍生出用于动态语音效果生成的条件扩散模型,该模型能够在对话中自然地插入笑声、叹气等非语言声音,极大提升了合成语音的真实感。此外,奖励模型排名的引入还激发了关于偏好对齐在语音生成中应用的研究浪潮,推动了高质量语音合成系统的评价体系革新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务