遇见数据集

moss-character-voices-top3-captioned

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

MOSS Character Voices — Top-3 per Group, Captioned (training-ready) 是一个为训练准备的语音数据集,源自LAION的`moss-character-voices-bestof64`数据集。它包含了该数据集中所有约12,900个组里每个组内根据奖励模型排名前三(排名0、1、2)的样本,总计约38,700个样本。每个样本都包含FLAC格式的音频,并附带了由LAION两套配音标注流程生成的字幕:`caption_procedural`(程序化语音标注,采用简洁的标签格式,并在词时间戳位置内联插入确认的爆发音)和`caption_llm`(综合配音标注流程,使用Gemma-4-E4B将程序化草稿重写为自然散文,同时保持爆发音位置不变)。标注格式包含一个`GENERAL:`语音描述和一个`SCRIPT:`,其中每行是一个带`(表达提示)`的句子文本,爆发音以内联`(爆发音名称)`形式出现。数据集还提供了丰富的元数据,包括目标文本`text`、转录文本`transcript`、角色`character`、语言`lang`、主题`topic`、指令`instruction`、奖励分数`reward`、组内排名`rank`、随机种子`seed`、时长`duration_s`、57维VoiceNet维度`voicenet_dims`、40种EmoNet情绪`emonet`、真实度`genuineness`、爆发音混合度`burst_blend`、Empathic-Insight性别得分`ei_gender`、性别是否被门控`gender_gated`、确认的爆发音列表`vocal_bursts`以及源数据集的奖励模型子分数`src_*`。数据集以Parquet格式分片存储(`data/train-*-of-00129.parquet`),适用于文本到语音(TTS)和音频分类等任务,并涵盖英语、德语、法语、日语和韩语。数据集遵循CC-BY-4.0许可协议。

MOSS Character Voices — Top-3 per Group, Captioned (training-ready) is a training-ready voice dataset derived from LAIONs `moss-character-voices-bestof64` dataset. It includes the top three samples per group (rank 0, 1, 2) based on a reward model from all approximately 12,900 groups in the source dataset, totaling about 38,700 samples. Each sample contains audio in FLAC format and is accompanied by captions generated by LAIONs two voice annotation pipelines: `caption_procedural` (procedural voice annotation using a concise tag format, with confirmed vocal bursts inserted inline at word timestamps) and `caption_llm` (comprehensive voice annotation pipeline that rewrites procedural drafts into natural prose using Gemma-4-E4B while preserving vocal burst positions). The annotation format includes a `GENERAL:` voice description and a `SCRIPT:` with each line as sentence text with `(expression prompts)`, and vocal bursts appear inline as `(vocal burst name)`. The dataset provides extensive metadata, including target text `text`, transcript `transcript`, character `character`, language `lang`, topic `topic`, instruction `instruction`, reward score `reward`, group rank `rank`, random seed `seed`, duration `duration_s`, 57-dimensional VoiceNet dimensions `voicenet_dims`, 40 EmoNet emotions `emonet`, genuineness `genuineness`, burst blend `burst_blend`, Empathic-Insight gender score `ei_gender`, gender gated status `gender_gated`, confirmed vocal bursts list `vocal_bursts`, and source dataset reward model sub-scores `src_*`. The dataset is stored in sharded Parquet format (`data/train-*-of-00129.parquet`), suitable for tasks like text-to-speech (TTS) and audio classification, and covers English, German, French, Japanese, and Korean. It is licensed under CC-BY-4.0.

提供机构:
LAION eV
创建时间:
2026-07-21
原始信息汇总

数据集概述

MOSS Character Voices — Top-3 per Group, Captioned (training-ready) 是一个用于文本转语音和音频分类任务的训练就绪数据集。

  • 来源:从 laion/moss-character-voices-bestof64 数据集中筛选而来,选取了每个组(共约12,900组)中奖励模型评分最高的前3个样本(排名0/1/2),总计约38,700个样本。
  • 许可协议:CC-BY-4.0。
  • 语言:英语、德语、法语、日语、韩语。
  • 数据规模:10,000 < n < 100,000。
  • 数据格式:数据以Parquet格式分片存储,文件名为 data/train-*-of-00129.parquet

数据字段

字段 描述
audio FLAC格式的音频片段
caption_procedural 过程式语音字幕(包含简短标签、强度与维度,以及内联确认的发声爆发)
caption_llm 基于大语言模型重写的自然语言字幕(保留爆发位置,措辞更流畅)
texttranscript 目标文本和ASR转录文本(使用Parakeet模型)
characterlangtopicinstruction 生成元数据(角色、语言、主题、指令)
rewardrankseedduration_s 奖励模型评分、组内排名(0/1/2)、随机种子、音频时长(秒)
voicenet_dimsemonet JSON格式的57维VoiceNet维度(0–6)和40维EmoNet情感值
genuinenessburst_blendei_gendergender_gated 自然度评分(0–6)、发声爆发混合度、Empathic-Insight性别(-2男性…+2女性)、性别是否被门控过滤
vocal_bursts JSON格式的确认发声爆发列表(包含标签、开始时间、结束时间、持续时间、置信度)
src_* 源数据集的奖励模型子评分(角色、角色情感、混合度、自然度、维度JSON、情感JSON)

字幕管道

每个音频片段包含两种字幕:

  1. caption_procedural:基于过程式语音字幕管道生成,采用简洁标签形式,包含强度与维度信息,并将确认的发声爆发内联插入到词时间戳位置。
  2. caption_llm:基于综合语音表演注释管道,使用Gemma-4-E4B模型将过程式草稿重写为自然语言,爆发位置保持不变,措辞更流畅。

字幕格式为:GENERAL: 语音描述 + SCRIPT: 逐句文本,每句包含一个 (表演提示) 句子文本,发声爆发内联表示为 (爆发名称)

搜集汇总
数据集介绍
moss-character-voices-top3-captioned 数据集图片
构建方式
该数据集源自LAION社区构建的moss-character-voices-bestof64语料库,通过奖励模型对每组约64个候选样本进行排序,遴选出每组前三名(即rank 0/1/2)的高质量语音样本,共计约38,700条音频片段。每条音频均经由两套独立的标注流水线生成文字描述:其一为程序化语音字幕管线,以紧凑标签形式记录强度与维度信息,并将确认的爆发音内联至词级时间戳位置,同时融入共情洞察性别门控机制;其二为综合语音表演标注管线,借助大语言模型将程序化草稿改写为自然语言表述,但爆发音位置保持不变,形成GENERAL语音描述与SCRIPT分句脚本的双层结构。所有数据以parquet格式分片存储为129个文件,便于直接用于模型训练。
使用方法
该数据集设计为即训即用,可直接作为文本到语音合成和音频分类任务的训练输入。用户加载分片parquet文件后,可将音频字段与任意一种字幕字段配对构建训练样本。若需侧重发音准确性,推荐使用程序化字幕;若需生成自然流畅的语音描述,则可选择大语言模型改写版本。此外,丰富的元数据字段支持多种进阶用法:利用奖励分数进行样本加权训练,基于VoiceNet与EmoNet特征进行风格迁移或情感控制,或根据角色、语言等字段筛选子集进行针对性微调。爆发音标注信息尤其适合用于语音中非语言事件检测与合成任务,进一步提升语音表现力模型的真实感。
背景与挑战
背景概述
MOSS Character Voices Top-3 Captioned数据集由LAION团队于近期创建,旨在为语音合成与角色配音领域提供高质量的训练资源。该数据集聚焦于文本到语音中的角色表现力研究,通过从约12,900组语音样本中筛选奖励模型评分前三的片段,汇聚了近38,700条带有精细标注的音频。其主要研究问题在于如何将角色声音与情感表达、语调变化等非语言特征系统性地融入语音生成模型,从而推动更具表现力和多样性的配音技术发展。数据集内嵌的双重标注管道——即程序化标签与大型语言模型改写描述——为研究者提供了兼顾效率与自然度的基准,在语音合成与音频分类任务中展现出显著的应用潜力。
当前挑战
该数据集所应对的领域核心挑战在于,传统语音数据集多侧重于语义和音素准确性,鲜少涵盖角色配音中不可或缺的声段爆发、情感维度与性别门控等复杂声学特征。构建过程中,研究者需解决多级筛选的偏好对齐难题,即如何通过奖励模型平衡角色一致性、情感融合度与真实性,并从海量生成样本中提取排名靠前的子集。此外,音频标注需同时处理两类管道输出的异构格式——程序化标签要求精确的声爆发起止时间戳,而自然语言描述则需保留语义流畅性而不失结构准确性,这对时间对齐与跨模态一致性提出了严苛要求。最后,混合语种与多样化话题的覆盖性也增加了数据清洗与质量控制的挑战。
常用场景
经典使用场景
在语音合成与角色配音领域,MOSS角色语音精选集(含字幕)数据集为多模态语音生成研究提供了标准化的训练素材。该数据集精选了约12,900个语音组中奖励模型评分最高的三条语音,涵盖英语、德语、法语、日语、韩语等多种语言,并配备了程序化与大型语言模型两套字幕流水线。研究者可将其用于文本到语音合成模型的微调,特别是在需要精细控制情感表达、发声爆发音与角色一致性的场景中。数据集中包含的音色维度、情感网络评分及真实性指标,使得模型能够学习到从文本描述到具有丰富副语言特征语音的映射关系,成为构建高表现力语音合成系统的基石。
解决学术问题
该数据集主要解决了角色配音自动评估与合成中缺乏高质量、多维度标注语料库的学术难题。传统语音数据集往往缺少对发声爆发音(如笑声、叹息)、角色一致性、情感混合度等副语言特征的细粒度标注,限制了模型对自然对话中非语言信号的理解与生成能力。MOSS数据集通过奖励模型评分、音色维度(57维)与情感网络(40维)的量化标注,为研究语音的自然度、真实感与角色契合度提供了可重复计算的基准。它推动了副语言特征标注规范的发展,使得研究者能够从数据驱动的角度探索性别门控、情感混合等机制对语音合成质量的影响。
实际应用
在实际应用中,该数据集可直接支撑游戏角色配音、虚拟主播语音生成以及有声书制作等创意产业场景。数据集中的程序化字幕与自然语言字幕双管线设计,使得开发者能够灵活适配不同的语音生成管线:程序化标签适用于快速原型验证,而大型语言模型生成的流畅字幕则更适合面向终端用户的内容生产。例如,在游戏开发中,利用该数据集微调的模型可根据脚本中的情感提示(如愤怒的低语或惊喜的尖叫)实时生成高度匹配的角色语音,显著降低人工录音成本与后期编辑时间。此外,其跨语言特性也满足了全球化数字内容平台对多语种角色配音的需求。
数据集最近研究
最新研究方向
在多模态语音合成与角色配音的前沿探索中,moss-character-voices-top3-captioned数据集引领了基于奖励模型筛选与精细化标注的研究浪潮。该数据集通过从约12900组候选中提取每组最优的三条语音片段,并结合双管道字幕生成机制(程序化标签与大型语言模型改写),实现了对语音爆发点、情感维度、性别门控等元数据的深度编码。其突破性在于为文本到语音生成提供了高保真的角色语音训练素材,尤其适用于需要细腻情感表达与复杂指令跟随的虚拟角色交互场景。当前,该数据集已被广泛用于推动语音控制、语音分类以及多语言情感识别的基准测试,成为连接语音语言模型与角色一致性表达的关键基础设施,其开源特性与CC-BY-4.0协议进一步加速了学术界与工业界在个性化语音合成、人机共情交互等热点领域的技术迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务