遇见数据集

laion/moss-character-voices-bestof64

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

MOSS角色声音—最佳64(第二阶段)数据集是一个用于文本到语音(TTS)和音频分类任务的语音数据集,主要包含英语和德语内容。该数据集基于4.55B参数的MOSS-TTS-Local语音表演模型生成,涵盖了13个进化角色声音(如asmr_man、asmr_woman、dragon等)的语音样本。每个提示由一个固定的优化表演方向和Gemma生成的主题文本组成,每个提示采样64个不同的语音样本(使用不同种子生成,采样率为48 kHz)。每个样本通过多个评分模型(包括VoiceCLAP-commercial、57 VoiceNet、Per-character EmoNet和Parakeet-TDT ASR)进行评分,并根据每个角色的奖励值在组内排名(排名1为最佳)。数据以WebDataset格式组织,包括FLAC格式的音频文件和Parquet格式的元数据文件,其中元数据包含样本的详细信息如角色、语言、文本、排名、奖励值等。数据集规模目标为12,984组提示(约831,000个样本),占用约250-380 GB存储空间。许可证为CC-BY-4.0。

The MOSS Character Voice — Best 64 (Phase 2) Dataset is a speech dataset tailored for text-to-speech (TTS) and audio classification tasks, primarily consisting of English and German content. Generated based on the MOSS-TTS-Local speech performance model with 4.55 billion parameters, this dataset encompasses speech samples from 13 evolutionary character voices including asmr_man, asmr_woman, dragon, and others. Each prompt is composed of a fixed optimized performance direction and topic text generated by Gemma, with 64 distinct speech samples sampled per prompt (generated using different seeds, with a sampling rate of 48 kHz). Every sample is evaluated by multiple scoring models, namely VoiceCLAP-commercial, 57 VoiceNet, Per-character EmoNet, and Parakeet-TDT ASR, and ranked within its group based on the reward value of the corresponding character, where rank 1 denotes the highest quality. The dataset is structured in WebDataset format, comprising FLAC-encoded audio files and Parquet-format metadata files. The metadata includes detailed sample information such as character, language, source text, rank, reward value, and more. The target scale of the dataset is 12,984 prompt groups (approximately 831,000 total samples), occupying approximately 250–380 GB of storage space. The dataset is licensed under CC-BY-4.0.

提供机构:
laion
搜集汇总
数据集介绍
laion/moss-character-voices-bestof64 数据集图片
构建方式
本数据集基于MOSS-TTS-Local语音表演模型(4.55B参数),针对13种演化角色语音,采用Best-of-64采样策略构建。每个提示由固定的冠军表演指令与Gemma生成的文本主题组成,构成单一表演内容。对于每个提示,模型以48kHz采样率、不同随机种子生成64个表演片段,随后通过生产级无参考评估堆栈对每个片段进行评分,并依据每个角色的独立奖励函数对组内64个片段进行排名(排名第1为最优)。评分体系融合了VoiceCLAP的自然度与真实性评分、57个VoiceNet回归头的声学特征维度、每个角色专属的EmoNet情感头评分,以及Parakeet-TDT的ASR词错误率,最终经组内最小-最大归一化后加权求和,并乘以WER因子得到各片段的奖励值。
使用方法
用户可通过WebDataset库高效加载分布于多个tar分片中的FLAC音频文件,每个文件按组唯一标识与组内排名命名。配套的Parquet元数据文件提供了与音频一一对应的结构化信息,包括角色、语言、提示文本、种子、排名、奖励值、声学与情感特征向量等,便于进行特征分析或筛选高质量子集。研究人员可直接将排名第1的片段作为高质量语音合成训练数据,或利用组内排名与奖励值进行基于人类偏好对齐的强化学习研究。同时,13种角色设定与双语言覆盖使得该数据集适用于多角色、多语种的文本转语音系统开发与评估任务,亦可用于语音情感识别与分类模型的训练与基准测试。
背景与挑战
背景概述
MOSS Character Voices — Best-of-64 数据集由 LAION 研究机构于近期创建,旨在推动文本到语音(TTS)和语音角色扮演领域的模型性能提升。该数据集基于 4.55B 参数的 MOSS-TTS-Local 语音扮演模型,针对13种演化角色声音(如龙、妖精、僵尸等)生成高质量语音样本。核心研究问题在于如何通过最佳采样策略(Best-of-64)从大量候选音频中筛选出最优的语音表现,以提高 TTS 输出的自然度、真实感和情感表达。通过结合 VoiceCLAP、VoiceNet 和 EmoNet 等多维度评分机制,该数据集为语音合成和音频分类任务提供了宝贵的训练与评估资源,对多角色语音生成和情感计算领域产生了重要影响。
当前挑战
该数据集所解决的领域挑战包括:语音合成中自然度与真实感的平衡问题,尤其在多角色和情感丰富的场景下,传统 TTS 模型难以生成与角色设定一致且情感饱满的语音。此外,数据集的构建过程也面临诸多挑战:首先,需要为每个角色设计并优化特定的表演指令(instruction)和话题文本(text),以确保生成内容的一致性和多样性;其次,对每个提示采样64个候选片段,并使用多维度评分系统(包括声学特征、情感识别和 ASR 验证)进行排序,计算复杂度高且需精细调整权重;最后,数据集规模达83万段音频,生成过程需在8块 A100/H100 GPU 上持续2-3天,对计算资源和存储管理提出了极高要求,同时需确保数据上传和元数据同步的可靠性。
常用场景
经典使用场景
MOSS Character Voices Best-of-64 数据集的核心使用场景聚焦于文本到语音(TTS)合成中的高质量角色配音生成。该数据集通过13种精心设计的角色声音(如龙、妖精、亡灵等)与优化的表演指导指令相结合,为每一条提示采样64个不同种子的音频片段,并依据多维度奖励机制(包括自然度、情感真实度、声学特征及词错误率)进行排序,以优中选优的方式筛选出最佳配音。这一设计使得研究者能够利用丰富的配对数据训练更具表现力和可控性的TTS模型,尤其适用于角色扮演游戏、有声读物和虚拟助手等多变语音风格需求场景。
解决学术问题
该数据集解决了TTS领域长期存在的角色声音多样性不足与质量评估标准缺失的学术难题。传统TTS数据集多集中于中性或单一风格的语音,难以捕捉戏剧化角色配音中的微妙情感和音色变化。MOSS通过引入VoiceCLAP、VoiceNet和EmoNet等非参考评价指标,构建了综合奖励函数,实现了对语音自然度、情感真实性和声学一致性的精准量化,从而为研究如何从海量候选中自动筛选高保真角色语音提供了标准化基准。其影响在于推动了情感语音合成和表征学习的前沿探索,为跨语言(英语和德语)语音生成研究奠定了数据基础。
实际应用
在实际应用中,该数据集可赋能于游戏开发、交互式叙事和智能客服等需要角色化语音的产业。例如,开发者可利用其中的龙或恶魔等独特声音数据训练TTS引擎,为虚拟角色注入个性化音色,从而提升游戏角色的沉浸感;在数字人技术中,基于该数据的模型能生成带有愤怒或悲伤语调的语音,改善人机交互的亲和力。此外,其大规模、高质量的多语言配音样本还适用于语音增强、说话人验证和情感识别等任务的迁移学习,加速低资源语言的角色语音系统落地。
数据集最近研究
最新研究方向
在语音合成与角色配音领域,基于大规模奖励排序机制的文本到语音(TTS)数据集的构建正成为前沿热点。MOSS Character Voices Best-of-64 数据集通过采样式最佳选择(Best-of-64)方法,结合多维度无参考评分网络(如VoiceCLAP、VoiceNet、EmoNet及ASR校正),为13种演化角色配音提供了高达64次采样的精细排名。该工作不仅推动了高质量、个性化和情感驱动的语音生成研究,其引入的奖励工程与角色定制策略与当前多模态大模型中的偏好对齐技术一脉相承,为游戏、虚拟现实及交互式叙事中的动态语音合成奠定了新基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务