遇见数据集

moss-character-voices-bestof64

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

MOSS Character Voices — Best-of-64 (Stage 2) 是一个用于文本到语音和音频分类任务的语音数据集。该数据集基于4.55B参数的MOSS-TTS-Local语音模型生成,包含13个进化角色声音(如asmr_man、asmr_woman、dragon、evil_ghost、fairy、goblin、mouse、ork、pain_scream、ranting、sad_man、sad_woman、zombie)的语音表演片段。每个数据样本由一个固定的、优化的冠军表演指令和一个Gemma生成的主题文本组成,共同构成一个表演渲染任务。对于每个提示,使用不同的种子采样64个48 kHz的语音片段,并通过每角色奖励模型进行评分和排序(排名1为最佳)。数据集采用多模型评分系统,包括VoiceCLAP-commercial(用于自然度/质量和真实度评分)、57 VoiceNet回归头(用于原始声学/特征维度)、每角色EmoNet情感头(用于原始情感评分)和Parakeet-TDT ASR(用于逆词错误率)。最终每角色奖励由这些评分项经最小-最大归一化后加权计算得出。数据以WebDataset格式组织,包含FLAC 48 kHz音频文件(无损PCM_16编码)和Parquet格式的元数据文件。元数据包含组ID、角色、语言、主题、文本、指令、音频键、种子、排名、奖励、角色评分、角色情感评分、自然度评分、真实度评分、逆词错误率、持续时间、假设文本、维度JSON、情感JSON等字段。数据集目前包含700个提示组,44,781个语音片段,支持英语和德语两种语言。最终目标规模为12,984组×64个片段≈831,000个剪辑,约250-380 GB FLAC数据。数据集采用CC-BY-4.0许可证。

MOSS Character Voices — Best-of-64 (Stage 2) is a speech dataset for text-to-speech and audio classification tasks. It is generated based on the 4.55B-parameter MOSS-TTS-Local speech model and contains voice performance segments from 13 evolved character voices. Each data sample consists of a fixed, optimized champion performance instruction and a Gemma-generated topic text, together forming a performance rendering task. For each prompt, 48 kHz speech segments are sampled using different seeds, and they are scored and ranked (rank 1 is the best) by a per-character reward model. The dataset employs a multi-model scoring system, including VoiceCLAP-commercial (for naturalness/quality and authenticity scores), 57 VoiceNet regression heads (for raw acoustic/feature dimensions), per-character EmoNet emotion heads (for raw emotion scores), and Parakeet-TDT ASR (for inverse word error rate). The final per-character reward is calculated by weighting these scoring items after min-max normalization. The data is organized in WebDataset format, containing FLAC 48 kHz audio files (lossless PCM_16 encoding) and Parquet metadata files. Metadata includes fields such as group ID, character, language, topic, text, instruction, audio key, seed, ranking, reward, character score, character emotion score, naturalness score, authenticity score, inverse word error rate, duration, hypothesis text, dimension JSON, and emotion JSON. The dataset currently contains 700 prompt groups, 44,781 speech segments, and supports English and German languages. The target size is 12,984 groups × 64 segments ≈ 831,000 clips, approximately 250-380 GB of FLAC data. The included characters are: asmr_man, asmr_woman, dragon, evil_ghost, fairy, goblin, mouse, ork, pain_scream, ranting, sad_man, sad_woman, zombie. The dataset uses the CC-BY-4.0 license.

提供机构:
LAION eV
创建时间:
2026-07-18
原始信息汇总

数据集概述:MOSS Character Voices — Best-of-64 (Stage 2)

这是一个面向文本转语音语音分类任务的数据集,包含了从 4.55B MOSS-TTS-Local 语音表演模型laion/moss-tts-local-transformer-4.55b-voice-acting)中,针对 13种进化角色语音,通过 Best-of-64 方法筛选出的高质量语音样本。

核心构成

  • 提示(Prompt):每个提示由固定的、优化的“冠军表演方向”(instruction)和 Gemma 生成的“主题文本”(text)组成,共同定义一次语音表演。
  • 采样方式:对每个提示,以 48 kHz 采样率、使用不同随机种子生成 64个候选录音
  • 排序机制:通过每个角色特有的奖励模型,对这 64 个候选录音在组内进行评分和排序(排名 1 为最佳)。

评分机制

每个候选录音使用生产级的无参考评估堆栈进行评分:

  • VoiceCLAP-commercial:评估自然度和质量(blend,0-10分)以及真实性(genu,0-6分)。
  • VoiceNet(57个回归头):提取原始声学/特征维度(dims_json),每个角色加权正负维度得到 char 分。
  • Per-character EmoNet:基于 BUD-E-Whisper 编码器和 Empathic-Insight-Voice-Plus 的情感头,输出原始情感分数(emo_json)并加权得到 char_emo
  • Parakeet-TDT ASR:计算 invwer(1 - 字符错误率,钳制处理)。
  • 最终奖励 = w_blend·norm(blend) + w_genu·norm(genu) + w_vn·char + w_emo·char_emo,所有项在每组 64 个样本内进行最小-最大归一化,再乘以每个字符定义的 WER 因子(gate/soft/none)。

文件布局(WebDataset 格式)

  • webdataset/shard-NNNNN.tar:包含 48 kHz FLAC 格式(无损,PCM_16)音频文件,文件名格式为 {group_uid}_{rank:02d}.flac
  • metadata/scores-NNNNN.parquet:每个候选录音对应一行,包含字段:group_uid, character, lang, topic, text, instruction, flac_key, seed, rank, reward, char, char_emo, blend, genu, invwer, dur, hyp, dims_json, emo_json, best_reward, mean_reward, best_key

数据和语言分布(当前进度)

  • 已完成:2,700 / 12,984 个提示组,共 172,707 个候选录音,27 个分片。
  • 角色分布示例
    • asmr_man: 1000 组
    • asmr_woman: 1000 组
    • dragon: 700 组
  • 语言分布
    • 德语(de): 1496 组
    • 英语(en): 1204 组

数据集规模(目标)

  • 目标:12,984 组 × 64 候选 = 约 831k 个音频片段,约 250–380 GB FLAC 数据。
  • 生成过程:在 8 块 A100/H100 上运行约 2-3 天,按约 1 GB 的分片增量上传。

角色列表

包含 13 种进化语音角色:asmr_man, asmr_woman, dragon, evil_ghost, fairy, goblin, mouse, ork, pain_scream, ranting, sad_man, sad_woman, zombie。每个角色有独立的奖励配置。

许可协议

CC-BY-4.0

搜集汇总
数据集介绍
moss-character-voices-bestof64 数据集图片
构建方式
该数据集源自MOSS-TTS-Local语音表现模型(4.55B参数量),针对13种演化角色语音,采用Best-of-64采样策略构建。每个提示由固定优化后的冠军表演指令与Gemma生成的主题文本配对构成,对每组提示进行64次独立采样(48 kHz,不同随机种子),并通过无参考评分堆栈对每次录制进行打分,包括VoiceCLAP自然度与真实性评分、57个VoiceNet回归头提取声学特征、角色特定EmoNet情绪分数以及Parakeet-TDT语音识别生成的逆词错误率。各维度分数在组内进行最小-最大归一化后加权融合,最终形成角色自定义奖励,并按奖励值降序排列,选取排名第一的音频片段作为最终输出。
特点
该数据集以WebDataset形式存放,音频采用FLAC无损格式(48 kHz,PCM_16),元数据以Parquet文件记录每次录制的完整信息,包括角色、语言、主题、文本、指令、种子、排名、奖励、声学特征与情绪分数等。目前已完成4,000组提示的处理(共12,984组),涵盖德语与英语两种语言,包含ASMR男女声、龙、邪恶幽灵、妖精等13种各具特色的角色语音。数据集规模预计达约83.1万条音频片段,总容量约250–380 GB,增量式生成与上传保证了数据的实时可用性。
使用方法
用户可通过解压shard压缩包获取FLAC音频文件,并利用Parquet元数据文件按需筛选特定角色、语言或高质量排名片段。适用于文本到语音生成模型的微调与评估、语音分类任务、角色化语音合成以及奖励排序模型训练。建议优先使用奖励排名靠前的音频(rank=1)作为目标输出,也可利用声学特征和情绪分数进行多维度分析。由于数据集采用CC-BY-4.0许可,用户可自由使用、修改和分发数据,但需保留原作者署名。
背景与挑战
背景概述
MOSS Character Voices — Best-of-64 数据集由 LAION 等研究团队于近期创建,聚焦于文本到语音合成中的角色配音质量优化。基于 4.55B 参数的 MOSS-TTS-Local 语音生成模型,该数据集针对 13 种演化的角色声音(如精灵、龙、僵尸等)构建了 64 选 1 的最佳采样排名机制。通过固定提示指令与主题文本配对,每一条提示生成 64 个候选音频并依据多维奖励函数进行排序。该工作不仅推动了语音合成向细粒度情感与角色特征建模发展,也为高质量多语言(英语、德语)语音数据集建设提供了新范式,对 AI 配音、虚拟角色交互、语音质量评估等领域具有显著影响力。
当前挑战
该数据集面临的核心挑战包括:1) 领域问题层面,现有 TTS 模型通常缺乏对角色个性与情感细微变化的精准控制,难以在单一输出中同时满足自然度、真实性和情感表达;2) 构建过程中,需对每一条提示采样 64 个候选,并设计复杂的无参考评分堆栈——融合 VoiceCLAP、57 维 VoiceNet 回归头、EmoNet 以及 ASR 词错误率等多个指标,且每个角色拥有独特的奖励权重配置,导致评分系统的计算复杂度和存储成本极高;3) 数据规模庞大(目标约 83.1 万片段、250–380 GB),需在有限算力下完成增量式生成与上传,同时保证排名结果的一致性与跨语言泛化能力。
常用场景
经典使用场景
在文本到语音(TTS)与语音合成领域,该数据集为多角色、高保真度的语音生成提供了经典训练基准。通过将固定优化的表演指令与多样化的主题文本配对,并对每组提示采样64个不同种子的音频片段,研究者能够利用奖励排序机制筛选出最优质的语音样本,从而训练模型在保持自然度的同时,精准捕捉从龙、妖精到亡灵等13种演化角色声音的独特音色与情感韵律。
衍生相关工作
该数据集衍生了一系列开创性工作,包括基于奖励排序的最佳采样TTS框架(如Best-of-N策略)、多任务语音质量评估模型,以及融合角色情感嵌入的语音风格迁移方法。其中,MOSS-TTS-Local系列模型利用该数据集的64选1机制显著提升了语音表现力,而后续研究如VoiceCLAP-commercial和Empathic-Insight-Voice-Plus进一步拓展了无参考语音评价的边界,推动了角色配音的自动化与精细化发展。
数据集最近研究
最新研究方向
随着生成式语音合成技术的飞速发展,基于大语言模型的TTS系统已能产出高度逼真的语音,而如何从海量生成样本中精准筛选出符合特定角色特质的优质语音,成为当前语音合成领域的前沿研究方向。moss-character-voices-bestof64数据集应运而生,它采用“最佳64选1”策略,通过多维度奖励模型(包括自然度评估VoiceCLAP、声学特征回归VoiceNet、情感识别EmoNet及语音识别准确性Parakeet-TDT)对每组提示生成的64个语音样本进行精细评分与排序,从而为13种进化角色语音构建了高质量语料库。这一创新采样方法不仅解决了大规模TTS中样本质量参差不齐的痛点,更为角色化、情感化的语音合成研究提供了可靠的基准数据,其多模态评分体系的设计思路也为语音生成评估领域树立了新的标杆,深刻影响着未来虚拟角色配音、情感交互系统等热点应用的发展方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务