遇见数据集

moss-voice-identity-repairs

收藏
Hugging Face2026-08-15 更新2026-08-16 收录
官方服务:

资源简介:

MOSS voice-acting v2 是一个用于文本转语音(TTS)任务的数据集,由 LAION 和 MOSS 项目构建。该数据集专注于修复原始语料库中说话人相似度较低的音频片段。对于每个说话人配置文件,所有原始音频中 ECAPA 说话人相似度低于 0.40 的片段,都使用该说话人的身份 LoRA(来自 laion/moss-voice-identity-loras)以 1.0 的尺度合并到相同的条件适配器上重新生成。原始片段未被替换,低相似度片段仍保留在语料库中,因为它们对于无参考音频训练具有独立用途。数据集采用 WebDataset 格式组织,每个说话人目录包含多个 shard 文件(.tar,包含 MP3 音频和 JSON 元数据)、一个 annotations.parquet 文件(每行对应一个修复片段)和一个 report.json 文件(前后对比及成本报告)。数据字段分为三组:src_* 组存储原始片段的完整注释(包括各种评分分量如 strength_raw、w_blend、z_containment、contained、dur、wer、spk_sim 等),org_* 组存储原始音频通过相同传感器栈(ECAPA、WavLM-tbr、Whisper-large-v3-turbo 等)重新评分的结果,rep_* 组存储修复后音频的相同评分。此外还包含原始和修复后的说话人嵌入(ECAPA,float16)、修复后音频的 TBR 嵌入(WavLM-tbr,float16),以及修复使用的适配器名称、SHA、尺度和 epoch 信息。每个音频键为 <gid>.cNNN.mp3,不唯一,需与 run_dir 联合使用以确保唯一性。

MOSS voice-acting v2 is a dataset for text-to-speech (TTS) tasks, built by LAION and the MOSS project. It focuses on repairing audio clips with low speaker similarity in the original corpus. For each speaker profile, all original audio clips with ECAPA speaker similarity below 0.40 are regenerated using the speakers identity LoRA (from laion/moss-voice-identity-loras) merged with a scale of 1.0 onto the same condition adapter. The original clips are not replaced; low-similarity clips are retained in the corpus because they have independent uses for reference-free audio training. The dataset is organized in WebDataset format, with each speaker directory containing multiple shard files (.tar with MP3 audio and JSON metadata), an annotations.parquet file (one row per repaired clip), and a report.json file (before/after comparison and cost report). Data fields are divided into three groups: src_* stores full annotations of original clips (including various score components such as strength_raw, w_blend, z_containment, contained, dur, wer, spk_sim, etc.), org_* stores re-scored results of original audio through the same sensor stack (ECAPA, WavLM-tbr, Whisper-large-v3-turbo, etc.), and rep_* stores the same scores for repaired audio. Additionally, it includes original and repaired speaker embeddings (ECAPA, float16), TBR embeddings of repaired audio (WavLM-tbr, float16), and the adapter name, SHA, scale, and epoch used for repair. Each audio key is <gid>.cNNN.mp3, not unique, and must be combined with run_dir to ensure uniqueness.

提供机构:
LAION eV
创建时间:
2026-08-15
原始信息汇总

数据集概述

MOSS voice-acting v2 -- repaired takes 是一个用于文本到语音(TTS)任务的语音数据集,由 LAION 发布,采用 Apache-2.0 许可证。该数据集专注于说话人身份(speaker identity)的语音修复,是 MOSS 配音语料库的补充版本。

核心内容

  • 修复目标:对于每个声音档案(voice profile),所有与参考音频的 ECAPA 说话人相似度低于 0.40 的录音(take),使用该声音的身份 LoRA(见 laion/moss-voice-identity-loras)以 1.0 的缩放比例合并到相同的条件适配器上重新生成。
  • 原始数据保留:原始录音保持不变,仍保留在语料库中。低相似度的录音被有意保留,因为它们对于无需参考音频的训练仍然有用。

数据布局

每个声音档案(voice)的目录结构如下:

  • <voice>/part-<shard>-<chunk>.tar:WebDataset 格式,包含 <key>.mp3(160 kbps, 48 kHz)和 <key>.json 文件。
  • <voice>/annotations.parquet:每个修复后录音的一行记录。
  • <voice>/report.json:该声音的修复前后对比及成本报告。

数据列说明

每一行包含三组独立的列,且各组之间不存在派生关系:

  • src_*:原始录音在语料库中存储的完整注释,包含所有评分组件(strength_raww_blendz_containmentcontaineddurwerspk_sim、z 项及乘法因子),便于后续无需重新生成即可进行重排序。
  • org_*:原始音频在相同的传感器栈(ECAPA、WavLM-tbr、Whisper-large-v3-turbo、语料库的快速评分器)下重新评分的结果。由于原始存储的 WER 来自 Parakeet,与 Whisper WER 不可比,因此对修复前音频进行重新测量。
  • rep_*:修复后的音频,采用与修复前相同的测量方式。

此外还包括:

  • src_spk_emb / rep_spk_emb:ECAPA 说话人嵌入(float16)。
  • rep_tbr_emb:WavLM-tbr 嵌入(float16)。
  • repair_adapterrepair_adapter_sharepair_scalerepair_epoch:记录每个录音使用的确切权重信息。

关键注意事项

  • audio_key 格式为 <gid>.cNNN.mp3,在多次运行中不唯一
  • run_dir 存储在 audio_key 旁边,所有连接操作必须同时使用这两个字段。
搜集汇总
数据集介绍
moss-voice-identity-repairs 数据集图片
构建方式
在语音合成与克隆领域,说话人身份一致性是评估合成质量的核心维度。该数据集针对原始语料中ECAPA说话人相似度低于0.40的语音片段,利用每个语音档案对应的身份LoRA(以`laion/moss-voice-identity-loras`为来源)在相同条件适配器与相同权重下进行重新生成,从而修复身份相似度不足的片段。原始片段被完整保留,修复片段以增量方式加入,形成包含8,177,013条修复语音、覆盖499个语音档案的大规模语料。构建过程中,每个修复片段均经过字节级校验,并同步生成包含125列的标注文件与报告文件,确保数据可追溯、可复现。
使用方法
使用该数据集时,需通过`wds_key`将Parquet标注与WebDataset分片中的音频成员进行关联,建议采用流式遍历tar文件的方式高效读取。音频文件为双声道MP3,实际为单声道复制,主流解码库(如soundfile、librosa、torchaudio、ffmpeg)可正确处理,但需避免手写帧读取器导致的时间拉伸问题。标注中的`rep_*`列应与`org_*`列对比以评估修复效果,而非与`src_*`列直接比较。若需MOSS编解码令牌,可转向`laion/laion-voice-profiles-annotated`数据集的`origin=repair`分区,或从MP3自行编码。每条修复片段均记录`repair_adapter_sha`,确保权重可追溯。
背景与挑战
背景概述
语音合成领域长期面临身份一致性难以维持的困境,尤其在零样本克隆与情感表达并存时,参考音色往往被内容或风格所侵蚀。2026年,LAION团队发布moss-voice-identity-repairs数据集,针对MOSS语音表演语料库中ECAPA说话人相似度低于0.40的片段,利用身份LoRA进行修复性重生成,覆盖499个声音档案、817万余条修复样本,音频总量达1.29TB。该工作直面大规模语音数据中低相似度样本的再利用问题,为语音克隆、说话人验证及多语言TTS研究提供了可复现的修复范式与丰富的并行标注,对推动数据-centric的语音生成研究具有标志性意义。
当前挑战
该数据集所应对的核心挑战在于说话人身份保持与情感、韵律、可懂度之间的内在张力。修复过程虽将ECAPA相似度从0.266提升至0.487,却以牺牲目标情感强度、混合度、自然度及词错误率为代价,揭示了身份增益并非免费。构建层面,项目需处理千万级音频的分布式生成、跨集群字节级校验、以及两阶段上传中文件完整性追踪;更关键的是,0.40阈值仅为项目内部标度,独立WavLM-tbr嵌入器显示约四分之三被标记为失败的样本实际高于其同说话人阈值,且缺乏逐声音对照导致修复效应与均值回归难以剥离,这些均对数据解读与后续建模构成持续挑战。
常用场景
经典使用场景
在语音合成与说话人建模领域,该数据集最经典的使用场景在于为低相似度合成语音提供身份修复与音色克隆训练素材。研究者可借助其中带有身份LoRA修复的语音片段,开展参考音频缺失条件下的说话人身份保持建模,或利用配对的原音与修复音进行细粒度音色相似度判别训练。每一条修复语音均附带ECAPA与WavLM-tbr嵌入向量,使得基于嵌入的对比学习、身份一致性评估等任务得以高效展开。
解决学术问题
该数据集直面语音合成研究中长期存在的身份漂移与音色失配问题,即合成语音与目标说话人参考之间的相似度显著下降。它通过大规模修复样本及完整的前后测评分值,为量化身份修复的代价与收益提供了实证基础,并澄清了相似度阈值并非普适感知事实这一争议。其意义在于推动说话人身份保持研究从孤立指标走向兼顾情感强度、可懂度与自然度的多目标权衡分析。
实际应用
在实际应用中,该数据集可用于构建具备稳定音色表现的多说话人语音合成系统,尤其适用于有声内容创作、虚拟角色配音及个性化语音助手等需要长期维持身份一致性的场景。修复后的语音可直接用于微调或评估TTS模型的说话人编码器,亦可作为数据增强资源,提升系统在参考音频缺失条件下的鲁棒性。其附带的代价报告为工业级部署中的质量与成本平衡提供了决策依据。
数据集最近研究
最新研究方向
在语音克隆与身份保持的交叉领域,该数据集推动了基于低秩适配器(LoRA)的说话人身份修复研究。针对ECAPA相似度低于0.40的生成语音,研究者通过将身份LoRA与条件适配器融合,实现了相似度从0.266到0.487的显著提升,并使超过阈值样本占比从0.2%跃升至72.5%。前沿方向进一步关注修复代价的量化——如目标情感强度下降0.338、WER上升0.252——以及跨嵌入器(ECAPA与WavLM-tbr)的评估一致性。该工作为大规模TTS语料的质量控制与再生提供了可复现的基准,并引发了对身份-表达权衡的深入探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务