laion-voice-profiles-annotated
收藏资源简介:
LAION Voice Profiles — Annotated 是一个大规模合成语音数据集,由 Christoph Schuhmann 和 LAION 团队创建,采用 CC-BY-4.0 许可。数据集包含 28,212,933 条语音(总计 71,056 小时),由 500 个不同的语音角色生成,每个角色通过一个固定的 842 个命名表演条件矩阵驱动。语音为英文和德文的合成语音表演。每条语音都带有丰富的标注:40 种情绪强度(来自 Empathic-Insight 模型)、57 种感知声音维度(VoiceNet 回归与分类)、4 个音频质量分数、发声爆发检测(含时间戳和标签)、词级强制对齐、MOSS 音频编码标记(uint16 [T, 12])、768 维说话人/风格嵌入(vCLAP),以及 16 种不同风格和详细程度的程序化生成标题(从简洁到详尽)。数据分为两个来源:'original'(基础运行,20,079,381 条,54,943 小时)和 'repair'(修复运行,8,133,552 条,16,113 小时),后者替换了基础运行中身份检查失败的样本。数据集适用于文本到语音(TTS)、音频分类、语音情感识别、语音属性分析、语音角色生成等任务。数据以索引 parquet 文件(205 列)、WebDataset shards(包含 MP3 音频、JSON 元数据、MOSS 标记和 vCLAP 嵌入)、以及统计信息文件的形式提供。注意:所有标注均为机器生成,包含已知的修正(如半速解码错误、标题极性修正、情绪子句重新生成等),详细信息请参考 README 的已知问题部分。
LAION Voice Profiles — Annotated is a large-scale synthetic speech dataset created by Christoph Schuhmann and the LAION team, licensed under CC-BY-4.0. The dataset contains 28,212,933 utterances (totaling 71,056 hours) generated by 500 different voice personas, each driven by a fixed 842 named performance condition matrix. The speech consists of synthetic speech performances in English and German. Each utterance is richly annotated with: 40 emotion intensities (from the Empathic-Insight model), 57 perceived voice dimensions (VoiceNet regression and classification), 4 audio quality scores, vocal burst detection (with timestamps and labels), word-level forced alignment, MOSS audio encoding tokens (uint16 [T, 12]), 768-dimensional speaker/style embeddings (vCLAP), and 16 programmatically generated captions of varying styles and detail levels (from concise to exhaustive). The data is split into two sources: original (base run, 20,079,381 utterances, 54,943 hours) and repair (repair run, 8,133,552 utterances, 16,113 hours), with the latter replacing samples that failed identity checks in the base run. The dataset is suitable for tasks such as text-to-speech (TTS), audio classification, speech emotion recognition, speech attribute analysis, and voice persona generation. Data is provided in the form of index parquet files (205 columns), WebDataset shards (containing MP3 audio, JSON metadata, MOSS tokens, and vCLAP embeddings), and statistics files. Note: All annotations are machine-generated and include known corrections (e.g., half-speed decoding errors, caption polarity corrections, emotion clause re-generation, etc.). For details, refer to the Known Issues section of the README.
数据集概述
LAION Voice Profiles — Annotated 是一个大规模合成语音数据集,包含 28,212,933 条语音片段,总时长 71,056 小时,涵盖英语和德语,由 500 个不同声音档案 生成。每个声音档案通过同一固定的 842 个命名表演条件矩阵 驱动,生成具有丰富标注的语音数据。
数据组成
| 来源 | 描述 | 片段数 | 小时数 | 声音数 | 分片数 |
|---|---|---|---|---|---|
original |
基础运行 — 模型生成的所有候选片段 | 20,079,381 | 54,943 | 500 | 2,000 |
repair |
修复运行 — 未通过身份检查的片段重新生成 | 8,133,552 | 16,113 | 498 | 29,956 |
注意:
repair运行是对original中失败片段的部分重做,不是独立样本。修复行会取代相同(voice, gid, audio_key)的原始行。
标注信息
每条语音片段包含以下标注:
- 40 个情绪强度(Empathic-Insight 模型,0–7 分)
- 57 个感知声音维度(VoiceNet 模型,回归值与分类桶)
- 4 个音频质量指标
- 声带爆发检测(带时间戳与标签)
- 词级强制对齐(单词时间戳)
- MOSS 音频编解码器 token(
uint16 [T, 12]) - 768 维说话人/风格嵌入(VoiceCLAP)
- 16 个程序化生成的标题(不同模板与风格)
声音档案来源
500 个声音档案从 6,064 个参考声音池中精选,依据质量门槛、DNSMOS 分数、性别与语言配额、以及 VoiceNet 空间的最远点采样确保最大差异性。
| 声音前缀 | 数量 | 上游来源 | 许可 |
|---|---|---|---|
emolia_c* |
219 | laion/Emolia(真实录制多语言情感语音) | cc-by-4.0 |
mediathek_* |
124 | 德国公共广播集群(未公开) | — |
k<n>_age<n>_bg<n> |
115 | 生成音频集群 | — |
refvoice_* |
27 | 真实+AI 片段集群 | — |
anime_* |
15 | 动漫语音集群 | — |
所有音频均为模型输出,仅 emolia_* 家族追溯到真实录制的人类语音。
表演条件矩阵
| 模块 | 代码 | 组数 | 变化维度 |
|---|---|---|---|
| 情绪 | E |
320 | 40 情绪 × 4 舞台指示 × 2 语言 |
| 语音网络 | V |
456 | 57 VoiceNet 维度 × 4 等级 × 2 语言 |
| 边缘情况 | X |
28 | 14 个边缘情况 × 2 语言 |
| 角色声音 | C |
24 | 如“沙哑兽人 warlord” |
| 孤立爆发 | B |
10 | 单独声带爆发 |
| 体育解说 | S |
2 | 体育评论风格 |
| 明确内容 | P |
2 | 安全门控,部分声音合法缺失 |
文件布局
README.md code/ 标题渲染、音频处理、构建脚本 index/ Parquet 索引文件(205 列,共 2,500 个文件) scores/ 生成运行评分(仅 original,83 列) manifests/ 分片清单(含 sha256) data/ WebDataset 分片(MP3、JSON、MOSS token、VCLAP 嵌入) stats/ 每声音/情绪/维度的统计数据 vc_sidon/ 预留目录
每个 tar 成员组共享一个 uid:<uid>.mp3(48 kHz, 160 kbps CBR)、<uid>.json(完整嵌套记录)、<uid>.moss.npy(uint16 [T, 12])、<uid>.vclap.npy(float16 [768])。
关键已知问题
-
半速解码错误:早期标注存在立体声帧展平问题,导致解码音频精确 2 倍时长(半速)。整个标注堆栈已从修复的解码器重新计算,验证显示
dur_s与真实时长的比值为 1.000000,moss_frames与round(dur_s × 12.5)完全一致。MP3 音频本身从未受影响。 -
标题极性错误:
GEND和BKGN的标题梯子方向相反。高GEND实为男性化,高BKGN实为更干净(背景噪声更少)。所有数值列始终正确,仅散文文字反转。修复后可复现。 -
情绪条款更新(2026-08-23 重新生成):情绪条款改为语料库百分位门控而非绝对阈值。
Interest从 90.6% 的行降至 5.3%,所有 40 种情绪均出现,17.9% 的行标注为“无主导情绪”。旧版本保留在caption_general_v1列中,可按行审计。
模型链与许可
- TTS 模型:laion/moss-tts-local-transformer-4.55b-voice-acting-v2(Apache-2.0)
- 音频编解码器:OpenMOSS-Team/MOSS-Audio-Tokenizer-v2(Apache-2.0)
- 参考音频:TTS-AGI/moss-voice-profile-references(Apache-2.0)
- LoRA 适配器:laion/moss-voice-profile-loras-500(CC-BY-4.0)
数据集整体采用 CC-BY-4.0 许可,使用需注明 Christoph Schuhmann 和 LAION 以及上游来源。




