遇见数据集

laion-voice-profiles-annotated

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

LAION Voice Profiles — Annotated 是一个大规模合成语音数据集,由 Christoph Schuhmann 和 LAION 团队创建,采用 CC-BY-4.0 许可。数据集包含 28,212,933 条语音(总计 71,056 小时),由 500 个不同的语音角色生成,每个角色通过一个固定的 842 个命名表演条件矩阵驱动。语音为英文和德文的合成语音表演。每条语音都带有丰富的标注:40 种情绪强度(来自 Empathic-Insight 模型)、57 种感知声音维度(VoiceNet 回归与分类)、4 个音频质量分数、发声爆发检测(含时间戳和标签)、词级强制对齐、MOSS 音频编码标记(uint16 [T, 12])、768 维说话人/风格嵌入(vCLAP),以及 16 种不同风格和详细程度的程序化生成标题(从简洁到详尽)。数据分为两个来源:'original'(基础运行,20,079,381 条,54,943 小时)和 'repair'(修复运行,8,133,552 条,16,113 小时),后者替换了基础运行中身份检查失败的样本。数据集适用于文本到语音(TTS)、音频分类、语音情感识别、语音属性分析、语音角色生成等任务。数据以索引 parquet 文件(205 列)、WebDataset shards(包含 MP3 音频、JSON 元数据、MOSS 标记和 vCLAP 嵌入)、以及统计信息文件的形式提供。注意:所有标注均为机器生成,包含已知的修正(如半速解码错误、标题极性修正、情绪子句重新生成等),详细信息请参考 README 的已知问题部分。

LAION Voice Profiles — Annotated is a large-scale synthetic speech dataset created by Christoph Schuhmann and the LAION team, licensed under CC-BY-4.0. The dataset contains 28,212,933 utterances (totaling 71,056 hours) generated by 500 different voice personas, each driven by a fixed 842 named performance condition matrix. The speech consists of synthetic speech performances in English and German. Each utterance is richly annotated with: 40 emotion intensities (from the Empathic-Insight model), 57 perceived voice dimensions (VoiceNet regression and classification), 4 audio quality scores, vocal burst detection (with timestamps and labels), word-level forced alignment, MOSS audio encoding tokens (uint16 [T, 12]), 768-dimensional speaker/style embeddings (vCLAP), and 16 programmatically generated captions of varying styles and detail levels (from concise to exhaustive). The data is split into two sources: original (base run, 20,079,381 utterances, 54,943 hours) and repair (repair run, 8,133,552 utterances, 16,113 hours), with the latter replacing samples that failed identity checks in the base run. The dataset is suitable for tasks such as text-to-speech (TTS), audio classification, speech emotion recognition, speech attribute analysis, and voice persona generation. Data is provided in the form of index parquet files (205 columns), WebDataset shards (containing MP3 audio, JSON metadata, MOSS tokens, and vCLAP embeddings), and statistics files. Note: All annotations are machine-generated and include known corrections (e.g., half-speed decoding errors, caption polarity corrections, emotion clause re-generation, etc.). For details, refer to the Known Issues section of the README.

提供机构:
LAION eV
创建时间:
2026-08-23
原始信息汇总

数据集概述

LAION Voice Profiles — Annotated 是一个大规模合成语音数据集,包含 28,212,933 条语音片段,总时长 71,056 小时,涵盖英语和德语,由 500 个不同声音档案 生成。每个声音档案通过同一固定的 842 个命名表演条件矩阵 驱动,生成具有丰富标注的语音数据。

数据组成

来源 描述 片段数 小时数 声音数 分片数
original 基础运行 — 模型生成的所有候选片段 20,079,381 54,943 500 2,000
repair 修复运行 — 未通过身份检查的片段重新生成 8,133,552 16,113 498 29,956

注意:repair 运行是对 original 中失败片段的部分重做,不是独立样本。修复行会取代相同 (voice, gid, audio_key) 的原始行。

标注信息

每条语音片段包含以下标注:

  • 40 个情绪强度(Empathic-Insight 模型,0–7 分)
  • 57 个感知声音维度(VoiceNet 模型,回归值与分类桶)
  • 4 个音频质量指标
  • 声带爆发检测(带时间戳与标签)
  • 词级强制对齐(单词时间戳)
  • MOSS 音频编解码器 tokenuint16 [T, 12]
  • 768 维说话人/风格嵌入(VoiceCLAP)
  • 16 个程序化生成的标题(不同模板与风格)

声音档案来源

500 个声音档案从 6,064 个参考声音池中精选,依据质量门槛、DNSMOS 分数、性别与语言配额、以及 VoiceNet 空间的最远点采样确保最大差异性。

声音前缀 数量 上游来源 许可
emolia_c* 219 laion/Emolia(真实录制多语言情感语音) cc-by-4.0
mediathek_* 124 德国公共广播集群(未公开)
k<n>_age<n>_bg<n> 115 生成音频集群
refvoice_* 27 真实+AI 片段集群
anime_* 15 动漫语音集群

所有音频均为模型输出,仅 emolia_* 家族追溯到真实录制的人类语音。

表演条件矩阵

模块 代码 组数 变化维度
情绪 E 320 40 情绪 × 4 舞台指示 × 2 语言
语音网络 V 456 57 VoiceNet 维度 × 4 等级 × 2 语言
边缘情况 X 28 14 个边缘情况 × 2 语言
角色声音 C 24 如“沙哑兽人 warlord”
孤立爆发 B 10 单独声带爆发
体育解说 S 2 体育评论风格
明确内容 P 2 安全门控,部分声音合法缺失

文件布局

README.md code/ 标题渲染、音频处理、构建脚本 index/ Parquet 索引文件(205 列,共 2,500 个文件) scores/ 生成运行评分(仅 original,83 列) manifests/ 分片清单(含 sha256) data/ WebDataset 分片(MP3、JSON、MOSS token、VCLAP 嵌入) stats/ 每声音/情绪/维度的统计数据 vc_sidon/ 预留目录

每个 tar 成员组共享一个 uid<uid>.mp3(48 kHz, 160 kbps CBR)、<uid>.json(完整嵌套记录)、<uid>.moss.npyuint16 [T, 12])、<uid>.vclap.npyfloat16 [768])。

关键已知问题

  1. 半速解码错误:早期标注存在立体声帧展平问题,导致解码音频精确 2 倍时长(半速)。整个标注堆栈已从修复的解码器重新计算,验证显示 dur_s 与真实时长的比值为 1.000000,moss_framesround(dur_s × 12.5) 完全一致。MP3 音频本身从未受影响。

  2. 标题极性错误GENDBKGN 的标题梯子方向相反。高 GEND 实为男性化,高 BKGN 实为更干净(背景噪声更少)。所有数值列始终正确,仅散文文字反转。修复后可复现。

  3. 情绪条款更新(2026-08-23 重新生成):情绪条款改为语料库百分位门控而非绝对阈值。Interest 从 90.6% 的行降至 5.3%,所有 40 种情绪均出现,17.9% 的行标注为“无主导情绪”。旧版本保留在 caption_general_v1 列中,可按行审计。

模型链与许可

  • TTS 模型:laion/moss-tts-local-transformer-4.55b-voice-acting-v2(Apache-2.0)
  • 音频编解码器:OpenMOSS-Team/MOSS-Audio-Tokenizer-v2(Apache-2.0)
  • 参考音频:TTS-AGI/moss-voice-profile-references(Apache-2.0)
  • LoRA 适配器:laion/moss-voice-profile-loras-500(CC-BY-4.0)

数据集整体采用 CC-BY-4.0 许可,使用需注明 Christoph SchuhmannLAION 以及上游来源。

搜集汇总
数据集介绍
laion-voice-profiles-annotated 数据集图片
构建方式
数据集的构建植根于大规模语音合成与声纹建模的前沿实践,由LAION团队以五百个精选声纹为起点,驱动其通过一个由842个命名表演条件构成的固定矩阵,从而系统性地产生丰富多样的语音样本。所有音频均由模型生成,而非源录音的直接拷贝,每个话语经由统一的合成流程产生,并辅以机器标注流水线,涵盖情感强度、感知维度、音频质量与声音突发检测等多层信息。构建过程中,通过身份校验筛除不合格样本并引入修复机制,确保数据在身份一致性与表现力之间取得平衡,最终形成超过两千八百万条话语、总时长逾七万小时的合成语音语料库。
使用方法
使用该数据集时,研究者可通过HuggingFace的datasets库加载默认配置,以获取全部原始与修复话语,或单独加载vc_sidon配置以访问每一条源话语中排名最高的声纹转换结果。音频数据存储于WebDataset格式的tar分片中,每条话语包含MP3音频、JSON记录、MOSS编解码令牌与VoiceCLAP嵌入四个成员文件,通过uid与分片索引表进行关联。用户可借助提供的Python脚本重建不同运行版本,或利用caption_render.py基于扁平化数值列快速生成十六种不同风格的描述文本,以支撑语音合成、音频分类及条件建模等多样化研究任务。
背景与挑战
背景概述
LAION Voice Profiles — Annotated 由 Christoph Schuhmann 与 LAION 于 2026 年前后发布,旨在为语音合成与音频分类构建大规模、精细标注的合成语音资源。该数据集包含约 2821 万条英文和德语语音,总时长逾 7.1 万小时,覆盖 500 个经 farthest-point sampling 精选的差异化音色,每条话语均通过 842 种命名表演条件矩阵驱动,并配有情感强度、感知维度、音频质量、人声爆发、强制对齐及 MOSS 编解码器 token 等丰富标注。其核心研究问题在于:能否以程序化方式大规模生成兼具情感表达与音色多样性的语音数据,从而缓解 TTS 与语音情感识别领域高质量标注语音稀缺的瓶颈。该资源为语音生成、情感建模及说话人表征学习提供了可复现的基准,对语音合成与音频理解社区具有显著推动意义。
当前挑战
该数据集所针对的领域问题在于语音合成与音频分类中大规模、多维度情感标注语音的匮乏,而人工录制与标注此类数据成本高昂且难以覆盖长尾音色与情感条件。构建过程中的挑战尤为突出:其一,500 个音色需从 6064 个候选池中经质量门控、DNSMOS 下限及性别语言均衡配额筛选,确保最大化差异而非简单取优;其二,所有标注依赖 VoiceCLAP 与 VoiceNet 等模型级联推断,其可靠性受限于训练锚点,例如 R_MIXD 维度相关性仅 0.39,部分弱轴标签近乎无信息;其三,早期标注流程曾因立体声展平解码导致半速错误,影响全部 GPU 阶段输出,需对整个标注栈重新计算与验证;其四,情感描述采用语料相对百分位门控,与 VoiceNet 绝对锚定词不可通约,跨语料比较时须审慎处理。
常用场景
经典使用场景
在语音合成与音频理解领域,LAION Voice Profiles — Annotated数据集以其规模与标注丰富度成为语音表演建模的基石资源。该数据集经典地服务于文本到语音合成任务,特别是情感与风格可控的语音生成研究。通过842种命名表演条件,涵盖情绪强度、感知维度、角色声音与发声爆发等,研究者可在固定声纹下系统探索同一说话者的多样化表演空间。每一条语音均附带词级强制对齐、MOSS音频编解码令牌及768维说话人风格嵌入,使条件建模与声学分析得以在同一框架内并行展开,为多语言英语与德语的情感语音合成提供了标准化实验平台。
解决学术问题
该数据集有效回应了语音情感识别与说话人风格建模中长期存在的标注稀缺与维度不统一问题。其40维情感强度与57维感知声音维度均带有回归估计与分类桶标签,为研究情感维度的连续变化与离散感知提供了大规模监督信号。同时,词级对齐与发声爆发时序标注解决了副语言事件检测中边界模糊的难题。数据集还通过质量门控与最远点采样选出的500个声纹,支持说话人身份与表演条件解耦的研究,推动了语音表征学习中内容、风格与音质因子的可解释分离。
实际应用
在工业实践中,该数据集广泛应用于情感语音助手、有声读物与游戏角色配音的自动化生成系统。其16种程序化字幕模板可直接作为训练条件文本,使模型习得从自然语言描述到声学表现的映射,降低配音制作对专业演员的依赖。音频质量头与发声爆发时序标注有助于构建鲁棒的语音编辑与修复工具,例如自动检测并替换不自然片段。多语言英语与德语支持使其适用于跨语言语音克隆与本地化配音流程。MOSS编解码令牌与声纹嵌入则为低比特率语音传输与隐私保护场景提供了可复用的声学表示。
数据集最近研究
最新研究方向
在语音合成与音频分类领域,laion-voice-profiles-annotated数据集以其大规模、多维度标注的特性,正推动着情感语音合成与声音属性可控生成的研究前沿。该数据集涵盖500个独特声音档案,每个声音在842种表演条件下生成,并附带40种情感强度、57个感知声音维度及16种程序化描述,为情感条件建模和声音风格解耦提供了丰富资源。当前研究热点集中于利用此类细粒度标注进行零样本语音克隆与情感迁移,同时探索声音爆发(vocal bursts)在自然交互中的生成与识别。该数据集的发布不仅促进了TTS模型在表现力与可控性上的突破,也为音频分类任务提供了标准化基准,对语音交互、虚拟角色塑造及跨语言情感计算具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务