遇见数据集

humaneness-voice-small-dpo-acting-eval

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

Humaneness Voice Small DPO 匹配表演评估音频数据集是一个用于文本到语音(TTS)模型评估的音频集合。该数据集提供了 S3 基础模型与其四个 S3 DPO LoRA 适配器之间的可听五路比较。每个适配器均在固定的 Humaneness Voice Small acting benchmark 上进行了评估,该基准包含 50 个场景、11 种提示条件,涵盖英语和德语,使用相同的脚本、提示、参考分配和生成种子。每个模型有 1,872 个匹配片段,四个 LoRA 适配器贡献了 7,488 个可直接访问的 128 kbps 单声道 MP3 文件。数据集的比较键为 (challenge_id, surface, mode, seed),MP3 文件路径结构清晰。此外,数据集还包含 scores 目录下的 16 个 Parquet 文件和 summary.json,提供 ASR/WER、真实性、情感向量等评估指标,以及 proofs 目录中的不可变记录。该数据集适用于 TTS 模型的性能比较、DPO 微调效果分析以及自然度评估,但需注意预测指标存在局限性,应结合人工试听进行判断。

Humaneness Voice Small DPO matched performance evaluation audio dataset is an audio collection for evaluating text-to-speech (TTS) models. It provides an audible five-way comparison between the S3 base model and its four S3 DPO LoRA adapters. Each adapter is evaluated on the fixed Humaneness Voice Small acting benchmark, which includes 50 scenes, 11 prompt conditions, covering English and German, using the same scripts, prompts, reference assignments, and generation seeds. Each model has 1,872 matched segments, and the four LoRA adapters contribute 7,488 directly accessible 128 kbps mono MP3 files. The comparison key of the dataset is (challenge_id, surface, mode, seed), and the MP3 file path structure is clear. Additionally, the dataset includes 16 Parquet files and summary.json in the scores directory, providing evaluation metrics such as ASR/WER, naturalness, emotion vectors, as well as immutable records in the proofs directory. This dataset is suitable for TTS model performance comparison, DPO fine-tuning effect analysis, and naturalness evaluation, but it should be noted that the prediction metrics have limitations and should be combined with human listening for judgment.

提供机构:
LAION eV
创建时间:
2026-09-30
原始信息汇总

Humaneness Voice Small DPO: matched acting evaluation audio

数据集概述

  • 这是一个匹配的、可聆听的五方对比数据集。
  • 包含原始的 S3 基础模型,以及四个 S3 DPO LoRA 适配器(原始/重新平衡的任务混合 × rank 64/128)。
  • 每个 LoRA 都在与 S3 相同的、冻结的 Humaneness Voice Small acting benchmark 上进行了评测。
  • 评测基准包含 50 个场景、11 种提示条件、英语和德语,并使用相同的脚本、提示、参考分配和生成种子。
  • 每个模型有 1,872 条匹配的录制样本。
  • 四个 LoRA 在此数据集中贡献了 7,488 个可直接访问的 128-kbps 单声道 MP3 文件;S3 的 MP3 仍保留在现有的基准仓库中,并通过并排聆听 Space 进行链接。

对比键与文件路径

  • 对比键为 (challenge_id, surface, mode, seed)。
  • 适配器的 MP3 路径为 mp3/{model}/{challenge_id}__{surface}__{mode}__seed{seed}.mp3。
  • 例如:mp3/original_rank064/HVSAC-001__C01__instruction__seed17.mp3。
  • 每个 MP3 都可以通过 Hub 的 resolve/main/... URL 配合浏览器范围请求进行播放。

数据文件结构

  • scores/{model}/rankNNN.parquet:共 16 个文件,每个文件保留一条录制样本对应的一行数据,包含完整的 Parakeet ASR/WER、genuineness、vocal-burst blending、Empathic Insight Voice Plus 40-emotion vector、VoiceNet vector、clip-duration diagnostics、prompt 和 provenance。
  • proofs/:包含不可变的按 rank 的 PASS 记录和文件哈希。
  • summary.json:报告匹配行统计信息和缺失情况。

如何解读结果

  • Space 仅展示公共键匹配的对比,而非不相关的随机样本。
  • WER 越低越好。
  • genuineness 和 blend predictor 值越高通常表示模型预测的自然度/混合度更强,但预测器并不完美,不能替代聆听。
  • 目标情感激活是该场景所请求情感头的平均输出;它是一种预测器激活值,而非校准的情感准确率百分比。
  • Vocal-burst F1 仅在请求 bursts 的场景上进行汇总。
  • Clip 级时长误差仅作为诊断用途。
  • 强制句子对齐尚未完成,因此本次发布不声称已验证逐句时序合规性。
  • 即使生成和首轮评分成功,源 PASS 文件也可能带有 publication_ready: false,以表示缺失对齐后处理步骤。
  • 在选择适配器之前,请自行比较提示和音频。

训练与许可信息

  • 四个适配器检查点均源自同一 S3 基础模型。
  • 原始 DPO 配对混合包含 715,402 对;重新平衡的六任务混合包含 447,179 对。
  • 重新平衡的运行没有独立的配对级音高或质量留出集,因此配对准确率无法证明这两项新增内容能改善音频。
  • 完整的训练注意事项和可复现代码参见模型卡。
  • 底层的 acting-challenge prompts 来自 laion/acting-challenge-dataset,采用 Apache 2.0 许可。
  • 生成的音频及本衍生评测发布采用 CC BY 4.0 许可,与 S3 基础模型一致。
  • 请勿将此基准用作说话人同意或身份保真度的测试。

元数据

  • 许可证:cc-by-4.0
  • 语言:英语(en)、德语(de)
  • 任务类别:text-to-speech
  • 标签:audio、evaluation、humaneness-voice-small、dpo
搜集汇总
数据集介绍
humaneness-voice-small-dpo-acting-eval 数据集图片
构建方式
该数据集建立在文本到语音合成模型评估的持续演进脉络之上,通过匹配式五方比较框架构建而成。具体而言,以原始S3基础模型为参照,将四个基于S3的DPO LoRA适配器(原始与重平衡任务混合×秩64与128)纳入统一评估。每个适配器均在完全冻结的Humaneness Voice Small表演基准上进行测试,该基准涵盖50个场景、11种提示条件,并同时包含英语和德语,脚本、提示、参考分配及生成种子均保持一致。最终每个模型产生1,872条匹配音频片段,四个适配器贡献7,488个可直接寻址的128-kbps单声道MP3文件,从而形成严格可控的比较语料库。
特点
此数据集的显著特点在于其匹配性与可听性兼备的设计。所有音频片段通过(challenge_id, surface, mode, seed)这一比较键进行精确对齐,消除了随机抽样带来的不可比性。数据集不仅提供音频文件,还附带多维度的评分数据,包括Parakeet ASR词错率、真实感、人声爆发混合、Empathic Insight Voice Plus 40维情感向量、VoiceNet向量以及片段时长诊断等。此外,proofs目录保存了不可变的每秩通过记录与文件哈希,summary.json则报告了匹配行统计与缺失情况,确保了评估过程的可追溯性与透明度。
使用方法
使用者可通过HuggingFace Hub的resolve/main/... URL以浏览器范围请求方式直接播放每个MP3文件,音频路径遵循mp3/{model}/{challenge_id}__{surface}__{mode}__seed{seed}.mp3的命名规则。scores/{model}/rankNNN.parquet文件保留了每一条音频片段的完整诊断信息与出处,供深入分析。配套的并排聆听Space仅展示共同键匹配的比较结果,便于直观对比不同适配器的表现。需要注意的是,较低词错率更优,而真实感与混合预测值通常指示更强的自然度,但预测器并非完美,不应替代实际聆听。目标情感激活值仅为预测器激活,并非校准后的情感准确率百分比。
背景与挑战
背景概述
语音合成领域长期追求自然度与表现力的统一,而基于人类反馈的强化学习及直接偏好优化(DPO)正成为提升生成语音拟人性的关键路径。LAION 团队于2024年前后构建的 Humaneness Voice Small 系列,聚焦于在 S3 基础模型上通过 DPO LoRA 适配器微调,以增强语音的拟人特质。该数据集 humaneness-voice-small-dpo-acting-eval 应运而生,汇集四种 DPO LoRA 适配器在冻结的表演基准上的配对比较音频,涵盖50个场景、11种提示条件,英德双语,共7488个可直接寻址的MP3文件,为研究者提供了可复现、可聆听的评估资源,推动了表现力语音合成评价体系的发展。
当前挑战
该数据集所应对的领域核心挑战在于,如何客观量化语音的拟人性与表演力,而非仅依赖主观听感。现有自动指标如WER、情感激活值与混合预测器等虽提供参考,却存在预测不完美、无法替代人工聆听的固有局限。构建过程中的挑战亦十分显著:需确保不同LoRA适配器在相同脚本、提示、参考分配与生成种子下严格配对,同时管理跨语言、多场景的大规模音频与评分数据,并处理强制句子对齐缺失导致的验证不完备问题。此外,重新平衡的任务混合缺乏独立的音高或质量留出集,使得配对准确率无法直接证明音频改进效果,这些均构成数据集使用与解读时需审慎对待的挑战。
常用场景
经典使用场景
在文本到语音合成领域,针对表现力与拟人化程度的评估长期依赖主观听测,缺乏可复现的标准化基准。该数据集以匹配式五路对比为核心范式,将S3基座模型与四种基于直接偏好优化的LoRA适配器置于完全冻结的表演基准之上,覆盖50个场景、11种提示条件及英德双语,并保持脚本、提示、参考分配与生成种子的一致性,从而提供1872条逐模型对齐的音频样本。研究者可借助统一比较键逐条定位对应音频,在控制所有混杂变量的前提下开展细粒度听测与自动指标分析。
实际应用
在语音内容创作与交互式音频产品开发中,开发者需要为特定角色或场景选择表现力最契合的语音模型变体。该数据集通过并排听测空间与可直接寻址的128kbps单声道MP3文件,使产品团队能够针对英语或德语场景,在原始任务混合与再平衡任务混合、秩64与秩128的适配器之间进行听觉比对。每个音频文件均可通过浏览器范围请求即时播放,配套的Parquet评分文件保留了完整的提示与来源信息,便于工程团队依据词错率与自然度预测指标筛选适配器,同时避免将预测激活值误读为校准后的情绪准确率。
衍生相关工作
该数据集直接衍生自Humaneness Voice Small表演基准与act ing-challenge-dataset的提示体系,并构成Humaneness Voice Small DPO LoRA适配器系列的官方评估配套。其匹配比较键与并排听测空间的设计,为后续语音偏好优化研究提供了可扩展的评估模板,推动了从单一模型评分向多适配器受控对比的范式迁移。冻结基准与不可变PASS记录的结合,亦为音频生成领域的可复现评测树立了工程规范,后续相关研究可在此基础上引入强制句子对齐与更细粒度的时序合规验证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务