遇见数据集

Clean Voice Dataset

收藏
github2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

从长录音中提取的、针对特定说话人的干净语音数据集,用于语音转换和克隆。

A speaker-specific clean speech dataset extracted from long-duration audio recordings, intended for voice conversion and voice cloning.

创建时间:
2026-08-16
原始信息汇总

🎙️ Voice Dataset Forge 数据集详情

Voice Dataset Forge 是一个桌面工具,用于从长篇录音中提取特定目标说话人的语音数据集,通过说话人分割、语音匹配、可选音乐分离、质量过滤和转录等步骤,将杂乱的直播录音转化为干净的、针对特定说话人的语音数据集。

核心功能

  • 目标说话人提取:从包含多个说话人的录音中提取目标说话人
  • 音乐/背景分离:可选使用 Demucs 进行音乐和背景声分离
  • 说话人分割:使用 pyannote/speaker-diarization-community-1 模型
  • 参考语音匹配:基于 WeSpeaker 嵌入实现参考语音匹配
  • 自动音频片段生成:自动生成连续的数据集片段
  • 说话人筛选:通过最佳说话人边际过滤减少误包含其他说话人
  • 音频质量过滤:过滤过短、过静、削波或大部分静音的片段
  • 转录功能:可选使用 faster-whisper 进行转录
  • 增量写入与缓存:处理过程中保存已接受的片段,支持缓存和恢复
  • 长录音支持:支持多小时的录音,无需手动分割
  • 内存感知处理:避免将所有重型模型同时加载到显存
  • 桌面 GUI:基于 PySide6 的简单图形界面

处理流程

text 直播录音 → FFmpeg 提取 → (可选)Demucs 语音分离 → pyannote 说话人分割 → WeSpeaker 参考匹配 → 最佳说话人/模糊性过滤 → 重叠与音频质量过滤 → 48 kHz 单声道 PCM16 片段 → (可选)faster-whisper 转录 → 统一数据集

质量预设

⚡ Fast(快速)

  • 不使用 Demucs 音源分离
  • 说话人分割 + 参考匹配
  • 过滤条件较宽松
  • 分割窗口约 5 分钟
  • 转录使用 faster-whisper small 模型

⚖️ Balanced(均衡)

  • 使用 Demucs htdemucs 模型
  • 参考音频先清洗再构建语音嵌入
  • 更严格的说话人过滤
  • 转录使用 faster-whisper turbo 模型

💎 Maximum(最高质量)

  • 使用 Demucs htdemucs_ft 模型
  • 最严格的说话人过滤
  • 对已接受片段进行额外验证
  • 转录使用 faster-whisper large-v3 模型

数据集输出

最终生成的音频片段格式为:

  • 采样率:48 kHz
  • 声道:单声道(mono)
  • 编码:PCM16 WAV

输出目录包含以下文件:

  • audio/:音频片段文件(000001.wav、000002.wav 等)
  • metadata.csv:主要元数据文件,使用竖线分隔格式,无表头
  • metadata_extended.csv:包含源文件、时间戳、时长、说话人相似度和技术质量指标等扩展信息
  • metadata.jsonl:JSON Lines 格式元数据
  • statistics.json:数据集统计信息
  • dataset_report.txt:数据集报告
  • settings.json:设置配置
  • processing.log:处理日志
  • .vdf_state.json:项目状态文件
  • .cache/:缓存目录

参考语音建议

  • 仅包含目标说话人
  • 总计至少提供 30-60 秒的语音
  • 尽可能包含不同的说话风格和语调
  • 避免参考中出现其他人说话
  • 避免严重削波和强烈回声
  • 在 Balanced 和 Maximum 预设下,参考文件会自动通过 Demucs 清洗,因此适度的背景音乐可接受,但包含其他歌手的声音仍不理想

系统要求

  • Windows 10/11(主要支持平台)
  • Python 3.11 x64
  • FFmpeg(需在 PATH 中可用)
  • NVIDIA GPU(强烈推荐,支持 CUDA,可选但推荐)

缓存与恢复机制

  • 完成的重型处理阶段会被缓存
  • 支持从失败的晚期阶段恢复,无需完全从头开始
  • 缓存文件缺失会被视为需要重新计算的工作,而非致命错误
  • 具备自修复能力,可自动清理过期的元数据并重置已完成源文件状态

限制与注意事项

  • 说话人分割无法物理分离同时说话的两个人的声音,重叠/模糊语音将被丢弃
  • Demucs 在困难音乐或重叠人声情况下可能留下伪影
  • 说话人相似度分数为余弦相似度,不是经过校准的生物识别概率
  • CPU 回退可用,但处理速度可能非常慢
  • 质量较差的源音频仍可能产生质量不佳的数据集片段
  • Windows 是当前主要测试平台
  • rejected/ 工作流尚不是核心稳定功能
搜集汇总
数据集介绍
Clean Voice Dataset 数据集图片
构建方式
Clean Voice Dataset的构建依托于Voice Dataset Forge这一桌面工具,其核心流程从原始流媒体录音出发,依次执行FFmpeg音频提取、可选的Demucs音乐分离、pyannote说话人分离、WeSpeaker参考语音匹配及最佳说话人筛选。随后进行重叠与音频质量过滤,最终输出48kHz单声道PCM16格式的统一数据集。整个管线支持Fast、Balanced、Maximum三种质量预设,分别对应不同级别的分离精度与过滤严格度,满足从快速测试到高纯度数据集生成的多层次需求。
特点
该数据集具有多项显著特性:能够从多说话人混杂的长时录音中精准提取目标说话人;通过最佳说话人边际过滤有效降低他人语音混入风险;集成音频质量过滤机制,剔除短促、静音、削波或含糊片段;支持增量式写入与缓存续跑,即使处理中断或缓存缺失也能自愈恢复。此外,内存安全设计确保重型模型按序加载,避免显存溢出,并生成详尽的处理日志与统计信息,为高质量语音转换训练提供坚实的数据基础。
使用方法
使用该数据集时,用户需通过图形界面指定流媒体文件夹、参考语音文件夹及数据集输出目录,并选择质量预设。系统自动处理内部切分与过滤,无需手动裁剪长录音。最终产出的数据集包含audio目录下的WAV文件及metadata.csv等元数据文件,其中metadata.csv采用管道分隔格式记录音频路径与可选转写文本,便于直接接入RVC、Seed-VC等语音转换或语音合成训练管线。对于需要转写的场景,可启用faster-whisper进行自动标注,而语音转换训练通常无需转写,可关闭以节省资源。
背景与挑战
背景概述
Clean Voice Dataset(语音数据集锻造工具)由开发者于近期创建,旨在解决从流媒体录音中提取单一说话人干净语音数据集的难题。该工具整合了说话人分割(pyannote)、语音匹配(WeSpeaker)、音乐分离(Demucs)和质量过滤等先进技术,形成一个自动化的数据预处理流水线。其核心研究问题在于如何高效、准确地将数小时的多说话人、含背景音乐的原始录音转化为可用于语音转换(如RVC、Seed-VC)或语音合成训练的高质量数据集。该工具的出现填补了流媒体录音数据自动化清洗领域的空白,为语音技术研究提供了便捷的数据准备方案,对相关领域的研究效率提升具有显著影响。
当前挑战
该数据集面临的挑战主要集中于技术复杂性与数据质量保障。领域问题方面,从真实世界流媒体录音中提取单一说话人语音,需同时应对背景音乐干扰、多人交谈重叠、说话人识别准确性及长时录音的处理效率等难题。构建过程中,工具需保证说话人分割与匹配的精度,避免误删或混入他人语音;音乐分离可能引入音频伪影;过滤算法需平衡敏感度与误判率。此外,长录音处理对内存和计算资源要求高,且需要实现缓存与断点续传以提升鲁棒性。这些挑战对算法性能、系统稳定性和用户体验均提出了严苛要求。
常用场景
经典使用场景
该数据集工具专门用于从嘈杂的流媒体录音中提取单一目标说话人的干净语音片段,其核心应用场景是语音转换(Voice Conversion)和语音合成(TTS)模型的训练数据准备。通过集成的说话人日志(speaker diarization)、声纹匹配(voice matching)以及可选的音乐分离(music separation)和音质过滤(quality filtering),它能够自动将数小时的多说话人录音转化为统一格式的、仅包含目标说话人的高质量语音片段。这一流程特别适用于需要对主播、歌手或特定个体进行语音建模的场景,例如为RVC、Seed-VC等语音转换框架构建专属数据集,从而显著降低手动切割和清洗录音的时间成本。
解决学术问题
该数据集解决了语音处理研究领域中一个长期存在的痛点:从非受控的流媒体录音中准备干净、纯净且目标说话人一致的语音数据。传统方法往往依赖大量人工干预,耗时且易出错,而该工具通过自动化流水线,集成了说话人日志、声纹嵌入、音乐分离和智能过滤技术,有效处理了背景音乐混合、多人对话干扰、录音时长过长及片段质量参差不齐等难题。其意义在于为语音转换、说话人验证和语音识别等研究提供了一种可复现、可扩展的数据集构建方案,提升了数据准备的效率和纯度,进而增强了基于这些数据训练的模型的性能和可靠性。
衍生相关工作
该数据集的构建流程和方法论已催生出多项相关衍生工作。其核心思路——结合说话人日志与声纹匹配来提取目标语音,被后续研究所采纳并优化,例如在说话人验证任务中利用相似度边际过滤以降低错误接纳率的技术,以及在长时录音中采用分块分离策略以管控内存消耗的实践。此外,其可选的自动转录环节为语音文本对齐任务提供了基础,相关衍生工作可能包括基于该数据集训练的语音识别或语音转换模型。该工具的开源属性也激发了社区对多说话人场景下数据增广、说话人一致性增强以及跨域语音转换等课题的探索,推动了语音数据自动化处理技术的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务