奶龙语音克隆数据集
收藏资源简介:
数据集按处理阶段分为四部分:1. `raw_audio` (原始采样):使用 Audacity 直接对视频素材进行录音,格式为 44.1kHz, 16-bit, Stereo。包含背景音、特效及多角色对话的非结构化原片素材。2. `vocal_only` (人声分离):从 `raw_audio` 中使用 UVR5 的 MDX-NET 模型剥离背景音乐与噪音。3. `sliced_vocal` (自动化切片):基于停顿检测、音色突变及总时长控制,将 `vocal_only` 自动化切分为一系列短音频。4. `nailong_selected` (精选集):该数据集可最终用于模型训练与微调,其由人工精选部分和选择器补充部分构成。
The dataset is divided into four parts based on processing stages: 1. `raw_audio` (Raw Sampling): Directly recorded from video source materials using Audacity, with specifications of 44.1kHz sampling rate, 16-bit bit depth, and stereo channel layout. It contains unstructured raw footage with background sounds, sound effects, and multi-character dialogues. 2. `vocal_only` (Vocal Separation): Background music and noise are stripped from the `raw_audio` dataset using the MDX-NET model from UVR5. 3. `sliced_vocal` (Automated Slicing): The `vocal_only` audio is automatically segmented into a series of short audio clips based on pause detection, timbre mutation, and total duration control. 4. `nailong_selected` (Selected Collection): This dataset is ultimately intended for model training and fine-tuning, and it is composed of a manually selected portion and a supplementary portion selected by a selector.
奶龙语音克隆数据集(NaiLong-Voice-Clone)概述
数据集基本信息
- 数据集名称:奶龙语音克隆数据集
- 数据集地址:https://huggingface.co/datasets/pengyichen/NaiLong-Voice-Clone
- 国内镜像地址:https://hf-mirror.com/datasets/pengyichen/NaiLong-Voice-Clone
- 关联模型仓库:https://huggingface.co/pengyichen/NaiLong-Voice-Clone
数据集内容与结构
数据集按处理阶段分为以下四个部分:
1. raw_audio(原始采样)
- 处理方式:使用 Audacity 直接对视频素材进行录音。
- 技术规格:44.1kHz, 16-bit, Stereo。
- 内容说明:包含背景音、特效及多角色对话的非结构化原片素材,是整个流水线的起点。
2. vocal_only(人声分离)
- 处理方式:从
raw_audio中使用 UVR5 的 MDX-Net 模型剥离背景音乐与噪音。 - 内容说明:利用 MDX-Net 模型提取出干净的人声轨道,为后续切片提供高信噪比素材。
3. sliced_vocal(自动化切片)
- 处理方式:基于停顿检测、音色突变及总时长控制,将
vocal_only自动化切分为一系列短音频。 - 内容说明:主要意义是为了后续通过选择器筛选出其中是“纯正奶龙”的片段。
4. nailong_selected(精选集)
该数据集可最终用于模型训练与微调,其由两部分构成:
- 人工精选部分:从
vocal_only中手动挑选的优质奶龙音色参考音频(44.1kHz, Stereo)。 - 选择器补充部分:利用选择器
selector.py,以第一部分得到的奶龙参考音频为基础,通过迭代标记扩散,从sliced_vocal中检索出高置信度片段,并经人工二次核验挑选得到最终音频集(32kHz, Mono)。
配套工具:音频选择器 (selector.py)
本仓库提供一份通用的音频筛选工具 selector.py。
核心功能
- 筛选逻辑:根据
reference文件夹中存放的特定角色参考音频,将sliced_vocal当中“大概率是纯该特定角色”的音频筛选出来。 - 全路径提取:提取
reference和sliced_vocal内部的任意层级子文件夹。 - 带路径输出:输出结果时,会在文件名中体现其在
sliced_vocal目录当中的相对路径,防止同名文件冲突并方便数据溯源。 - 格式兼容:支持
.wav,.mp3,.flac,.m4a,.ogg,.opus等多种主流音频格式。
使用方法
- 安装依赖:
pip install -r requirements.txt - 环境要求:处理
.mp3,.m4a,.opus等压缩格式需预装 FFmpeg。 - 放置数据:将参考音频放入
reference文件夹,待筛选切片放入sliced_vocal文件夹。 - 运行程序:运行
selector.py,结果将输出至preselected文件夹。
关键配置参数
SEED_DIR: 存放“特定角色”参考音频的路径(默认:reference)。POOL_DIR: 存放切割好数据集的路径(默认:sliced_vocal)。OUTPUT_DIR: 存放程序筛选结果的路径(默认:preselected)。THRESHOLDS: 迭代筛选的相似度阈值序列。AUDIO_EXTENSIONS: 支持的音频文件后缀。DECAY_FACTOR: 迭代过程中新加入音频对目标音色特征向量的贡献权重衰减因子。
数据集用途
该数据集用于基于 GPT-SoVITS 的 v2proplus 预训练模型进行微调,以得到最终的奶龙语音克隆模型。nailong_selected 精选集可直接用于模型训练。




