遇见数据集

Miuzarte/SUISovitsDataForBaseModel

收藏
Hugging Face2023-03-10 更新2024-03-04 收录
官方服务:

资源简介:

岁己SUI的sovits底模数据集主要用于岁己音色的底模训练。数据集包含多个预处理步骤和不同版本的数据集文件,采样频率分别为44.1kHz和48kHz,适用于sovits3.0和sovits4.0模型。数据集来源于岁己的录播内容,经过筛选和处理,最终生成了多个版本的数据集文件。

SUI (Suiji)'s SovITS base model dataset is primarily used for training the base model of Suiji's vocal timbre. This dataset includes multiple preprocessing procedures and dataset files in various versions, with sampling rates of 44.1 kHz and 48 kHz respectively, and is compatible with SovITS 3.0 and SovITS 4.0 models. Derived from Suiji's recorded broadcast content, the dataset has been screened and processed, ultimately yielding multiple versions of dataset files.

提供机构:
Miuzarte
原始信息汇总

岁己SUI的sovits底模数据集

数据集描述

数据集概要

ForBaseModel.zip:

  • 用途:用于岁己音色的底模训练,洗去G_0.pth和D_0.pth的音色。

  • 质量:数据质量不高。

  • 采样频率:44.1kHz。

  • 来源:取自岁己2022年12月和2023年1月的录播(除电台,共计211:13:21)。

  • 处理步骤

    1. 挑取BGM音量较低的直播片段(20:39:21)。
    2. 使用UVR5 VR Architecture 5_HP-Karaoke-UVR处理,尽量除去BGM中的人声(20:39:20)。
    3. 使用Audio Slicer切片(12:45:29)。
    4. 使用Fish Audio Preprocessor响度标准化并删除过短过长的片段(11:24:06)。
    5. 使用Spliter Wav by IceKyrin声纹识别稳定数据(06:47:46)。
  • 文件结构

    ForBaseModel.zip ├── 25788785-20221201-195959-658_01_(Vocals)1.wav ├── 25788785-20221201-195959-658_01(Vocals)3.wav ├── ...... ├── 25788785-20230201-005152-235_03(Vocals)9.wav └── 25788785-20230201-005152-235_03(Vocals)_10.wav

ForBaseModel_sovits3.0.zip:

  • 用途:ForBaseModel.zip经过预处理后的数据集,可以直接投入sovits3.0_48k使用。

  • 采样频率:48kHz。

  • 文件结构

    ForBaseModel_sovits3.0.zip ├── configs │   └── config.json ├── dataset │   └── 48k │   └── suijiSUI │   ├── 25788785-20221201-195959-658_01_(Vocals)1.wav │   ├── 25788785-20221201-195959-658_01(Vocals)1.wav.f0.npy │   ├── 25788785-20221201-195959-658_01(Vocals)1.wav.soft.pt │   ├── ...... │   ├── 25788785-20230201-005152-235_03(Vocals)10.wav │   ├── 25788785-20230201-005152-235_03(Vocals)10.wav.f0.npy │   └── 25788785-20230201-005152-235_03(Vocals)_10.wav.soft.pt └── filelists    ├── test.txt    ├── train.txt    └── val.txt

ForBaseModel_sovits4.0.zip:

  • 用途:ForBaseModel.zip经过预处理后的数据集,可以直接投入sovits4.0使用。

  • 采样频率:44.1kHz。

  • 注意:4.0开始config.json中的batch_size默认为6,已改回12。

  • 文件结构

    ForBaseModel_sovits4.0.zip ├── configs │   └── config.json ├── dataset │   └── 44k │   └── suijiSUI │   ├── 25788785-20221201-195959-658_01_(Vocals)1.wav │   ├── 25788785-20221201-195959-658_01(Vocals)1.wav.f0.npy │   ├── 25788785-20221201-195959-658_01(Vocals)1.wav.soft.pt │   ├── ...... │   ├── 25788785-20230201-005152-235_03(Vocals)10.wav │   ├── 25788785-20230201-005152-235_03(Vocals)10.wav.f0.npy │   └── 25788785-20230201-005152-235_03(Vocals)_10.wav.soft.pt └── filelists    ├── test.txt    ├── train.txt    └── val.txt

支持的任务和排行榜

[更多信息待补充]

语言

  • 中文(98%)
  • 英文(1%)
  • 日文(1%)

[更多信息待补充]

搜集汇总
数据集介绍
构建方式
该数据集专为虚拟主播“岁己SUI”的So-VITS-SVC底模训练而设计,旨在通过高质量音频素材洗去预训练模型中的原始音色特征。数据源自岁己于2022年12月至2023年1月期间的直播录播内容,累计时长超过211小时,但仅选取背景音乐音量较低的片段以降低干扰。构建过程历经多阶段精细化处理:首先利用UVR5模型的VR架构5_HP-Karaoke-UVR进行人声分离,剔除背景音乐中残留的人声成分;随后通过Audio Slicer工具对音频进行切片处理,并借助Fish Audio Preprocessor完成响度标准化,同时过滤掉时长过短或过长的无效片段;最终采用Spliter Wav基于声纹识别技术筛选出音色一致性较高的稳定数据,形成约6小时47分钟的纯净音频数据集。
使用方法
用户可根据目标模型版本选择对应的压缩包直接使用。对于So-VITS-SVC 3.0版本,下载ForBaseModel_sovits3.0.zip后,其内部已包含configs配置目录、dataset音频及特征文件目录、以及filelists训练/验证/测试文件列表,解压后即可按框架要求指定数据路径进行训练。4.0版本用户则需选用ForBaseModel_sovits4.0.zip,其目录结构与3.0版本类似,但采样率为44.1kHz。若需从原始音频开始定制处理流程,可下载ForBaseModel.zip并参考README中描述的预处理步骤,自行完成UVR分离、切片、响度归一化及声纹筛选等操作。所有数据均以中文文件名标识源直播片段信息,便于追溯与调试。
背景与挑战
背景概述
在人工智能与虚拟主播(VTuber)领域快速融合的当下,语音合成技术成为塑造虚拟角色个性化表达的核心引擎。由Miuzarte团队于2023年构建的岁己SUI的sovits底模数据集,聚焦于中国虚拟主播“岁己SUI”的音色建模,旨在为So-VITS-SVC(一款基于变分推理的歌声与语音转换模型)提供高质量的基座训练数据。该数据集源自岁己2022年12月至2023年1月的录播内容,经过精密的多阶段筛选与预处理,最终产出约6.8小时的纯净语音片段。其研究核心在于解决虚拟主播个性化音色迁移的底层模型训练问题,为后续的语音合成任务奠定音色无关的基座。该数据集虽标注为“数据质量不高”,但其构建流程为AI虚拟主播的声纹数据采集与处理提供了重要参考,推动了虚拟角色声音定制化的技术边界。
当前挑战
该数据集所面临的挑战涵盖了领域问题与构建过程两个层面。在领域问题层面,核心挑战在于从复杂背景音(如BGM、观众互动噪音)中分离并保留目标音色的纯净度,这直接关系到So-VITS-SVC模型能否有效学习岁己的音色特征,避免背景噪音干扰导致的音色混淆或模型泛化能力下降。在构建过程中,挑战尤为显著:首先,原始录播长达211小时,需通过UVR5模型进行人声分离,但算法难以完全消除BGM中残留的人声,导致数据纯净度受限;其次,声纹识别(Spliter Wav)步骤仅从12.8小时切片中稳定提取出6.8小时数据,反映出非可控录制环境下语音片段筛选的高难度与低效性;此外,数据标注缺失(如语言比例仅为粗略估计)与预处理流程依赖多种开源工具的组合,增加了复现与跨场景迁移的复杂性。
常用场景
经典使用场景
在语音合成与歌声转换领域,Miuzarte/SUISovitsDataForBaseModel 数据集被广泛用于 So-VITS-SVC 系列模型的基座模型训练。该数据集以虚拟主播“岁己SUI”的直播录音为原始素材,经过背景音乐分离、音频切片、响度归一化及声纹筛选等多重精细预处理,最终获得约6.8小时的高质量纯净语音数据。其经典使用场景在于为 So-VITS-SVC 的 3.0 与 4.0 版本提供可直接投入训练的底模数据集,研究者可基于此快速构建具有特定音色特征的基座模型,从而显著降低从零开始收集和处理语音数据的时间成本。
解决学术问题
该数据集有效解决了虚拟角色语音合成研究中高质量标注数据匮乏的学术难题。传统语音数据集往往依赖专业录音棚采集,成本高昂且难以获取自然口语化的语音风格。而该数据集通过从直播录音中提取并净化语音,为研究者提供了大规模、高保真、且包含丰富情感与语调变化的真实语音样本。它支撑了跨说话人音色迁移、小样本语音克隆以及低资源语音合成等前沿课题的探索,推动了语音生成模型在个性化与自然度上的突破,为虚拟人交互、AI 主播等研究提供了关键的数据基础。
实际应用
在实际应用中,该数据集主要服务于 AI 虚拟主播与数字人语音交互系统的构建。基于此数据集训练出的 So-VITS-SVC 基座模型,能够精准复现虚拟主播“岁己SUI”的独特音色与说话风格,广泛应用于直播实时语音合成、短视频配音生成以及互动式语音聊天机器人等场景。此外,该数据集还支持用户通过微调快速定制专属音色模型,降低了个人创作者与小型团队进入 AI 语音合成领域的技术门槛,推动了虚拟偶像产业与内容创作生态的多元化发展。
数据集最近研究
最新研究方向
在虚拟主播与人工智能语音合成技术深度融合的前沿领域,Miuzarte/SUISovitsDataForBaseModel数据集聚焦于基于So-VITS架构的个性化音色底模训练。该数据集以国内VirtuaReal旗下虚拟主播“岁己SUI”的直播语音为原始素材,经过背景音乐过滤、音频切片、响度标准化及声纹识别等多重精细处理,最终获得约6.8小时的高质量纯净人声数据。其核心价值在于为So-VITS 3.0与4.0版本提供可直接投入使用的预处理数据集,支持44.1kHz与48kHz双采样率配置,显著降低了个性化音色克隆的门槛。这一工作呼应了当前AI虚拟主播领域对低数据量、高保真度声音复刻技术的迫切需求,推动了二次元文化社区与生成式语音技术的交叉创新,为虚拟偶像的数字化存续与交互体验升级奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务