遇见数据集

Qwen3-1.7-TTS-SFT-Furina

收藏
魔搭社区2026-07-15 更新2026-07-15 收录
官方服务:

资源简介:

# Furina Speech Dataset (芙宁娜语音数据集) ## 数据集简介 本数据集为游戏角色 **「芙宁娜(Furina)」** 的中文/英文语音素材,共 **832 条**,专为 [Qwen3-TTS](https://github.com/QwenLM/Qwen3-TTS) 文本转语音大模型的**全量微调(Full Fine-Tuning)** 而构建。数据集包含原始音频(24kHz WAV)、对应文本标注(.lab 文件)、统一参考音频(ref.wav),以及与 Qwen3-TTS 训练流程兼容的 JSONL 格式标注文件。 ## 数据集动机 Qwen3-TTS 提供了强大的 Base 声音克隆模型,但要将模型从"通用声音克隆"进一步适配为"预设说话人(CustomVoice)模型",需要针对特定说话人进行微调。本数据集提供了芙宁娜这一单一说话人的高质量语音-文本配对数据,覆盖多种语境和句式,便于开发者复现从 Base → CustomVoice 的全量微调流程。 ## 数据来源与预处理 原始音频素材来自《原神》游戏内芙宁娜角色的语音台词(采样率 48kHz),经过以下 **5 步预处理**: | 步骤 | 操作 | 说明 | |------|------|------| | 1 | 时长过滤 | 使用 `ffprobe` 检测时长,保留 **3 秒 ~ 15 秒** 的音频(太短信息不足,太长显存消耗高) | | 2 | 文件重命名 | 按顺序重命名为 `furina_0001` ~ `furina_0832` | | 3 | 重采样 | 使用 `ffmpeg` 从 48kHz 重采样至 **24kHz 单声道**(适配 Qwen3-TTS 12Hz 分词器) | | 4 | 参考音频选择 | 自动选取数据集中**时长最长**的音频作为统一参考音频 `ref.wav`,保证说话人音色一致性 | | 5 | 生成 JSONL 标注 | 生成 `train_raw.jsonl`,每行包含 `audio`、`text`、`ref_audio` 三个字段 | ## 数据集统计 | 统计项 | 数值 | |--------|------| | 音频总数 | **832 条** | | 文件总数 | **1,665**(832 .wav + 832 .lab + 1 ref.wav) | | 采样率 | 24,000 Hz | | 声道数 | 1(单声道) | | 位深 | 16-bit | | 格式 | WAV(PCM) | | 时长范围 | 3 秒 ~ 15 秒 | | 参考音频时长 | 8.24 秒 | | 语言 | 中文为主,含少量英文 | | 说话人数量 | 1 人(芙宁娜) | | 训练集大小 | 832 条(全部用于训练,无验证集划分) | | 总音频时长 | 约 2 小时 | | 音频编码格式 | 12Hz, 16 层量化(通过 Qwen3-TTS-Tokenizer-12Hz 提取) | ## 数据集结构 ``` data/ ├── ref.wav # 统一参考音频(全数据集使用同一条,8.24s) ├── furina_0001.wav # 音频文件 1 ├── furina_0001.lab # 文本标注文件 1 ├── furina_0002.wav # 音频文件 2 ├── furina_0002.lab # 文本标注文件 2 ├── ... ├── furina_0832.wav # 音频文件 832 └── furina_0832.lab # 文本标注文件 832 ``` ## 数据格式说明 ### .wav 文件 - 格式:WAV (PCM) - 采样率:24,000 Hz, 单声道, 16-bit ### .lab 文件 - 纯文本文件,内容为对应音频的文本标注(UTF-8 编码) - 示例内容:`我不是俱乐部的会员。只是一大早被克洛琳德敲门叫醒,说有个不错的剧本可以体验,这才决定加入的。` ### train_raw.jsonl 每行一个 JSON 对象,包含三个字段: ```json { "audio": "data/furina_0001.wav", "text": "我不是俱乐部的会员。只是一大早被克洛琳德敲门叫醒,说有个不错的剧本可以体验,这才决定加入的。", "ref_audio": "data/ref.wav" } ``` | 字段 | 说明 | |------|------| | `audio` | 音频文件的相对路径 | | `text` | 音频对应的文本标注 | | `ref_audio` | 参考音频的相对路径(全数据集统一为 `data/ref.wav`) | ### train_with_codes.jsonl 在 `train_raw.jsonl` 基础上增加 `audio_codes` 字段,包含 Qwen3-TTS-Tokenizer-12Hz 提取的音频离散编码(形状为 `[T, 16]`,T 为编码帧数,16 为量化器层数)。 ## 使用方式 ### 通过 ModelScope SDK 下载 ```python from modelscope import MsDataset ds = MsDataset.load("YourUsername/Furina-Speech-Dataset") ``` ### 通过 Git Clone 下载 ```bash git clone https://www.modelscope.cn/datasets/YourUsername/Furina-Speech-Dataset.git ``` ### 配合 Qwen3-TTS 微调使用 本数据集可直接用于 Qwen3-TTS 的全量微调训练: ```bash # 1. 克隆 Qwen3-TTS 仓库 git clone https://github.com/QwenLM/Qwen3-TTS.git cd Qwen3-TTS/finetuning # 2. 将本数据集放入 finetuning/data/ 目录 # 3. 提取音频编码(如使用已提供的 train_with_codes.jsonl 可跳过) python prepare_data.py \ --device cuda:0 \ --tokenizer_model_path Qwen/Qwen3-TTS-Tokenizer-12Hz \ --input_jsonl train_raw.jsonl \ --output_jsonl train_with_codes.jsonl # 4. 启动全量微调训练 python sft_12hz.py \ --init_model_path Qwen3-TTS-12Hz-1.7B-Base \ --output_model_path output \ --train_jsonl train_with_codes.jsonl \ --batch_size 2 \ --lr 1e-6 \ --num_epochs 10 \ --speaker_name furina ``` ## 微调效果 使用本数据集对 Qwen3-TTS-12Hz-1.7B-Base 进行 10 epoch 全量微调后,模型在 20 条测试样本上的量化指标如下: | 指标 | Base (x-vector) | SFT (epoch-4) | 改善幅度 | |:---|---:|---:|:---:| | Mel MSE ↓ | 2.043 | **1.861** | **-8.9%** | | Mel Cosine ↑ | 0.906 | **0.921** | **+1.6%** | | MFCC Cosine ↑ | 0.737 | **0.777** | **+5.4%** | | STFT Cosine ↑ | 0.148 | **0.153** | **+3.1%** | > ⚠️ 注意:微调时建议使用较小的学习率(如 `1e-6`),官方默认的 `2e-5` 在本数据集上会导致生成质量崩溃(输出噪声)。详见后文「已知问题」章节。 ## 已知问题与建议 1. **学习率选择**:全量微调 1.7B 模型 + 小数据集场景下,官方默认学习率 `2e-5` 不适用,建议从 `1e-6` 起步。 2. **不要仅依赖 Loss**:训练过程中建议定期进行推理验证(每个 epoch 结束后生成测试样本),Loss 下降 ≠ 生成质量提升。 3. **数据多样性**:当前数据集以芙宁娜的游戏内日常对话为主,在极端情绪表达方面覆盖有限。 4. **无验证集**:832 条数据全部用于训练,建议评估时自行切分独立测试集。 ## 许可证 本数据集采用 [Apache License 2.0](https://www.apache.org/licenses/LICENSE-2.0) 许可证。 数据集中的音频和文本素材版权归原版权方(miHoYo / HoYoverse)所有。本数据集仅供学术研究和学习使用,不得用于商业目的。 ## 引用 如果你使用了本数据集,请引用: ```bibtex @misc{furina-speech-dataset, title = {Furina Speech Dataset for Qwen3-TTS Fine-Tuning}, author = {Dong Qingsen}, year = {2026}, howpublished = {\url{https://www.modelscope.cn/datasets/YourUsername/Furina-Speech-Dataset}}, } ``` 以及 Qwen3-TTS 原论文: ```bibtex @misc{qwen3tts2026, title = {Qwen3-TTS: A Large Language Model based Text-to-Speech System}, author = {Qwen Team, Alibaba Group}, year = {2026}, eprint = {2601.15621}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.15621}, } ``` ## 联系方式 如有问题或建议,欢迎通过 ModelScope 数据集页面提交 Issue,或联系数据集维护者。

提供机构:
maas
创建时间:
2026-06-08
二维码
社区交流群
二维码
科研交流群
商业服务