遇见数据集

blue_archive_tts

收藏
魔搭社区2026-07-15 更新2026-07-15 收录
官方服务:

资源简介:

# 碧蓝档案 (Blue Archive) 语音数据集 由散乱的每角色 `all.zip`/`all.txt` 整理成的规范 TTS 训练数据集。 生成脚本: `neko-speech/data/process_blue_archive.py` ## 目录结构 ``` dataset_clean/ ├── train.list # 全量训练 list (所有角色, 17213 条) ├── speaker_map.csv # 拼音 ↔ 中文名 ↔ CH代码 ↔ 条数 (保留中文信息) ├── <pinyin>/ # 每个角色一个目录 (133 个) │ ├── *.wav # 筛选后的音频 │ └── <pinyin>.list # 单角色训练 list (可单独训练) └── _arona_cn/ # 阿罗娜中配音频 (1 条, 无文本标注, 保留供以后补标) ``` ## list 行格式 (GPT-SoVITS 风格, `|` 分隔) ``` /data/<pinyin>/<wav>|<pinyin>|JA|<日文原文> ``` - **col1** 路径: `/data` 是**占位符**前缀, 部署时替换成实际数据目录。 - **col2** speaker id: 用**拼音**。原始数据第二列全是占位符 `all`, 已按角色改成真实 id。 - **col3** 语言: 全部 `JA`。 - **col4** 文本: 日文原文。 ## 关键决策 - **speaker id 为什么用拼音而不是 CH 代码**: `CHxxxx` 是**皮肤级**编号, 一个角色常有多个 (如 优香=CH0184+CH0284)。用 CH 代码会把一个人拆成多个假"说话人"。中文文件夹名才是可靠的角色身份, 转拼音保证 ASCII 路径安全。完整 CH 代码列表见 `speaker_map.csv`。 - **中文信息保留**: `speaker_map.csv` 记录 拼音↔中文名↔所有CH代码。阿罗娜的中配音频存于 `_arona_cn/`。 ## 已知的少量缺标注 (源数据本身缺, 非处理错误) | 角色 | 有标注 | 音频数 | 说明 | |------|-------|-------|------| | huizhang (会长) | 5 | 6 | `Main_11000_014.wav` 源文本为空 | | wang (望) | 107 | 110 | `exskill_1/2/3` 源 list 无对应行 | | baizi (白子三年级) | 71 | 72 | 1 条音频源 list 无对应行 | 多出的 wav 已解压保留在角色目录, 只是未进 list。 ## 未纳入的原始文件 (已按需丢弃) - `A使用须知/` — 使用说明, 非数据 - `*_日期.zip` (如 `YiHua_25.07.26.zip`) — 未筛选素材包 - `wiki.txt` — 未校对字幕 - 各角色的 `.zip` 源包 (已解压)

提供机构:
maas
创建时间:
2026-07-05
二维码
社区交流群
二维码
科研交流群
商业服务