Galgame_Speech_ASR_16kHz
收藏资源简介:
Galgame_Speech_ASR_16kHz 数据集是一个从视觉小说(Galgames)中提取的日语语音数据集,专门用于训练自动语音识别(ASR)模型。该数据集包含3,746,321个音频-文本对,总计5,355小时,大小为100.16 GB。数据集采用WebDataset格式,音频文件为16kHz、16位、单声道OGG格式。该数据集旨在微调ASR模型,如Whisper,特别适用于日语动漫风格的语音领域,包括NSFW内容。然而,由于音频质量较低(16kHz),该数据集不适用于文本到语音(TTS)或语音转换(VC)。数据集根据GNU通用公共许可证v3.0授权,并附加了禁止商业使用的限制,除非获得数据集中列出的所有提供商的明确许可。
The Galgame_Speech_ASR_16kHz dataset is a Japanese speech dataset extracted from visual novels (Galgames), specifically developed for training automatic speech recognition (ASR) models. This dataset comprises 3,746,321 audio-text pairs, with a total duration of 5,355 hours and a storage size of 100.16 GB. The dataset is stored in WebDataset format, where the audio files are in 16kHz, 16-bit, mono-channel OGG format. This dataset is intended for fine-tuning ASR models such as Whisper, and is particularly suitable for the Japanese anime-style speech domain, including NSFW content. However, due to the relatively low audio quality associated with the 16kHz sampling rate, this dataset is not applicable for text-to-speech (TTS) or voice conversion (VC) tasks. The dataset is licensed under the GNU General Public License v3.0, with an additional restriction prohibiting commercial use unless explicit permission is obtained from all providers listed in the dataset.
Galgame_Speech_ASR_16kHz 数据集概述
基本信息
- 语言: 日语
- 许可证: GPL-3.0
- 多语言性: 单语种
- 数据集名称: Galgame_Speech_ASR_16kHz
- 数据量: 1M<n<10M
- 任务类别: 自动语音识别
- 标签: 语音, 音频, 文本, 日语, 动漫, 声音, 视觉小说, 美少女游戏
数据集详情
- 大小:
- 3,746,321 个音频文件(均带有转录文本)
- 总计 5,355 小时
- 115 个 tar 文件,总计 100.16 GB,每个 tar 文件(除最后一个外)包含 32,768 个音频-文本对(OGG 和 TXT 文件),每个 tar 文件约 897 MB
- 语言: 日语
- 格式:
- WebDataset 格式
- 16kHz, 16-bit, 单声道 OGG 文件
数据集描述
- 大小: 3,746,321 个音频-文本对,5,355 小时,100GB
- 语言: 日语
- 格式: 16kHz, 16-bit, 单声道 OGG
数据集来源
所有音频文件和转录文本均来自 OOPPEENN/Galgame_Dataset。
修改内容
- 将音频文件重新采样为 16kHz OGG 格式(音量调整为 x0.9 以避免剪切)
- 使用随机 SHA-256 类似的哈希重命名所有文件
- 排除具有多个不同转录文本的音频文件
- 对转录文本进行归一化处理并根据结果过滤音频文件
使用场景
直接使用
- 微调 ASR 模型,如 Whisper,用于日语动漫类语音领域
- 训练 ASR 模型用于 NSFW 领域(如 aegi 和 chupa 声音),Whisper 和其他 ASR 模型大多无法识别
超出范围的使用
- 不适合用于 TTS(文本到语音)和 VC(语音转换),因为音频质量较低(16kHz)
数据集结构
- 数据集采用 WebDataset 格式
- 包含
galgame-speech-asr-16kHz-train-{000000..000114}.tar文件 - 每个 tar 文件包含音频(OGG)和文本(TXT)文件,文件名相同(SHA-256 类似的哈希)
如何使用
- 使用 🤗 Datasets 库加载数据集时,设置
streaming=True以避免一次性下载整个数据集
数据集创建动机
- 希望获得一个大规模的日语音频-文本对 ASR 语料库,用于动漫类语音领域,由专业声优配音,且转录文本准确率 100%
- 个人对 Whisper 无法识别 Galgame 中的 aegi 和 chupa 声音感到沮丧,因此希望训练一个能够识别这些声音的 ASR 模型
偏见、风险和局限性
- 数据集源自(动漫类)Galgame,因此语音与日常生活中的常规表达有很大不同
- 数据集包含 NSFW 音频(aegi 和 chupa)和台词,不适合所有受众
- 数据集不适合用于 TTS 和 VC,因为音频质量较低(16kHz)
- 数据集中女性声音多于男性声音,这可能会在基于该数据集训练的模型中引入性别偏见




