Kurisu_Voice
收藏资源简介:
Makise Kurisu Multilingual Voice Dataset 是一个非官方的粉丝制作多语言语音数据集,专注于 STEINS;GATE 系列中的角色牧濑红莉栖(Makise Kurisu),包含其变体 Amadeus Kurisu。数据集共包含 13,999 个已标注的语音片段,总时长约 17.14 小时,覆盖六种语言:日语(11.914 小时)、英语(1.95 小时)、西班牙语(0.971 小时)、德语(0.968 小时)、法语(0.862 小时)和中文(0.479 小时)。所有音频均为 WAV 格式,PCM 16-bit,单声道,采样率 24 kHz。数据来源包括 STEINS;GATE 游戏、动画、OVA 以及三首角色歌曲。每个片段均提供转录文本、声学特征(如基频、信噪比、混响衰减等)、说话人身份验证分数、质量等级(A/B/C)以及可选的表达性标签(如 [digital]、[sigh]、[gasp] 等)。标签系统分为事件标签(标记非语言发声)和条件标签(描述整句语气),部分标签由人工标注,部分由自动检测模型生成并经过校准。数据集已划分为训练集(12,832 片段,15.85 小时)、验证集(607 片段,0.66 小时)和测试集(560 片段,0.63 小时),且保证跨语言平行句组不跨分割。数据集适用于文本转语音(TTS)、自动语音识别(ASR)、多语言语音合成、表达性语音建模、说话人验证等任务。注意:六种语言对应六位不同的声优,训练时建议按语言/说话人筛选;自动标签的召回率较低,未标记片段不代表无事件;部分音频来自动画源分离,可能含有背景音乐或噪声,可通过质量等级和污染分数过滤。
The Makise Kurisu Multilingual Voice Dataset is an unofficial fan-made multilingual speech dataset focused on the character Makise Kurisu from the STEINS;GATE series, including its variant Amadeus Kurisu. The dataset contains 13,999 annotated speech clips with a total duration of approximately 17.14 hours, covering six languages: Japanese (11.914 hours), English (1.95 hours), Spanish (0.971 hours), German (0.968 hours), French (0.862 hours), and Chinese (0.479 hours). All audio is in WAV format, PCM 16-bit, mono, with a sampling rate of 24 kHz. Data sources include STEINS;GATE games, anime, OVAs, and three character songs. Each clip provides transcription text, acoustic features (e.g., fundamental frequency, signal-to-noise ratio, reverberation decay), speaker verification scores, quality grades (A/B/C), and optional expressive labels (e.g., [digital], [sigh], [gasp]). The labeling system includes event labels (marking non-linguistic vocalizations) and condition labels (describing the tone of the entire sentence), with some labels manually annotated and others generated by automatic detection models and calibrated. The dataset is split into training set (12,832 clips, 15.85 hours), validation set (607 clips, 0.66 hours), and test set (560 clips, 0.63 hours), ensuring that cross-language parallel sentence groups do not cross splits. The dataset is suitable for tasks such as text-to-speech (TTS), automatic speech recognition (ASR), multilingual speech synthesis, expressive speech modeling, and speaker verification. Note: The six languages correspond to six different voice actors; it is recommended to filter by language/speaker during training. The recall rate of automatic labels is low; unlabeled clips do not necessarily indicate no events. Some audio comes from anime source separation, which may contain background music or noise and can be filtered using quality grades and contamination scores.
Makise Kurisu 多语言语音数据集
数据集概览
该数据集包含 13,999 条带标签的音频片段(总计 17.1423 小时),内容为牧濑红莉栖(Makise Kurisu)角色的语音,包括 Amadeus 变体,涵盖六种语言,音频素材来自 STEINS;GATE 游戏、动画及三首角色歌曲。每条片段均附带转写文本、声学特征测量结果、独立的说话人身份验证,以及(在可确认而非猜测的情况下)表达性标签。本数据集为非官方粉丝制作,与 STEINS;GATE 版权方无关联。
语言与配音演员分布
重要提示:speaker_id 在所有条目中均为 kurisu,因为角色相同,但每种语言的配音演员不同,混合训练将产生六人混合音色。
| 语言 | 配音演员 | 片段数 | 时长(小时) |
|---|---|---|---|
| 日语 (ja) | 今井麻美 | 10,039 | 11.914 |
| 英语 (en) | Trina Nishimura | 1,485 | 1.95 |
| 西班牙语 (es) | 西语配音组 | 775 | 0.971 |
| 德语 (de) | 德语配音组 | 735 | 0.968 |
| 法语 (fr) | 法语配音组 | 591 | 0.862 |
| 中文 (zh) | 中文配音组 | 374 | 0.479 |
技术规格
| 属性 | 值 |
|---|---|
| 音频格式 | WAV PCM 16-bit, 单声道, 24 kHz |
| 角色变体 | kurisu 12,521 · amadeus 1,478 |
| 带表达性标签片段 | 1,309 (9.4%) |
| 跨语言平行句 | 5,124 条,1,497 组 |
| 人工审核片段 | 1,475 |
| 时长中位数/p05/p95 | 3.552s / 0.81s / 11.001s |
数据分割
| 分割 | 片段数 | 时长(小时) |
|---|---|---|
| train | 12,832 | 15.8493 |
| validation | 607 | 0.6627 |
| test | 560 | 0.6303 |
分割基于表演而非文件进行,确保跨语言平行句不跨分割边界,经验证训练/验证/测试集之间零泄漏。
质量分级
| 级别 | 片段数 | 含义 |
|---|---|---|
| A | 8,197 | 无质量标记,转写来源可靠 |
| B | 5,363 | 可用,含至少一个软标记 |
| C | 439 | 有污染、低信噪比、削波或说话人检测矛盾 |
数据集结构
采用 Hugging Face AudioFolder 布局:data/train、data/validation、data/test,每个目录包含 metadata.jsonl 和 WAV 文件。
主要字段说明
transcription:训练标签(文本+标签);text:去除标签后的纯文本language/voice_id:语言标识兼表演者身份character_variant:kurisu或amadeusparallel_group:跨配音版本的平行句分组 IDquality_tier/quality_flags:质量等级与原因speaker_margin:与最接近的其他 STEINS;GATE 角色的独立身份验证差异- 其他声学特征:响度、信噪比、基频、语速等
表达性标签系统
标签分两类:事件标签(非语言发声,标注在发生位置)和条件标签(描述整句特征,置于句首)。
| 标签 | 类型 | 片段数 | 人工标注 | 自动标注 |
|---|---|---|---|---|
[pause] |
结构性 | 814 | 0 | 814 |
[digital] |
条件 | 188 | 132 | 56 |
[sigh] |
事件 | 170 | 22 | 149 |
[gasp] |
事件 | 75 | 41 | 34 |
[singing] |
条件 | 53 | 53 | 0 |
[breath] |
事件 | 31 | 31 | 0 |
自动标签采用精确率优先策略,召回率有意偏低——未打标签不代表片段内无此现象。标签获取依赖多模型校准(VocalBurst 分类器、CED 基座、Qwen3 强制对齐等),并针对不同语言设定独立阈值。
参考音频
reference/ 目录为每种语言提供一条干净、无标签、4–10 秒的参考片段,按测量选择(对最接近的其他角色具有最高区分余量),可用于语音克隆微调。
加载方式
python from datasets import load_dataset ds = load_dataset("starrydark/Kurisu_Voice")
使用限制
- 六种语言对应六位表演者,单说话人训练需按
voice_id过滤 - 语音为角色表演对话,不代表自然日常会话
- 动画音频可能残留音乐、音效或分离伪影,可通过
quality_tier等字段过滤 - 自动标签不可作为官方 TTS 功能特性,需独立评估可控性
许可声明
底层音频、对话、角色等版权归原权利方所有,数据集使用 Hugging Face other 许可标识。禁止用于模仿表演者、误导他人、规避版权或骚扰等用途。使用及再分发者需自行确认所在地法律合规性。




