遇见数据集

Kurisu_Voice

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

Makise Kurisu Multilingual Voice Dataset 是一个非官方的粉丝制作多语言语音数据集,专注于 STEINS;GATE 系列中的角色牧濑红莉栖(Makise Kurisu),包含其变体 Amadeus Kurisu。数据集共包含 13,999 个已标注的语音片段,总时长约 17.14 小时,覆盖六种语言:日语(11.914 小时)、英语(1.95 小时)、西班牙语(0.971 小时)、德语(0.968 小时)、法语(0.862 小时)和中文(0.479 小时)。所有音频均为 WAV 格式,PCM 16-bit,单声道,采样率 24 kHz。数据来源包括 STEINS;GATE 游戏、动画、OVA 以及三首角色歌曲。每个片段均提供转录文本、声学特征(如基频、信噪比、混响衰减等)、说话人身份验证分数、质量等级(A/B/C)以及可选的表达性标签(如 [digital]、[sigh]、[gasp] 等)。标签系统分为事件标签(标记非语言发声)和条件标签(描述整句语气),部分标签由人工标注,部分由自动检测模型生成并经过校准。数据集已划分为训练集(12,832 片段,15.85 小时)、验证集(607 片段,0.66 小时)和测试集(560 片段,0.63 小时),且保证跨语言平行句组不跨分割。数据集适用于文本转语音(TTS)、自动语音识别(ASR)、多语言语音合成、表达性语音建模、说话人验证等任务。注意:六种语言对应六位不同的声优,训练时建议按语言/说话人筛选;自动标签的召回率较低,未标记片段不代表无事件;部分音频来自动画源分离,可能含有背景音乐或噪声,可通过质量等级和污染分数过滤。

The Makise Kurisu Multilingual Voice Dataset is an unofficial fan-made multilingual speech dataset focused on the character Makise Kurisu from the STEINS;GATE series, including its variant Amadeus Kurisu. The dataset contains 13,999 annotated speech clips with a total duration of approximately 17.14 hours, covering six languages: Japanese (11.914 hours), English (1.95 hours), Spanish (0.971 hours), German (0.968 hours), French (0.862 hours), and Chinese (0.479 hours). All audio is in WAV format, PCM 16-bit, mono, with a sampling rate of 24 kHz. Data sources include STEINS;GATE games, anime, OVAs, and three character songs. Each clip provides transcription text, acoustic features (e.g., fundamental frequency, signal-to-noise ratio, reverberation decay), speaker verification scores, quality grades (A/B/C), and optional expressive labels (e.g., [digital], [sigh], [gasp]). The labeling system includes event labels (marking non-linguistic vocalizations) and condition labels (describing the tone of the entire sentence), with some labels manually annotated and others generated by automatic detection models and calibrated. The dataset is split into training set (12,832 clips, 15.85 hours), validation set (607 clips, 0.66 hours), and test set (560 clips, 0.63 hours), ensuring that cross-language parallel sentence groups do not cross splits. The dataset is suitable for tasks such as text-to-speech (TTS), automatic speech recognition (ASR), multilingual speech synthesis, expressive speech modeling, and speaker verification. Note: The six languages correspond to six different voice actors; it is recommended to filter by language/speaker during training. The recall rate of automatic labels is low; unlabeled clips do not necessarily indicate no events. Some audio comes from anime source separation, which may contain background music or noise and can be filtered using quality grades and contamination scores.

创建时间:
2026-08-22
原始信息汇总

Makise Kurisu 多语言语音数据集

数据集概览

该数据集包含 13,999 条带标签的音频片段(总计 17.1423 小时),内容为牧濑红莉栖(Makise Kurisu)角色的语音,包括 Amadeus 变体,涵盖六种语言,音频素材来自 STEINS;GATE 游戏、动画及三首角色歌曲。每条片段均附带转写文本、声学特征测量结果、独立的说话人身份验证,以及(在可确认而非猜测的情况下)表达性标签。本数据集为非官方粉丝制作,与 STEINS;GATE 版权方无关联。

语言与配音演员分布

重要提示speaker_id 在所有条目中均为 kurisu,因为角色相同,但每种语言的配音演员不同,混合训练将产生六人混合音色。

语言 配音演员 片段数 时长(小时)
日语 (ja) 今井麻美 10,039 11.914
英语 (en) Trina Nishimura 1,485 1.95
西班牙语 (es) 西语配音组 775 0.971
德语 (de) 德语配音组 735 0.968
法语 (fr) 法语配音组 591 0.862
中文 (zh) 中文配音组 374 0.479

技术规格

属性
音频格式 WAV PCM 16-bit, 单声道, 24 kHz
角色变体 kurisu 12,521 · amadeus 1,478
带表达性标签片段 1,309 (9.4%)
跨语言平行句 5,124 条,1,497 组
人工审核片段 1,475
时长中位数/p05/p95 3.552s / 0.81s / 11.001s

数据分割

分割 片段数 时长(小时)
train 12,832 15.8493
validation 607 0.6627
test 560 0.6303

分割基于表演而非文件进行,确保跨语言平行句不跨分割边界,经验证训练/验证/测试集之间零泄漏

质量分级

级别 片段数 含义
A 8,197 无质量标记,转写来源可靠
B 5,363 可用,含至少一个软标记
C 439 有污染、低信噪比、削波或说话人检测矛盾

数据集结构

采用 Hugging Face AudioFolder 布局:data/traindata/validationdata/test,每个目录包含 metadata.jsonl 和 WAV 文件。

主要字段说明

  • transcription:训练标签(文本+标签);text:去除标签后的纯文本
  • language / voice_id:语言标识兼表演者身份
  • character_variantkurisuamadeus
  • parallel_group:跨配音版本的平行句分组 ID
  • quality_tier / quality_flags:质量等级与原因
  • speaker_margin:与最接近的其他 STEINS;GATE 角色的独立身份验证差异
  • 其他声学特征:响度、信噪比、基频、语速等

表达性标签系统

标签分两类:事件标签(非语言发声,标注在发生位置)和条件标签(描述整句特征,置于句首)。

标签 类型 片段数 人工标注 自动标注
[pause] 结构性 814 0 814
[digital] 条件 188 132 56
[sigh] 事件 170 22 149
[gasp] 事件 75 41 34
[singing] 条件 53 53 0
[breath] 事件 31 31 0

自动标签采用精确率优先策略,召回率有意偏低——未打标签不代表片段内无此现象。标签获取依赖多模型校准(VocalBurst 分类器、CED 基座、Qwen3 强制对齐等),并针对不同语言设定独立阈值。

参考音频

reference/ 目录为每种语言提供一条干净、无标签、4–10 秒的参考片段,按测量选择(对最接近的其他角色具有最高区分余量),可用于语音克隆微调。

加载方式

python from datasets import load_dataset ds = load_dataset("starrydark/Kurisu_Voice")

使用限制

  • 六种语言对应六位表演者,单说话人训练需按 voice_id 过滤
  • 语音为角色表演对话,不代表自然日常会话
  • 动画音频可能残留音乐、音效或分离伪影,可通过 quality_tier 等字段过滤
  • 自动标签不可作为官方 TTS 功能特性,需独立评估可控性

许可声明

底层音频、对话、角色等版权归原权利方所有,数据集使用 Hugging Face other 许可标识。禁止用于模仿表演者、误导他人、规避版权或骚扰等用途。使用及再分发者需自行确认所在地法律合规性。

搜集汇总
数据集介绍
Kurisu_Voice 数据集图片
构建方式
该数据集以《命运石之门》系列游戏、动画及角色歌曲中的角色牧濑红莉栖为对象,构建了一个多语种语音语料库。音频经标准化为24kHz单声道PCM格式,并按来源组统一增益至-26 LUFS,以保留动态范围。通过强制对齐和声学分析,为每个片段标注了文本、声学画像、说话人身份验证、质量等级及表达性标签。利用分类器与回归模型自动识别非语言发声与播放条件,并结合人工审核校准阈值。跨语言平行句群被绑定至同一划分,确保无泄漏。
特点
数据集涵盖六种语言、13999个片段,总时长17.14小时,其中日语占比最大。标签体系精细,包括事件标签与条件标签,如[sigh]、[digital],且每个标签均有精度与召回率报告。说话人身份经独立验证,并提供参考音频。质量分级与污染评分便于筛选。跨语言平行语料支持多语种研究,但六种语言对应六位配音演员,需按voice_id分开训练。
使用方法
通过HuggingFace datasets库加载,可使用load_dataset('starrydark/Kurisu_Voice')。支持按语言、质量分级过滤,如选择日语、非C级样本。transcription字段用于训练表达性控制,text字段用于纯文本。parallel_group可用于跨语种对照。参考音频存放于reference目录,便于语音克隆。训练、验证、测试划分已就绪,适合TTS与ASR任务。
背景与挑战
背景概述
Kurisu_Voice数据集由粉丝社区于2023年创建,旨在构建一个多语种、表现力丰富的语音语料库,收录了《命运石之门》中角色牧瀬红莉栖(包括Amadeus变体)的语音。该数据集汇集了来自游戏、动画及角色歌曲的13,999条带标注的语音片段,总时长约17.14小时,覆盖六种语言,并由不同声优配音。其核心研究问题在于为文本转语音(TTS)和自动语音识别(ASR)提供高质量的多语种平行语料,并精细标注表现性标签(如叹息、惊讶、歌唱等)。该数据集的发布对跨语种语音合成、说话人识别及情感表达建模等领域具有重要影响,为研究者提供了独特的多语种角色语音资源,促进了多语种TTS系统的性能提升与可控性研究。
当前挑战
该数据集面临的核心挑战首先在于领域问题:多语种TTS需处理不同语言间的韵律差异及说话人多样性,而本数据集六种语言对应六位不同声优,训练单一模型易导致声音混合,影响说话人一致性。此外,表现性标签的自动标注精度有限,召回率低,对细粒度情感控制构成障碍。构建过程中遇到的挑战包括:跨来源(游戏、动画、歌曲)音频响度不均衡,需精确动态调整;自动标注需校准以避免误报,但小语种样本稀疏导致部分标签无法可靠学习;数据集版权受限,属非官方粉丝作品,需重点防范声音滥用与侵权风险。
常用场景
经典使用场景
Kurisu_Voice数据集为跨语言表达性语音合成研究提供了独特的多维度语音资源,其核心应用在于训练和评估多语种、多角色、多风格的自适应文本到语音系统。数据集中每一条语音片段均配有文本转写、声学特征、情感标注及独立说话人验证信息,为精细控制韵律、情感和发音特征的神经TTS模型(如VITS、XTTS)提供高质量训练样本。尤为重要的是,该数据集内置了跨语言平行句对,使研究者能够构建基于同一语义内容的跨语言语音转换与克隆系统,探索说话人特征与语言特征解耦的深层机制。数据集的噪声控制、动态范围和录音条件的系统性标注,为稳健语音合成系统的开发提供了真实世界的复杂场景测试基准。
衍生相关工作
该数据集的官方设计衍生了多项值得关注的学术工程方向。其自带的泄漏控制切分方案,为多说话人、多语言语料库的构建树立了防止数据穿越的范例。对音库中高强度语音的层级标记方法,启发了基于回归模型的自动标注工具的研发。在数据整理过程中,研究者结合已有模型进行标签自动校准的流程,为半监督式语音语料标注提供了实践蓝图。此外,数据集中的精细质量控制指标(如说话人相似度与竞争样本差异)催生了对基于ECAPA的说话人嵌入特征更全面的评价研究。在开源社区,该数据集常与现有的高音质多语言合成框架结合,构成一个可以快速评测和迭代的脚本基线。一系列使用该语料库的后续研究,推动了面向角色扮演、可控情感表达及多语言配音场景的专用语音合成与声纹转换系统的原型开发。
数据集最近研究
最新研究方向
当前,多语言与多说话人语音合成研究正朝着细粒度情感控制与跨语言一致性的方向深化。Kurisu_Voice数据集以其独特的六语种、单角色多演绎配音结构,为探索语音身份与语言多样性之间的平衡提供了宝贵资源。其前沿研究聚焦于利用大规模平行语料进行跨语种韵律迁移,以及通过精确标注的非言语发声(如叹息、倒吸)和条件标签(如数字效果)实现表现力可控的语音生成。该数据集对数据泄露的严谨防控、基于声学测量的质量分层以及参考音频的甄选,为构建公正、可复现的语音合成评估体系树立了新标杆,对推动虚拟角色语音克隆技术的伦理化与实用化发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务