YO-CPT-ru
收藏资源简介:
YO-CPT-ru(YouTube-Oriented dataset for Continual Pre-Training, Russian)是一个大规模、高质量的俄语语音语料库,语音数据来源于YouTube(通过YODAS2数据集)。数据集包含约163万条语音片段,总计约6052小时,为24kHz单声道音频。经过严格质量过滤和处理,形成干净、单人、适合文本到语音(TTS)任务的语音片段。每条语音片段附带了集成验证的转录文本、带标点和重音标记的去归一化文本变体、词级强制对齐信息、视频内及跨视频的说话人身份标识、音频质量(MOS)评分,以及基于语音和(可用的)屏幕上人脸构建的说话人画像。其主要设计目的是用于TTS模型的持续大规模预训练,提供TTS级质量的音频(去噪、响度归一化、边界干净、强制对齐)和丰富的文本及说话人条件信息。此外,也适用于自动语音识别(ASR)、说话人验证和话轮检测等任务。数据经过三阶段流水线处理:ASR挖掘、TTS处理和元数据丰富化,确保每个样本包含音频波形和详细元数据。
YO-CPT-ru (YouTube-Oriented dataset for Continual Pre-Training, Russian) is a large-scale, rigorously quality-filtered Russian speech corpus, with its speech data sourced from YouTube via the YODAS2 dataset. This dataset has been processed to produce clean, single-speaker speech segments suitable for Text-to-Speech (TTS) tasks. Each speech segment comes with integratively verified transcriptions, de-normalized text variants with punctuation and accent markings, word-level forced alignment information, speaker identifiers within and across videos, audio quality Mean Opinion Score (MOS) ratings, and a speaker profile constructed based on speech and (where available) on-screen facial data. The dataset contains approximately 1.63 million speech segments, totaling roughly 6052 hours of 24 kHz mono audio. Its primary design purpose is to support the large-scale continual pre-training phase of TTS models, providing TTS-grade audio (denoised, loudness-normalized, cleanly segmented, with forced alignment) and rich textual and speaker-conditioned information. Furthermore, this dataset is also applicable to other tasks: Automatic Speech Recognition (ASR, using integratively consistent transcriptions), speaker verification (leveraging intra-video and cross-video speaker IDs), and turn detection (single-speaker segmentation paired with word and pause timing information). The dataset is processed through a well-designed three-stage pipeline: 1) ASR Mining: Converting raw YouTube audio into clean, transcribed, single-speaker segments; 2) TTS Processing: Transforming transcribed segments into TTS-grade audio with word-level forced alignment; 3) Metadata Enrichment: Adding accent markings, de-normalization and punctuation to the text, and constructing speaker profiles that fuse both speech and visual information. Each sample in the dataset includes audio waveforms and a rich set of metadata fields, including multi-format text, duration, speaker ID, language tags, detailed speaker descriptions, and MOS ratings.
数据集概述:YO-CPT-ru
YO-CPT-ru 是一个大规模、高质量过滤的俄语语音数据集,专为 TTS(文本转语音)模型的持续预训练(CPT)而设计。该数据集源自 YouTube(通过 YODAS2 获取),经过多阶段处理,生成清洁、单人说话、达到 TTS 级别的语音片段。
核心规模与用途
- 规模:约 163 万条语音片段,总计约 6,052 小时,24 kHz 单声道音频。
- 主要用途:TTS 模型的持续预训练(CPT)。
- 其他适用任务:
- 自动语音识别(ASR)
- 说话人确认(Speaker Verification)
- 话轮检测(Turn-Detection)
数据内容
每条记录包含丰富的标注信息:
- 音频:波形(嵌入的 WAV 字节)
- 文本:规范化的 ASR 转录文本(小写、无标点)
- 文本_去规范化:带有重音标记、大小写和标点的文本
- 文本_对齐:词级强制对齐,包含静音标签
- 说话人标识:视频内说话人 ID 和跨视频说话人 ID
- 说话人描述:基于声音和人脸(如可用)构建的说话人画像(JSON 格式)
- 音频质量评分:MOS 分数
数据处理流水线
数据集经过三个主要处理阶段:
阶段 1 - ASR 挖掘
- VAD 分割(Silero VAD)
- 说话人一致性检查(VoxBlink2)
- 音频质量过滤(MOS ≥ 3.0)
- ASR 集成(Whisper、GigaAM、Vosk)和交叉验证
阶段 2 - TTS 处理
- 反欺骗检测(Spectra-0)
- 语音增强(ClearVoice MossFormer2)
- 响度归一化和削波保护
- VAD 边缘检查和重新裁剪
- 强制对齐(wav2vec2-BERT)
阶段 3 - 元数据丰富
- 重音标记(RUAccent)
- 去规范化和标点恢复(GPT-4.1-mini)
- 说话人画像构建:声音特征、人脸识别和描述
说话人标注
- 视频内说话人 ID:137,082 个独特说话人
- 跨视频说话人 ID:17,598 个跨视频身份,其中 2,349 个出现在至少 3 个视频中
数据格式
数据集可通过 Hugging Face Datasets 库加载:
ds = load_dataset("NCSpeech/YO-CPT-ru", split="train", streaming=True)
偏差、风险与限制
- 自动标注:所有标签均由模型生成,未经人工验证,可能存在少量错误。
- 视觉画像:仅基于单个视频片段的几帧图像,不代表说话人的总体外观。
- 属性估计:说话人画像中的人口统计学属性为自动估计,可能不准确。
- 来源代表性:数据集反映了俄语 YouTube 内容的分布,某些说话人、口音和领域可能存在过采样或欠采样。
许可证
YO-CPT-ru 是一个衍生数据集。标注和编译部分采用 CC BY 4.0 许可。音频源来自 YODAS2,并遵循 CC BY 3.0 许可。用户需自行遵守各上游组件的许可条款。
引用
使用该数据集时,请引用以下信息:
bibtex @misc{yocptru2026, title = {YO-CPT-ru: A YouTube-Oriented Russian Speech Corpus for Continual Pre-Training}, author = {{NCSpeech team}}, year = {2026}, howpublished = {Hugging Face Hub}, url = {https://huggingface.co/datasets/NCSpeech/YO-CPT-ru} }




