遇见数据集

YO-CPT-ru

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

YO-CPT-ru(YouTube-Oriented dataset for Continual Pre-Training, Russian)是一个大规模、高质量的俄语语音语料库,语音数据来源于YouTube(通过YODAS2数据集)。数据集包含约163万条语音片段,总计约6052小时,为24kHz单声道音频。经过严格质量过滤和处理,形成干净、单人、适合文本到语音(TTS)任务的语音片段。每条语音片段附带了集成验证的转录文本、带标点和重音标记的去归一化文本变体、词级强制对齐信息、视频内及跨视频的说话人身份标识、音频质量(MOS)评分,以及基于语音和(可用的)屏幕上人脸构建的说话人画像。其主要设计目的是用于TTS模型的持续大规模预训练,提供TTS级质量的音频(去噪、响度归一化、边界干净、强制对齐)和丰富的文本及说话人条件信息。此外,也适用于自动语音识别(ASR)、说话人验证和话轮检测等任务。数据经过三阶段流水线处理:ASR挖掘、TTS处理和元数据丰富化,确保每个样本包含音频波形和详细元数据。

YO-CPT-ru (YouTube-Oriented dataset for Continual Pre-Training, Russian) is a large-scale, rigorously quality-filtered Russian speech corpus, with its speech data sourced from YouTube via the YODAS2 dataset. This dataset has been processed to produce clean, single-speaker speech segments suitable for Text-to-Speech (TTS) tasks. Each speech segment comes with integratively verified transcriptions, de-normalized text variants with punctuation and accent markings, word-level forced alignment information, speaker identifiers within and across videos, audio quality Mean Opinion Score (MOS) ratings, and a speaker profile constructed based on speech and (where available) on-screen facial data. The dataset contains approximately 1.63 million speech segments, totaling roughly 6052 hours of 24 kHz mono audio. Its primary design purpose is to support the large-scale continual pre-training phase of TTS models, providing TTS-grade audio (denoised, loudness-normalized, cleanly segmented, with forced alignment) and rich textual and speaker-conditioned information. Furthermore, this dataset is also applicable to other tasks: Automatic Speech Recognition (ASR, using integratively consistent transcriptions), speaker verification (leveraging intra-video and cross-video speaker IDs), and turn detection (single-speaker segmentation paired with word and pause timing information). The dataset is processed through a well-designed three-stage pipeline: 1) ASR Mining: Converting raw YouTube audio into clean, transcribed, single-speaker segments; 2) TTS Processing: Transforming transcribed segments into TTS-grade audio with word-level forced alignment; 3) Metadata Enrichment: Adding accent markings, de-normalization and punctuation to the text, and constructing speaker profiles that fuse both speech and visual information. Each sample in the dataset includes audio waveforms and a rich set of metadata fields, including multi-format text, duration, speaker ID, language tags, detailed speaker descriptions, and MOS ratings.

创建时间:
2026-07-24
原始信息汇总

数据集概述:YO-CPT-ru

YO-CPT-ru 是一个大规模、高质量过滤的俄语语音数据集,专为 TTS(文本转语音)模型的持续预训练(CPT)而设计。该数据集源自 YouTube(通过 YODAS2 获取),经过多阶段处理,生成清洁、单人说话、达到 TTS 级别的语音片段。

核心规模与用途

  • 规模:约 163 万条语音片段,总计约 6,052 小时,24 kHz 单声道音频。
  • 主要用途:TTS 模型的持续预训练(CPT)。
  • 其他适用任务
    • 自动语音识别(ASR)
    • 说话人确认(Speaker Verification)
    • 话轮检测(Turn-Detection)

数据内容

每条记录包含丰富的标注信息:

  • 音频:波形(嵌入的 WAV 字节)
  • 文本:规范化的 ASR 转录文本(小写、无标点)
  • 文本_去规范化:带有重音标记、大小写和标点的文本
  • 文本_对齐:词级强制对齐,包含静音标签
  • 说话人标识:视频内说话人 ID 和跨视频说话人 ID
  • 说话人描述:基于声音和人脸(如可用)构建的说话人画像(JSON 格式)
  • 音频质量评分:MOS 分数

数据处理流水线

数据集经过三个主要处理阶段:

阶段 1 - ASR 挖掘

  • VAD 分割(Silero VAD)
  • 说话人一致性检查(VoxBlink2)
  • 音频质量过滤(MOS ≥ 3.0)
  • ASR 集成(Whisper、GigaAM、Vosk)和交叉验证

阶段 2 - TTS 处理

  • 反欺骗检测(Spectra-0)
  • 语音增强(ClearVoice MossFormer2)
  • 响度归一化和削波保护
  • VAD 边缘检查和重新裁剪
  • 强制对齐(wav2vec2-BERT)

阶段 3 - 元数据丰富

  • 重音标记(RUAccent)
  • 去规范化和标点恢复(GPT-4.1-mini)
  • 说话人画像构建:声音特征、人脸识别和描述

说话人标注

  • 视频内说话人 ID:137,082 个独特说话人
  • 跨视频说话人 ID:17,598 个跨视频身份,其中 2,349 个出现在至少 3 个视频中

数据格式

数据集可通过 Hugging Face Datasets 库加载:

ds = load_dataset("NCSpeech/YO-CPT-ru", split="train", streaming=True)

偏差、风险与限制

  • 自动标注:所有标签均由模型生成,未经人工验证,可能存在少量错误。
  • 视觉画像:仅基于单个视频片段的几帧图像,不代表说话人的总体外观。
  • 属性估计:说话人画像中的人口统计学属性为自动估计,可能不准确。
  • 来源代表性:数据集反映了俄语 YouTube 内容的分布,某些说话人、口音和领域可能存在过采样或欠采样。

许可证

YO-CPT-ru 是一个衍生数据集。标注和编译部分采用 CC BY 4.0 许可。音频源来自 YODAS2,并遵循 CC BY 3.0 许可。用户需自行遵守各上游组件的许可条款。

引用

使用该数据集时,请引用以下信息:

bibtex @misc{yocptru2026, title = {YO-CPT-ru: A YouTube-Oriented Russian Speech Corpus for Continual Pre-Training}, author = {{NCSpeech team}}, year = {2026}, howpublished = {Hugging Face Hub}, url = {https://huggingface.co/datasets/NCSpeech/YO-CPT-ru} }

搜集汇总
数据集介绍
YO-CPT-ru 数据集图片
构建方式
YO-CPT-ru数据集的构建始于从YODAS2中提取的原始俄语YouTube音频,全程经由三个阶段流水线加工而成。第一阶段为ASR挖掘,运用Silero VAD进行语音活动检测与切片,借助VoxBlink2确保每一切片的说话人一致性,并以DistillMOS评估音频质量,仅保留MOS≥3.0的片段。随后集成Whisper-large-v3-turbo、GigaAM v3 RNNT与Vosk三种异构ASR系统,通过WER交叉验证与ROVER投票生成高精度转录文本。第二阶段聚焦于TTS优化,先后应用Spectra-0反欺骗过滤去除合成语音,利用ClearVoice MossFormer2进行降噪与去混响增强,实施响度归一化与削波保护,并通过二次VAD边界精修与重新转录比对确保音频起始与结尾的干净。最终借助wav2vec2-BERT模型完成词级强制对齐。第三阶段进行元数据丰富,包括RUAccent词重音标注、GPT-4.1-mini文本去规范化与标点恢复,以及通过TalkNet与LVFace实现基于面部与语音的说话人身份聚类与画像构建。
特点
该数据集包含约163万条话语,总计超过6052小时的24千赫兹单声道音频,均为单说话人且经质量严格过滤至TTS级标准。每条记录除原始转录外,还提供带重音标记的标点去规范化文本、词级强制对齐结果(含静音标签)、视频内及跨视频的说话人身份标识、基于DistillMOS的音频质量评分,以及融合面部与语音信息的说话人画像。画像字段涵盖音频层面的音高、明亮度、气息度、语速与性别,并在面部可用时进一步包含年龄、国籍、外貌与风格描述,为多模态说话人建模提供了丰富维度。数据集同时适用于文本转语音的持续预训练、自动语音识别、说话人验证与话轮检测等多种任务场景。
使用方法
使用者可通过Hugging Face Datasets库以流式方式加载数据集,调用`load_dataset('NCSpeech/YO-CPT-ru', split='train', streaming=True)`即可获取迭代器。每条样本以字典形式呈现,包含`audio`(嵌入的24千赫兹波形)、`text`(归一化转录)、`text_denorm`(去规范化与重音文本)、`text_alignment`(词级对齐与暂停标记)、`duration`(时长)、`local_spk_id`与`global_spk_id`(说话人身份)、`spk_desc`(说话人画像JSON)及`mos_score`(质量评分)等字段。数据以Parquet格式分片存储,`shard_map.tsv`文件记录了每个分片对应的源YODAS2归档信息,便于溯源。使用时需注意所有标签均为模型自动生成且未经人工校验,可能存在微小误差;面部画像仅反映单一片段的即时外观,且源数据分布受YouTube内容偏向性影响。数据集采用CC BY 4.0许可,使用者需同时遵守上游组件的各自授权条款。
背景与挑战
背景概述
YO-CPT-ru数据集由NCSpeech团队于2026年创建,旨在为俄语文本到语音(TTS)模型的持续预训练(CPT)提供大规模、高质量的单说话人语料。该研究问题聚焦于如何从YouTube海量音频中自动挖掘并精炼出符合TTS训练要求的音频数据,以克服传统TTS数据集规模有限、噪声多、标注匮乏的瓶颈。数据集涵盖约6052小时、163万条话语,并附带集成验证的转录文本、重音标注、强制对齐及说话人画像等丰富元数据,对俄语语音处理领域,尤其是TTS、自动语音识别(ASR)及说话人验证等方向具有重要推动力。
当前挑战
数据集构建面临多重挑战。首先,领域问题是语音数据质量参差不齐,原始YouTube音频包含多说话人重叠、背景噪声、合成语音及录音失真,需通过级联过滤管道(如VAD切分、说话人一致性检测、MOS评分及集成ASR一致性验证)获得纯净单说话人片段。其次,构建过程中,为确保录音室级别音频,需经过防欺骗过滤(Spectra-0)、语音增强(ClearVoice MossFormer2)、响度归一化及边界裁剪重转录一致性校验等复杂处理;跨视频说话人身份识别依赖人脸模态,仅33%的说话人能够获得有效人脸描述,导致大部分说话人缺乏全局身份关联。
常用场景
经典使用场景
YO-CPT-ru作为面向俄罗斯语的持续预训练语料库,专为文本到语音(TTS)模型的大规模预训练阶段设计。其核心使用场景在于提供经过严格质量筛选的单说话人语音片段,每个片段配备集成验证的转录文本、重音标注、词级强制对齐以及说话人画像,使得TTS模型能够在丰富、洁净的多说话人数据上充分学习语音与文本的映射关系。语料库包含约163万条话语、超过6052小时的高质量音频,全部经过降噪、响度归一化和边缘裁剪等TTS级处理,可直接用于端到端TTS系统的持续预训练,显著提升合成语音的自然度和表现力。
实际应用
在实际应用中,YO-CPT-ru可直接赋能商业级俄语语音合成系统的构建,赋能智能语音助手、有声读物生成、语音导航和多媒体内容的自动化配音等场景。其精细的说话人画像字段使得系统能够根据用户偏好选择或定制发声风格,提升交互体验。此外,数据集亦适用于自动语音识别系统的微调、说话人验证和二值话者检测任务,为安防监控、身份认证和会议转写等工业应用提供高质量的训练素材。语料库的开放许可和流式加载设计进一步降低了部署门槛,使其能够便捷地融入企业级的语音技术栈。
衍生相关工作
YO-CPT-ru的构建方法论催生了多项前沿研究工作。其基于YODAS2的语料挖掘策略启发了面向其他语言的大规模TTS语料构建项目,例如类似流水线被移植用于哈萨克语和鞑靼语的持续预训练语料制作。数据集内部的说话人验证和聚类方法(如VoxBlink2和LVFace的结合)推动了跨视频身份链接技术的发展,被后续研究者引用为基准。此外,集成ASR与ROVER投票的转录验证方案成为低资源语音处理领域的重要参考范式,其抗欺骗检测与增强流水线则衍生出多个关于音频质量评价和语音增强模型对比的专项研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务