遇见数据集

AigizK/notebooklm_rus

收藏
Hugging Face2026-03-26 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - ru license: cc-by-nc-4.0 task_categories: - text-to-speech - automatic-speech-recognition tags: - podcast - russian - notebooklm - tts - emotional-speech size_categories: - n<1K --- # NotebookLM Russian Podcast Dataset Датасет содержит записи подкастов, сгенерированных с помощью Google NotebookLM на русском языке. ## Описание - **Голоса:** 2 диктора — мужской и женский - **Общая длительность:** 77 ч 23 мин 22 сек - **Количество эпизодов:** 417 - **Формат аудио:** WAV, 24 kHz, моно - **Язык:** русский ## Структура датасета | Поле | Тип | Описание | |------|-----|----------| | `audio` | Audio | Аудиозапись эпизода (24 kHz, моно) | | `transcription` | string | Полная текстовая расшифровка эпизода | | `segments` | string (JSON) | Посегментная разметка с таймкодами и идентификаторами спикеров | | `episode` | string | Название эпизода | ### Формат поля `segments` ```json [ { "Start": 0.0, "End": 5.64, "Speaker": 0, "Content": "Текст сегмента..." } ] ``` - `Speaker: 0` — первый диктор - `Speaker: 1` — второй диктор ## Цель создания Датасет создан в исследовательских целях для изучения возможности создания качественного и приятного Text-to-Speech на русском языке. Записи NotebookLM отличаются выразительной, эмоциональной и естественной речью, что делает их потенциально ценным материалом для обучения TTS-моделей с передачей эмоций и интонаций. ## Использование ```python from datasets import load_dataset ds = load_dataset("AigizK/notebooklm_rus", split="train") print(ds[0]) ```

语言: - ru(俄语) 许可协议:cc-by-nc-4.0 任务类别: - 文本转语音(Text-to-Speech, TTS) - 自动语音识别 标签: - 播客 - 俄语 - NotebookLM(Google NotebookLM) - TTS - 情感语音 规模类别: - 样本数少于1000(n<1K) # NotebookLM 俄语播客数据集 本数据集包含由Google NotebookLM生成的俄语播客音频片段。 ## 数据集概况 - **发声者:** 2名配音员,分别为男性与女性 - **总时长:** 77小时23分22秒 - **剧集总数:** 417集 - **音频格式:** WAV,24 kHz,单声道 - **语言:** 俄语 ## 数据集结构 | 字段名 | 数据类型 | 描述 | |------|-----|----------| | `audio` | Audio(音频类型) | 剧集音频片段(24 kHz,单声道) | | `transcription` | string(字符串) | 剧集完整文本转录内容 | | `segments` | string (JSON) | 包含时间码与说话人标识的分段标注信息 | | `episode` | string(字符串) | 剧集名称 | ### `segments`字段格式 json [ { "Start": 0.0, "End": 5.64, "Speaker": 0, "Content": "Текст сегмента..." } ] - `Speaker: 0` — 第一名配音员 - `Speaker: 1` — 第二名配音员 ## 构建目标 本数据集旨在开展俄语高质量文本转语音相关研究。由NotebookLM生成的音频具备富有表现力、情感饱满且自然流畅的语音特质,可作为训练具备情感与语调传递能力的TTS模型的优质训练素材。 ## 使用示例 python from datasets import load_dataset ds = load_dataset("AigizK/notebooklm_rus", split="train") print(ds[0])

提供机构:
AigizK
二维码
社区交流群
二维码
科研交流群
商业服务