gooshkon-chunks
收藏资源简介:
Gooshkon MP3 chunks 是一个面向波斯语自动语音识别(ASR)任务的音频数据集。该数据集包含嵌入的 MP3 格式音频片段,每个片段时长约为30秒,基于检测到的安静间隔进行切分,安全范围在12至48秒之间。数据集中每个样本包含四个字段:音频文件(audio)、来自 Koochik 的转录文本(koochik_transcript)、来自 Gemini 3.7 的转录文本(gemini37_transcript)以及经过波斯语归一化处理的 Gemini 3.7 转录文本(gemini37_persian_normalized_transcript)。需要注意的是,源录音与转录本并非严格对齐,而是利用声学静默边界来避免切分单词,从而尽可能保留语音的完整性。该数据集可用于训练和评估波斯语语音识别模型。
Gooshkon MP3 chunks is an audio dataset for Persian automatic speech recognition (ASR) tasks. The dataset contains embedded MP3 audio chunks, each approximately 30 seconds long, segmented based on detected silence intervals with a safe range of 12 to 48 seconds. Each sample includes four fields: audio file, transcript from Koochik, transcript from Gemini 3.7, and the Gemini 3.7 transcript normalized for Persian. Note that the source recordings and transcripts are not strictly aligned; instead, acoustic silence boundaries are used to avoid splitting words, preserving speech integrity as much as possible. This dataset can be used for training and evaluating Persian speech recognition models.
数据集概述
名称:Gooshkon MP3 chunks
标签:音频、语音、波斯语
任务类别:自动语音识别(Automatic Speech Recognition)
语言:波斯语(fa)
数据集特点
- 数据集格式为 Hugging Face 音频数据集,为单列结构。
- 每一行数据在
audio列中包含可嵌入、可播放的 MP3 音频字节。 - 音频片段目标时长约为 30 秒,选择在检测到的静音区间进行切分,安全范围为 12–48 秒。
数据字段
| 字段名 | 数据类型 | 说明 |
|---|---|---|
audio |
音频 | 包含音频文件内容 |
koochik_transcript |
字符串 | Koochik 转录文本 |
gemini37_transcript |
字符串 | Gemini 3.7 转录文本 |
gemini37_persian_normalized_transcript |
字符串 | Gemini 3.7 转录文本的波斯语规范化版本 |
处理说明
- 源录音并未与转录文本进行对齐。
- 本次发布使用声学静音边界进行切分,以便在存在可用停顿时避免切割单词。




