trivitaai/Blum_vi_voice
收藏资源简介:
--- language: - vi license: cc-by-4.0 task_categories: - automatic-speech-recognition --- # Blum Vi Voice Vietnamese speech dataset with 757,400 samples (~148GB audio). ## Fields - `split`: train/test split - `index`: sample index - `audio_path`: relative path to audio file in this repo (under `data/`) - `sampling_rate`: 16000 Hz - `duration`: duration in seconds - `text`: transcript ## Loading ```python from datasets import load_dataset ds = load_dataset("trivitaai/Blum_vi_voice") ```
--- 语言: - 越南语 许可协议:知识共享署名4.0(CC BY 4.0) 任务类别: - 自动语音识别(automatic-speech-recognition) --- # Blum Vi语音数据集 该数据集为越南语语音数据集,包含757400条语音样本,总音频容量约148GB。 ## 字段说明 - `split`:训练/测试集划分标识 - `index`:样本索引 - `audio_path`:本仓库中音频文件的相对路径(位于`data/`目录下) - `sampling_rate`:采样率为16000 Hz - `duration`:音频时长,单位为秒 - `text`:语音转写文本 ## 加载方法 可通过如下Python代码加载该数据集: python from datasets import load_dataset ds = load_dataset("trivitaai/Blum_vi_voice")



