BharatVaani
收藏资源简介:
该数据集是一个多语言语音翻译数据集,涵盖了多个语言对,包括adl-英语、aml-英语、brx-英语、grt-英语、hne-英语和kas-英语。每个样本包含源语言文本、目标语言文本、源语言音频和目标语言音频,音频采样率为16kHz。数据集已划分为训练集、验证集和测试集,各子集规模如下:adl-eng(训练749,验证94,测试94)、aml-eng(训练1711,验证214,测试214)、brx-eng(训练1309,验证164,测试164)、grt-eng(训练1221,验证152,测试152)、hne-eng(训练6659,验证832,测试832)、kas-eng(训练2739,验证342,未提供测试分割)。该数据集适用于语音翻译、语音识别、文本翻译等任务的研究与开发。
This dataset is a multilingual speech translation dataset covering multiple language pairs, including adl-English, aml-English, brx-English, grt-English, hne-English, and kas-English. Each sample contains source language text, target language text, source language audio, and target language audio, with audio sampling rate of 16kHz. The dataset has been split into training, validation, and test sets. The subset sizes are as follows: adl-eng (train 749, validation 94, test 94), aml-eng (train 1711, validation 214, test 214), brx-eng (train 1309, validation 164, test 164), grt-eng (train 1221, validation 152, test 152), hne-eng (train 6659, validation 832, test 832), kas-eng (train 2739, validation 342, test split not provided). This dataset is suitable for research and development of tasks such as speech translation, speech recognition, and text translation.
BharatVaani 数据集详情
数据集概述
BharatVaani 是一个多语言语音翻译数据集,包含印度多种语言与英语之间的语音与文本对译数据。每个配置均包含源语言(src)与目标语言(tgt)的文本和音频数据。
数据配置与语言对照
数据集共包含 14 个配置,每个配置代表一种印度语言与英语的对译:
| 配置名 | 源语言 |
|---|---|
| adl-eng | 阿迪语(Adi) |
| aml-eng | 阿姆里语(Amri) |
| brx-eng | 博多语(Bodo) |
| grt-eng | 加罗语(Garo) |
| guj-eng | 古吉拉特语(Gujarati) |
| hin-eng | 印地语(Hindi) |
| hne-eng | 恰蒂斯加尔印地语(Chhattisgarhi Hindi) |
| kan-eng | 卡纳达语(Kannada) |
| kas-eng | 克什米尔语(Kashmiri) |
| kha-eng | 卡西语(Khasi) |
| kok-eng | 孔卡尼语(Konkani) |
| lbj-eng | 拉达基语(Ladaki) |
| lep-eng | 雷布查语(Lepcha) |
| xtr-eng | 阿博尔语(Abor) |
数据特征
所有配置均包含以下 7 个字段:
- id(字符串):样本唯一标识符
- src_lang(字符串):源语言代码
- tgt_lang(字符串):目标语言代码
- src_text(字符串):源语言文本
- tgt_text(字符串):目标语言文本
- src_audio(音频,采样率 16000 Hz):源语言语音
- tgt_audio(音频,采样率 16000 Hz):目标语言语音
数据划分与规模
大部分配置包含 train、valid、test 三个划分(hin-eng 配置仅包含 valid 和 test 划分)。各配置的样本数量如下:
| 配置名 | 训练集样本数 | 验证集样本数 | 测试集样本数 |
|---|---|---|---|
| adl-eng | 749 | 94 | 94 |
| aml-eng | 1,711 | 214 | 214 |
| brx-eng | 1,309 | 164 | 164 |
| grt-eng | 1,221 | 152 | 152 |
| guj-eng | 19,036 | 2,379 | 2,379 |
| hin-eng | — | 2,398 | 2,398 |
| hne-eng | 6,659 | 832 | 832 |
| kan-eng | 17,777 | 2,222 | 2,222 |
| kas-eng | 2,739 | 342 | 342 |
| kha-eng | 2,030 | 254 | 254 |
| kok-eng | 9,100 | 1,138 | 1,138 |
| lbj-eng | 811 | 102 | 102 |
| lep-eng | 1,196 | 150 | 150 |
| xtr-eng | 309 | 38 | 38 |
数据集大小
- 总下载大小:约 53.7 GB
- 总数据集大小:约 57.3 GB
- 其中 guj-eng 配置规模最大(下载约 18.2 GB,数据集约 20.1 GB),hin-eng 配置未提供训练集数据。
适用场景
该数据集适用于语音到语音翻译(S2ST)、语音到文本翻译、文本到语音翻译等跨语言语音翻译任务,尤其聚焦于印度低资源语言与英语之间的翻译。




