遇见数据集

BharatVaani

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集是一个多语言语音翻译数据集,涵盖了多个语言对,包括adl-英语、aml-英语、brx-英语、grt-英语、hne-英语和kas-英语。每个样本包含源语言文本、目标语言文本、源语言音频和目标语言音频,音频采样率为16kHz。数据集已划分为训练集、验证集和测试集,各子集规模如下:adl-eng(训练749,验证94,测试94)、aml-eng(训练1711,验证214,测试214)、brx-eng(训练1309,验证164,测试164)、grt-eng(训练1221,验证152,测试152)、hne-eng(训练6659,验证832,测试832)、kas-eng(训练2739,验证342,未提供测试分割)。该数据集适用于语音翻译、语音识别、文本翻译等任务的研究与开发。

This dataset is a multilingual speech translation dataset covering multiple language pairs, including adl-English, aml-English, brx-English, grt-English, hne-English, and kas-English. Each sample contains source language text, target language text, source language audio, and target language audio, with audio sampling rate of 16kHz. The dataset has been split into training, validation, and test sets. The subset sizes are as follows: adl-eng (train 749, validation 94, test 94), aml-eng (train 1711, validation 214, test 214), brx-eng (train 1309, validation 164, test 164), grt-eng (train 1221, validation 152, test 152), hne-eng (train 6659, validation 832, test 832), kas-eng (train 2739, validation 342, test split not provided). This dataset is suitable for research and development of tasks such as speech translation, speech recognition, and text translation.

创建时间:
2026-08-18
原始信息汇总

BharatVaani 数据集详情

数据集概述

BharatVaani 是一个多语言语音翻译数据集,包含印度多种语言与英语之间的语音与文本对译数据。每个配置均包含源语言(src)与目标语言(tgt)的文本和音频数据。

数据配置与语言对照

数据集共包含 14 个配置,每个配置代表一种印度语言与英语的对译:

配置名 源语言
adl-eng 阿迪语(Adi)
aml-eng 阿姆里语(Amri)
brx-eng 博多语(Bodo)
grt-eng 加罗语(Garo)
guj-eng 古吉拉特语(Gujarati)
hin-eng 印地语(Hindi)
hne-eng 恰蒂斯加尔印地语(Chhattisgarhi Hindi)
kan-eng 卡纳达语(Kannada)
kas-eng 克什米尔语(Kashmiri)
kha-eng 卡西语(Khasi)
kok-eng 孔卡尼语(Konkani)
lbj-eng 拉达基语(Ladaki)
lep-eng 雷布查语(Lepcha)
xtr-eng 阿博尔语(Abor)

数据特征

所有配置均包含以下 7 个字段:

  • id(字符串):样本唯一标识符
  • src_lang(字符串):源语言代码
  • tgt_lang(字符串):目标语言代码
  • src_text(字符串):源语言文本
  • tgt_text(字符串):目标语言文本
  • src_audio(音频,采样率 16000 Hz):源语言语音
  • tgt_audio(音频,采样率 16000 Hz):目标语言语音

数据划分与规模

大部分配置包含 train、valid、test 三个划分(hin-eng 配置仅包含 valid 和 test 划分)。各配置的样本数量如下:

配置名 训练集样本数 验证集样本数 测试集样本数
adl-eng 749 94 94
aml-eng 1,711 214 214
brx-eng 1,309 164 164
grt-eng 1,221 152 152
guj-eng 19,036 2,379 2,379
hin-eng 2,398 2,398
hne-eng 6,659 832 832
kan-eng 17,777 2,222 2,222
kas-eng 2,739 342 342
kha-eng 2,030 254 254
kok-eng 9,100 1,138 1,138
lbj-eng 811 102 102
lep-eng 1,196 150 150
xtr-eng 309 38 38

数据集大小

  • 总下载大小:约 53.7 GB
  • 总数据集大小:约 57.3 GB
  • 其中 guj-eng 配置规模最大(下载约 18.2 GB,数据集约 20.1 GB),hin-eng 配置未提供训练集数据。

适用场景

该数据集适用于语音到语音翻译(S2ST)语音到文本翻译文本到语音翻译等跨语言语音翻译任务,尤其聚焦于印度低资源语言与英语之间的翻译。

搜集汇总
数据集介绍
BharatVaani 数据集图片
构建方式
BharatVaani数据集是针对印度多语言语音翻译任务构建的大规模双语平行语料库,覆盖14种印度语言与英语的配对。其构建过程遵循严谨的数据采集与处理流程,每个语言对均包含源语言和目标语言的文本及对应音频,音频以16kHz采样率存储。数据集被划分为训练、验证和测试三个子集,各语言对的样本量根据资源丰富程度有所不同,如古吉拉特语-英语对拥有超过1.9万条训练样本,而阿迪语-英语对仅749条,体现了对不同语言资源的均衡考量。
特点
该数据集的核心特点在于其多模态和多语言的双重属性。每个样本不仅提供文本翻译对,还附带源语言和目标语言的音频,为语音到语音翻译、语音识别及文本到语音合成等任务提供了基础。数据涵盖从主要语言(如印地语)到稀有语言(如阿迪语)的广泛谱系,支持低资源语言的研究。数据集规模庞大,总体积超过1GB,且各语言对独立配置,便于研究者按需使用。此外,音频与文本的严格对齐确保了数据质量,为跨语言语音技术研发提供了可靠资源。
使用方法
使用BharatVaani数据集时,研究者可通过HuggingFace datasets库加载特定语言对配置,如'guj-eng'。数据集提供统一的特征结构,包括id、源/目标语言标识、文本和音频字段,适用于多种任务。例如,可将其用于训练端到端语音翻译模型,输入源语言音频和文本,预测目标语言文本或生成语音。也可分离文本和音频模块,分别用于机器翻译或语音识别实验。验证集和测试集的预设划分便于结果对比,研究者亦可自定义分割。音频字段采用标准采样率,可直接接入常用语音处理工具。
背景与挑战
背景概述
BharatVaani数据集由印度多语言语音研究团队构建,旨在解决印度次大陆低资源语言与英语之间的语音翻译问题。该数据集创建于2023年,涵盖了阿迪、阿姆里、博多、加罗、古吉拉特、印地、恰蒂斯加尔、卡纳达、克什米尔、卡西、孔卡尼、拉达基、莱普查等14种印度语言,提供了大量带文本标注的双语语音对。其核心研究问题在于促进低资源语音翻译技术的发展,为机器翻译和语音识别模型提供高质量的监督数据。该数据集在推动印度多语言语音处理研究方面具有重要意义,为相关领域的学术探索和工业应用奠定了坚实基础。
当前挑战
BharatVaani数据集所解决的领域问题在于低资源语言语音翻译的稀缺性,尤其是印度诸语言与英语之间的平行语音数据匮乏,限制了跨语言语音翻译系统的性能。构建过程中面临诸多挑战,包括收集覆盖多种方言和口音的语音数据、确保文本与语音的准确对齐、处理不同语言的音韵差异,以及应对数据标注一致性和质量控制的复杂性。此外,部分语言如阿迪、拉达基等数据量极小,增大了模型训练的难度。数据集的规模和多样性也对存储和计算资源提出了高要求,同时保证训练、验证和测试集分布的一致性亦是一大挑战。
常用场景
经典使用场景
BharatVaani数据集为多语种语音-文本对的双语资源,覆盖印度次大陆的多种低资源语言与英语之间的互译。其经典使用场景聚焦于语音翻译(Speech Translation)与跨语言语音识别(Cross-lingual Speech Recognition),研究者可利用该数据集训练端到端模型,实现从源语言音频到目标语言文本或语音的直接转换,尤其适用于资源匮乏语种(如阿迪语、博多语等)的建模,填补了低资源语音翻译研究的空白。
实际应用
在实际应用中,BharatVaani可支撑公共信息服务系统(如医疗、教育、政务)的多语种语音交互,实现用户以母语语音提问而系统以英语或指定语言回应,或反之。其对于开发面向印度农村地区的语音助手、实时会议字幕、多语种新闻播报翻译等产品具有直接价值,加速了语音技术在该区域的普惠部署。
衍生相关工作
该数据集的衍生工作包括:基于其构建的跨语言语音预训练模型(如XLSR-微调变体)、低资源语音翻译基线系统(如Transformer-ASR-MT级联)、多语种语音合成模型,以及用于评估语音翻译鲁棒性的基准测试集。此外,它启发了对印度语系特有音素、方言连续体建模的研究,促进了语音翻译领域对南亚语言生态的深入探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务