遇见数据集

BanglaAccento

收藏
github2026-06-30 更新2026-07-23 收录
官方服务:

资源简介:

BanglaAccento 是一个用于孟加拉语区域方言语音识别的基准数据集,包含来自孟加拉国五个方言区域的49名母语者的6,650条录音,支持自动语音识别、自然语言处理和方言分析研究。

BanglaAccento is a benchmark dataset for Bengali regional dialect speech recognition. It contains 6,650 audio recordings from 49 native speakers across five dialectal regions in Bangladesh, supporting research in automatic speech recognition, natural language processing, and dialect analysis.

创建时间:
2026-06-30
原始信息汇总

数据集名称

BanglaAccento

概述

BanglaAccento 是一个用于孟加拉语区域方言语音识别的基准数据集,旨在支持自动语音识别(ASR)、方言识别、语音处理、计算语言学以及低资源语言技术等研究领域。该数据集包含 6,650 条手动验证的语音录音,来自 49 位母语为孟加拉语的讲话者,覆盖孟加拉国的 五种主要区域方言。每条音频录音均配有对应的标准孟加拉语转录文本和全面的元数据。

数据集统计信息

属性
数据集名称 BanglaAccento
版本 v1.0
语言 孟加拉语
母语讲话者数量 49
区域方言数量 5
语音类别数量 19
每类别句子数量 70
总录音数量 6650
音频格式 WAV
采样率 16 kHz
音频声道 单声道
总时长 约 6 小时

区域覆盖范围

数据集包含来自孟加拉国五种区域方言的录音:

  • Barishal
  • Chattogram
  • Noakhali
  • Rangpur
  • Sylhet

录音规格

特征 规格
格式 WAV
位深度 16-bit
采样率 16 kHz
声道 单声道
录音设备 智能手机及外接麦克风
录音环境 安静及中等噪声环境

数据集结构

仓库中包含以下文档及样本数据:

  • 数据集描述(Dataset_Description.pdf)
  • 元数据(Metadata.csv)
  • 数据字典(Data_Dictionary.pdf)
  • 讲话者信息(Speakers_Information.pdf,已匿名化)
  • 引用信息(Citation.txt)
  • 许可证(LICENSE.txt)
  • 数据访问政策(DATA_ACCESS_POLICY.pdf)
  • 访问申请表(Access_Request_Form.docx)
  • 样本数据(Sample_Data.zip)

原始数据集内部目录结构如下:

BanglaAccento/ ├── Fully Processed/ (包含各方言子目录) ├── Processed/ (包含各方言子目录) ├── Original Raw Dataset/ (包含各方言子目录) ├── metadata.csv ├── dataset_script.xlsx └── README.pdf

应用场景

该数据集适用于以下领域:

  • 自动语音识别(ASR)
  • 语音转文本
  • 区域方言识别
  • 口音分类
  • 说话人自适应
  • 语音处理
  • 深度学习
  • 机器学习
  • 自然语言处理
  • 计算语言学

数据集获取方式

完整数据集不提供公开下载。为保护参与者隐私并确保数据负责任使用,完整音频数据集仅对合理的学术请求开放。研究人员需通过访问申请表格(https://docs.google.com/forms/d/e/1FAIpQLSd68-BZtHXPwb1RB5KkN5fYUPZIIXDPLCEbPFZ7y-EsDNmEOA/viewform?usp=dialog)提交请求,并提供姓名、机构、研究目的、预期用途及预期发表信息。

引用信息

使用该数据集时,请引用:

Rahman, M. S., Shimul, S. A., Ramim, S. N. BanglaAccento: A Benchmark Dataset for Bangla Regional Dialect Speech Recognition. Mendeley Data, Version 1. DOI: https://doi.org/10.17632/mwcwbwzf7r.1

许可证

本仓库采用 Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) 许可证。完整数据集采用“按请求访问”政策分发。

未来工作

未来版本的 BanglaAccento 将包括:

  • 更多区域方言
  • 更广泛的讲话者多样性
  • 自发语音
  • 对话录音
  • 说话人验证标签
  • 基于 Whisper、Wav2Vec2 和 HuBERT 的基准基线

相关链接

  • Mendeley Data: https://doi.org/10.17632/mwcwbwzf7r.1
  • GitHub 仓库: https://github.com/MSakibR/BanglaAccento
搜集汇总
数据集介绍
BanglaAccento 数据集图片
构建方式
数据集BanglaAccento精心构建于孟加拉语语音识别领域,旨在填补方言语音基准数据的空白。研究团队招募了49名孟加拉语母语者,覆盖巴里萨尔、吉大港、诺阿卡利、朗布尔和锡尔赫特五大区域方言。每位参与者使用智能手机或外接麦克风在安静或中等噪声环境中录制语音,共采集6650条经过人工校验的录音,总时长约6小时。所有音频以16kHz采样率、16位深度的单声道WAV格式保存,并对应标准孟加拉语文本转写,同时附有详尽的元数据,包括说话人匿名信息、数据字典等,为监督学习与基准测试提供了坚实基础。
特点
BanglaAccento数据集的核心特色在于其精细的方言覆盖与结构化设计。它囊括孟加拉国五种主要方言,每种方言下设有19个语音类别,每类包含70个句子,确保了内容的丰富性与平衡性。数据集分为原始未处理、部分处理和完全处理三个层级,便于研究者按需使用。此外,严格的隐私保护机制通过申请访问制度实现,仅面向学术研究开放,体现了对参与者权益的尊重。该数据集支持方言识别、口音分类、说话人自适应等多维度任务,是低资源语言技术发展中不可多得的宝贵资源。
使用方法
使用BanglaAccento数据集时,研究者需通过官方提交访问申请表单,提供姓名、机构、研究目的等信息,经审核后获取完整音频。数据集以清晰目录结构呈现于GitHub仓库,包含元数据CSV文件、数据字典及示例压缩包。以Python为例,可借助`pandas`加载`metadata.csv`,结合`librosa`或`torchaudio`读取WAV音频。建议将方言标签作为分类目标,语种识别中的训练集划分。未来版本还计划集成Whisper、Wav2Vec2等基线模型,进一步简化基准测试流程。
背景与挑战
背景概述
在低资源语言语音处理领域,孟加拉语作为全球使用人数众多的语言之一,其多样的地域方言给自动语音识别(ASR)系统带来了显著挑战。为应对这一困境,孟加拉Accento数据集应运而生,由亚洲太平洋大学计算机科学与工程系的M. Sakib Rahman、Shahrier Alam Shimul和Salman Nur Ramim于近期创建。该数据集聚焦于孟加拉国五大主要方言(巴里萨尔、吉大港、诺阿卡利、朗布尔、锡尔赫特),通过49位母语者精心录制了6650条经过人工验证的语音样本,每条音频均配有标准孟加拉语转写及详尽元数据。作为首个针对孟加拉方言语音识别的基准数据集,BanglaAccento填补了该领域标准化评估资源的空白,为方言识别、语音处理及计算语言学研究提供了坚实的数据基础,有力推动了低资源语言语音技术的发展。
当前挑战
BanglaAccento数据集所解决的领域核心挑战在于,孟加拉语方言在音系、词汇及韵律上的显著差异导致通用ASR模型表现不佳,而现有资源严重匮乏。构建过程中,团队面临多重困难:首先,需从五个方言区招募能代表各地口音的母语者,并确保录音环境在安静与适度噪音间平衡,这涉及49位志愿者的协调与设备统一;其次,数据标注要求将方言语音精准对齐标准孟加拉语转写,对手动验证的准确性提出极高要求;此外,为保护参与者隐私,数据集采用按需访问政策,需设计严谨的申请与审查流程,在促进学术共享的同时防止滥用。这些挑战的克服,使BanglaAccento成为兼具科学价值与伦理考量的标志性成果。
常用场景
经典使用场景
在低资源语言语音处理领域,方言与口音的多样性构成了自动语音识别(ASR)系统面临的严峻挑战。BanglaAccento数据集涵盖孟加拉国巴里萨尔、吉大港、诺阿卡利、朗布尔和锡尔赫特五大区域方言,共计6,650条经过人工校验的高质量语音样本,每条均配有标准孟加拉语转写及详尽的元数据。该数据集最经典的使用场景便是作为方言感知型ASR系统的训练与评估基准,研究者可借此构建能够跨方言稳健转录的声学模型,亦可用于探究语速、韵律及音素变体等细微语音特征对识别精度的影响,从而推动多方言环境下的语音技术范式迁移。
衍生相关工作
围绕BanglaAccento,多个经典工作已在语音技术的前沿阵地上陆续衍生。研究者通常基于该数据集构建多任务学习框架,同时输出方言类别标签与标准文本序列,借助共享编码器捕获方言特有的声学模式。此外,将该数据集与开源预训练模型(如OpenAI的Whisper、Meta的Wav2Vec2或HuBERT)相结合,已在方言ASR微调与零样本泛化评估中展现出显著的性能提升,并催生了一系列关于方言数据增强策略与对抗训练鲁棒性的深入探讨。这些衍生工作不仅丰富了面向低资源语言的声学建模工具箱,更为后续构建多方言、多环境的综合语音理解系统铺设了坚实的实验基线。
数据集最近研究
最新研究方向
在低资源语言与方言语音处理这一前沿领域,BanglaAccento数据集为孟加拉语区域方言的自动语音识别(ASR)与方言辨识研究提供了标准化基准。当前热点聚焦于利用预训练模型(如Whisper、Wav2Vec2、HuBERT)进行方言自适应与鲁棒性语音到文本系统的开发,以应对多方言场景下的声学与语言变异性。该数据集覆盖五个主要方言区域,包含6650条精细标注的语音样本,显著推动了低资源语言语音技术的基准建立与可复现研究。其严格的访问控制与隐私保护机制,为学术界的负责任数据共享树立了新规范,对促进南亚语言数字化与包容性人工智能发展具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务