遇见数据集

DWADASH

收藏
arXiv2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

DWADASH是目前规模最大的孟加拉语多方言平行语料库,由锡尔赫特工程学院构建,旨在为多方言神经机器翻译提供统一基准。该语料库包含14,562行对齐数据,覆盖12种方言区域,共51,541个非空平行句对,通过整合Ancholik-NER、Anubhuti等七项现有数据集并额外添加2,510条经母语专家验证的平行句对而成。构建过程包括数据集成、去重、Unicode标准化及分词对齐等步骤,最终按80/10/10划分为训练、开发与测试集。该数据集主要应用于多方向方言翻译任务(方言→标准语、标准语→方言、方言间直接翻译),旨在克服传统中继翻译的误差累积问题,为方言使用者提供包容性的数字语言服务。

DWADASH is the largest Bengali multi-dialect parallel corpus to date, constructed by Sylhet Engineering College, with the objective of providing a unified benchmark for multi-dialect neural machine translation. This corpus consists of 14,562 aligned data entries, spanning 12 dialect regions, and contains a total of 51,541 non-empty parallel sentence pairs. It is compiled by integrating seven existing datasets such as Ancholik-NER and Anubhuti, along with an additional 2,510 parallel sentence pairs validated by native language experts. The construction process comprises data integration, deduplication, Unicode standardization, word segmentation and alignment, and finally splits the corpus into training, development and test sets with a ratio of 80:10:10. This dataset is primarily applied to multi-directional dialect translation tasks (dialect → Standard Bengali, Standard Bengali → dialect, and direct cross-dialect translation), aiming to resolve the error accumulation issue in traditional relay translation and provide inclusive digital language services for dialect speakers.

创建时间:
2026-08-12
搜集汇总
数据集介绍
DWADASH 数据集图片
构建方式
该数据集为孟加拉语多方言神经机器翻译构建了迄今规模最大的平行语料库,整合了Ancholik-NER、Anubhuti、BanglaDial、BhasaBodh、ChatgaiyyaAlap、ONUBAD和Vashantor七个既有数据集,并新增了由母语者验证的2,510条人工双语平行句对,覆盖Rangpur、Tangail、Kishoreganj、Narail和Narsingdi五种此前未被充分研究的方言。数据集包含14,562行对齐数据,覆盖12种方言,最终得到51,541对非空平行句对,并已公开于Mendeley Data。
特点
该数据集具有显著的多方言覆盖度和规模优势,每个方言均与标准口语孟加拉语对齐,形成了清晰的多向平行结构。数据集呈现明显的类别不均衡特征,Chittagonian样本量最大,而新增方言样本量较小,这为研究低资源场景下的跨方言泛化提供了独特视角。数据集的构建经过严格的净化流程,包括Unicode规范化、去重和过滤,并采用分层抽样确保训练、开发和测试集比例合理,避免了数据泄漏。其规模与方言多样性使得系统性对比实验和跨方言迁移分析成为可能。
使用方法
该数据集可直接用于微调序列到序列的神经机器翻译模型,论文展示了BanglaT5、NLLB-200和mBART-50三种架构的对比实验,并采用参数高效的DoRA适配方法进行微调。支持的翻译方向包括方言到标准语、标准语到方言以及方言到方言的直接翻译,无需经过标准语中转。使用时需遵循指定的预处理流程,即文本标准化、去重、分词和划分数据,并按照官方提供的脚本和配置进行模型训练与评估。此外,数据集也可用于方言识别、跨方言迁移学习以及数据集规模效应的研究。
背景与挑战
背景概述
孟加拉语作为全球使用人数众多的语言之一,其内部方言差异显著,却长期未获自然语言处理领域的足够关注。2026年,来自孟加拉国Sylhet Engineering College的研究团队,由Tanbir Ahmed、Rakib Ullah等人领衔,构建了迄今规模最大的孟加拉语多方言平行语料库DWADASH。该数据集整合了七个既有数据集,并辅以母语者验证的人工扩充,涵盖12种方言,共形成51,541个非空平行句对,为方言间的直接神经机器翻译提供了可能。研究团队还系统评估了BanglaT5、NLLB-200、mBART-50等模型,发现语言专属的T5模型凭借深层单语预训练优势,其性能显著超越参数规模更大的多语模型,为低资源方言翻译树立了新的标杆。
当前挑战
语言方言翻译的核心挑战在于数据稀缺与模型适应性不足。现有平行语料多集中于标准语,方言数据零散且高度不均,导致模型难以捕捉形态差异。构建过程中,团队需整合多个来源,应对方言拼写不统一和类别失衡问题,尤其是标准语与低资源方言间高达21:1的不平衡比例。此外,多语模型的词汇切分常破坏方言词素,而直接方言间翻译又缺乏足够监督信号,翻译质量严重受限于形态距离与数据量的交互作用。本研究虽通过人工扩充和参数高效微调缓解了部分难题,但方言特有词法错误、方向不对称及低资源方言的欠拟合仍是未竟挑战。
常用场景
经典使用场景
DWADASH数据集作为目前规模最大的孟加拉语多方言平行语料库,其经典使用场景聚焦于多方言神经机器翻译(NMT)模型的训练与评估。该语料库整合了七个既有数据集并辅以人工扩充,覆盖标准口语孟加拉语(SCB)及十一种地域方言,提供了超过五万条平行句对,使研究者能够训练统一的多方向翻译系统,实现方言到标准语、标准语到方言以及方言间的直接翻译,从而有效规避传统中继翻译方法中的级联错误。
衍生相关工作
DWADASH数据集的发布催生了一系列衍生工作,涵盖方言语言资源构建、模型架构优化及评估体系完善等多个维度。后续研究基于该语料库深入探究了不同预训练策略与适配器结构在多方言翻译中的表现,推动了针对孟加拉语形态复杂性的专用tokenizer开发。此外,其公开的基准测试结果亦成为衡量新兴模型性能的参照,并激发了跨语言迁移学习、数据增强技术及多模态方言翻译等方向的探索。
数据集最近研究
最新研究方向
当前数据集研究的前沿方向聚焦于构建大规模、多方言平行的孟加拉语机器翻译资源,以突破传统仅覆盖标准口语(SCB)的范式。DWADASH基准语料库整合了七个既有数据集及人工校验的新增方言对,涵盖12种地区变体,形成迄今规模最大的多方言平行语料,为低资源方言的神经机器翻译(NMT)提供坚实的数据基础。研究趋势强调从单向或双语的翻译转向多方向、统一的翻译框架,并采用参数高效的DoRA微调技术对序列到序列模型(如BanglaT5、NLLB-200、mBART-50)进行系统基准测试,发现深度单语预训练模型在方言翻译任务上优于大规模多语言模型。数据集规模效应研究揭示,当平行句对超过约3000对时,翻译质量的提升趋于饱和,而语言的形态邻近性对翻译效果的影响超过单纯的数据量。此外,将优化模型部署于INT8量化的Web应用中,推动方言翻译技术的实用化与普惠化,旨在消除数字鸿沟,促进少数方言群体的数字包容性。
相关研究论文
  • 1
    Unified Multi-Dialectal Neural Machine Translation for Bangla Using the Dwadash Benchmark Corpus锡尔赫特工程学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务