遇见数据集

EtMmohammedHafsati/darija-lid-benchmark

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该存储库包含了从多个公共来源合并的Darija语言识别最终数据集。

This repository contains the final merged Darija language identification dataset prepared from multiple public sources.

提供机构:
EtMmohammedHafsati
搜集汇总
数据集介绍
EtMmohammedHafsati/darija-lid-benchmark 数据集图片
构建方式
该数据集名为Darija LID Benchmark,是一个专门用于摩洛哥阿拉伯语(Darija)语言识别的文本分类基准数据集。其构建过程始于从多个公开数据源下载原始数据,包括Atlasia系列数据集以及Alexandria和黎凡特方言数据集。随后,通过统一的标准化流程将每个来源的数据展平为共享模式,包含文本、方言、来源、是否含有拉丁字母以及分类标签等字段。标签被映射为三类:阿拉伯字母书写的摩洛哥阿拉伯语、拉丁字母书写的摩洛哥阿拉伯语(Arabizi)及其他。数据集中还纳入了部分源数据中明确提供的英文翻译行。为保障数据质量,系统移除了重复的标准化文本行,确保同一文本仅出现一次,并通过来源列保留每一行的出处信息,若来自多个来源则以竖线分隔标记。最终,从533,380条输入行出发,经过去重后得到471,402条有效行,移除了61,978条重复数据以及527条因标签或方言冲突而被排除的行。
特点
该数据集具有显著的结构化与多源融合特点。它区分了两种书写形式的摩洛哥阿拉伯语:阿拉伯字母书写的类别(213,712条)和拉丁字母书写的Arabizi类别(12,468条),同时包含大量其他类别样本(245,222条),涵盖了非摩洛哥方言、英文翻译及其他非目标内容,形成了类别分布不均衡但全面的语言识别挑战。数据集中每一行都附带有来源标识列,可追溯至原始数据集,增强了数据的可解释性。通过去重处理,避免了同一文本的多重出现,提升了数据的纯净度。可视化分析可通过提供的仪表板图进行,直观展示数据集的整体构成。此外,注释中记录了冲突案例,如文本‘دقيقة’在多个来源中被标为不同类别,反映了实际语言识别中常见的歧义问题,为研究者提供了研究边界案例的宝贵资源。
使用方法
该数据集以Hugging Face上的标准格式发布,配置文件名为‘default’,数据文件为test.csv。使用方法简单直接,可通过Hugging Face的datasets库加载:使用`load_dataset('EtMmohammedHafsati/darija-lid-benchmark', split='test')`即可获取测试集。该数据集专为文本分类任务设计,适用场景包括语言识别模型的训练与评估。用户可利用其中的文本列作为输入特征,标签列作为目标类别,构建分类模型。由于数据集已预先划分好测试集,可直接用于模型性能的基准测试。研究者也可根据需要进一步拆分数据,进行交叉验证或适应其他实验设计。数据集以MIT许可协议发布,保障了使用的开放性与灵活性。
背景与挑战
背景概述
Darija(摩洛哥阿拉伯语)作为马格里布地区广泛使用的口语变体,在自然语言处理领域长期面临资源稀缺与标准化缺失的困境。该数据集的创建源于多语言场景下摩洛哥方言识别任务的迫切需求,由研究者EtMmohammedHafsati主导,整合了包括Darija LID Annotation 10k、DODa音频数据集、Alexandria语料库等在内的多个公开资源,于2023年左右构建完成。核心研究问题聚焦于区分三种语言类别:阿拉伯字母书写的摩洛哥方言、拉丁字母(Arabizi)书写的摩洛哥方言及其他语言(包括非摩洛哥方言、英语等),最终形成47万余条标注样本。该数据集填补了摩洛哥方言语言识别基准的空白,为北非地区低资源语言处理、社会语言学研究及多语言模型评估提供了标准化测试平台,其影响辐射至跨方言迁移学习、代码混合文本分析等前沿领域。
当前挑战
该数据集首要解决摩洛哥方言与高资源语言(如标准阿拉伯语、法语、英语)及邻近方言(如埃及方言、黎凡特方言)之间的混淆问题,尤其在文本简短、语境缺失时,阿拉伯字母书写的摩洛哥方言与标准阿拉伯语的区分极为困难,而Arabizi形式的拉丁化拼写则因缺乏统一正字法加剧了识别难度。构建过程中面临两大挑战:其一为多源数据融合时的语义冲突,例如同一文本‘دقيقة’在不同源中被分别标注为摩洛哥方言与非摩洛哥类,需通过去重算法剔除527条冲突样本以维护标签一致性;其二为类别严重不平衡,纯阿拉伯字母的摩洛哥方言样本(21.3万条)远超拉丁化Arabizi样本(1.2万条),需在模型训练中引入重采样或损失加权策略以避免偏向多数类。此外,数据归一化(如去除重复行与标准化文本)虽提升了质量,但可能抹除细微方言变体特征,为深度学习模型的鲁棒泛化留下隐患。
常用场景
经典使用场景
达里贾语(摩洛哥阿拉伯语)作为北非地区的日常交际语言,在社交媒体、语音助手和机器翻译等场景中频繁出现,却常因缺乏标注数据而被主流自然语言处理系统忽视。darija-lid-benchmark数据集的核心使命是识别文本所属的语言变体:摩洛哥阿拉伯语(阿拉伯字母)、摩洛哥拉丁阿拉伯语(Arabizi)或其他语言。该数据集不仅涵盖了字母书写的达里贾语,还创新性地纳入了拉丁字母转写的Arabizi形式,使得系统能够应对摩洛哥用户在数字平台上复杂的多语混杂现象。研究者可利用此数据集训练分类器,在细粒度上区分摩洛哥方言与非摩洛哥文本,为后续方言处理任务奠定基础。
实际应用
在现实应用中,达里贾语的自动识别对于摩洛哥本地的信息检索、社交倾听和客服系统至关重要。该数据集可用于赋能智能语音助手,使其在摩洛哥用户混合使用阿拉伯语、法语和方言时准确判断当前语言模式,从而选择合适的语音识别或翻译模型。同样,它在内容审核场景中能够帮助平台区分摩洛哥方言与其他阿拉伯方言的回帖,提高舆情分析的准确度。对于跨国企业在北非市场的社交媒体分析,该数据集提供的识别能力意味着品牌可以更精准地监测本土消费者的真实声音,免于被标准阿拉伯语或法语文本淹没。可以说,这项资源直接推动了多语、多方言环境中可商用语言识别系统的落地。
衍生相关工作
该数据集的发布直接催生了一系列衍生机型与研究工作。一方面,研究者基于此数据训练了专门针对达里贾语的BERT模型,如DarijaBERT及其变体,通过在下游任务上的微调进一步验证了数据集的区分能力。另一方面,该数据集被用于评估跨方言迁移学习的有效性,探讨摩洛哥达里贾语与黎凡特、埃及等其他阿拉伯方言之间的语义距离。此外,数据集中对冲突样本的标注记录催生了关于方言边界争议性的学术讨论,进而启发了基于软标签或多标签分类的方法学改进。这些衍生工作共同构成了从语言识别到深层方言理解的学术递进链条,使该数据集成为北非自然语言处理领域不可或缺的基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务