遇见数据集

DarijaDz

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

DarijaDZ 是一个大规模用户生成文本语料库,从阿尔及利亚 YouTube 频道收集而来,包含约 340 万条评论和 4225 万个词级别 token。文本内容主要使用阿尔及利亚 Darija 文字书写,同时包含拉丁 / Arabizi 书写和混合文字内容。该数据集旨在为低资源语言变体——阿尔及利亚 Darija 提供大规模公开文本资源,支持语言模型预训练、继续预训练、阿拉伯语 / Darija 自然语言处理研究、方言识别、情感分析、命名实体识别、机器翻译、分词器研究、阿拉伯文字与 Arabizi 书写研究、代码切换和非正式在线语言研究等任务。数据通过 YouTube Data API v3 从 43 个频道收集,涵盖新闻、教育、烹饪、娱乐、评论等多种内容类别。经过包括 URL 替换、@提及替换、零宽字符移除、方向控制字符移除、视频时间戳移除、连续表情符号折叠、字符延长折叠、过度标点折叠、近空文档移除、阿拉伯语变音符号移除、Unicode NFKC 标准化以及基于 MinHash/LSH 的近重复文档去重等预处理步骤。数据集以 Hugging Face 兼容格式发布,可直接使用 load_dataset 加载。

DarijaDZ is a large-scale user-generated text corpus collected from Algerian YouTube channels, containing approximately 3.4 million comments and 42.25 million word-level tokens. The text is primarily written in Algerian Darija, with Latin/Arabizi script and mixed script content. The dataset aims to provide a large-scale public text resource for the low-resource language variant Algerian Darija, supporting tasks such as language model pretraining, continued pretraining, Arabic/Darija NLP research, dialect identification, sentiment analysis, named entity recognition, machine translation, tokenizer research, Arabic script and Arabizi writing research, code-switching, and informal online language research. Data was collected from 43 channels via YouTube Data API v3, covering categories including news, education, cooking, entertainment, and commentary. Preprocessing steps include URL replacement, @mention replacement, zero-width character removal, direction control character removal, video timestamp removal, consecutive emoji folding, character elongation folding, excessive punctuation folding, near-empty document removal, Arabic diacritics removal, Unicode NFKC normalization, and MinHash/LSH-based near-duplicate document deduplication. The dataset is released in a Hugging Face-compatible format and can be loaded directly using load_dataset.

创建时间:
2026-08-12
原始信息汇总

DarijaDZ 数据集概述

基本信息

  • 数据集名称:DarijaDZ
  • 语言:阿拉伯语(阿尔及利亚方言)
  • 类型:大规模用户生成文本语料库
  • 来源:阿尔及利亚 YouTube 频道
  • 规模:超过100万条样本(1M < n < 10M)
  • 任务类别:文本生成、文本分类、词元分类
  • 创建者:Kharroubi Nasrellah(ENSIA 四年级学生)

语料库规模

指标 数值
文档数量 3,447,761
词级词元 42,250,028
平均词元/文档 12.25

文字使用分布(词元级别)

文字类别 词元数 占比
阿拉伯文字 36,173,217 85.62%
拉丁/阿拉伯语化拼写 4,526,255 10.71%
数字、标点与符号 1,506,822 3.57%
阿拉伯语+拉丁语混合 43,734 0.10%

注:数据中阿拉伯文字与Arabizi(阿拉伯语拉丁拼写)之间的不均衡,促使开发了阿拉伯文字→Arabizi转写工具以平衡数据。

数据来源与采集

  • API:YouTube Data API v3
  • 采集内容:顶级评论及回复
  • 爬虫:可恢复的采集管道
  • 频道数量:43个
  • 处理的原始视频文件数:25,640个
  • 覆盖内容类别:新闻与时事、教育/高考备考、烹饪与生活方式、娱乐与故事、评论与博客

清洗与预处理

清洗管道基于1,000个文档的蓄水池样本经验开发,并应用于整个语料库,具体规则包括:

  • URL → 替换为[URL]
  • @提及 → 替换为[MENTION]
  • 移除零宽度及不可见字符
  • 移除方向隔离控制字符
  • 移除视频时间戳
  • 连续emoji运行折叠
  • 字符拉长折叠(保留表达性变异)
  • 过多标点运行折叠
  • 移除接近空文档
  • 移除阿拉伯语变音符号(Tashkeel)
  • 应用Unicode NFKC规范化
  • 使用MinHash/LSH移除近似重复文档

预期用途

当前版本数据集最适合:

  • 无监督语言建模
  • 语言模型预训练
  • 继续预训练
  • 分词器开发
  • 语料库分析
  • 阿拉伯语/达里亚语语言学研究
  • 非正式在线语言研究
  • 阿拉伯/拉丁文字变体研究
  • 代码切换研究

此外,该数据集还可用于:方言识别、情感分析、命名实体识别、机器翻译及分词器研究。

数据格式

数据以Hugging Face兼容格式分发,加载方式:

python from datasets import load_dataset

dataset = load_dataset("nasrellahkharroubi/DarijaDz")

引用信息

引用格式:

Kharroubi Nasrellah. DarijaDZ: Algerian Darija YouTube Corpus. 2026.

搜集汇总
数据集介绍
DarijaDz 数据集图片
构建方式
DarijaDZ是一个大规模阿尔及利亚方言语料库,通过YouTube Data API v3从43个频道的25,640个视频中采集了评论及回复,构建了一个包含约344.8万篇文档和4225万词元的高质量语料集合。数据覆盖新闻、教育、烹饪、娱乐等多种内容类型,采集过程采用可恢复的流水线确保数据完整性。清洗流程基于1000篇文档的样本实验开发,综合运用了URL和提及替换、不可见字符移除、连续表情和标点压缩、字符延展折叠、近重复文档MinHash/LSH去重及Unicode NFKC规范化等多元手段,同时保留了符拉伯语和拉丁转写(Arabizi)的原始多样性,形成兼具规模与洁净度的非正式阿拉伯语文本资源。
特点
该数据集的核心特点在于其规模庞大、来源真实且高度贴近阿尔及利亚网络口语场景。语料中约85.62%的词元使用阿拉伯文书写,10.71%为拉丁转写,另含少量数字、标点及混合脚本内容,充分体现了民间语言的书写多样性。文档平均长度约12.25词,呈现典型的社会媒体话语特征。此外,数据集的清洗流程针对非正式语言特性进行了精细设计,在去除噪声的同时保留情感表达和网络用语风格,使得语料不仅适用于词典构建和语言模型预训练,还可支撑方言识别、情感分析、命名实体识别等下游任务的探索。对于研究阿拉伯语方言的书写变体、语码转换及非正式在线语言现象,DarijaDZ提供了极为罕见的实证数据基础。
使用方法
DarijaDZ以Hugging Face数据集格式发布,用户可通过`datasets`库便捷调用。首先安装`datasets`包,然后执行`load_dataset("nasrellahkharroubi/DarijaDz")`即可加载完整语料,返回包含注释文本的Dataset对象。该数据集支持多种NLP任务,包括无监督语言建模、预训练与继续预训练、分词器开发、语料分析等,也适用于方言识别、情感分析或命名实体识别等监督学习实验,需用户自行划分训练与验证集。对于阿拉伯语与拉丁转写对译研究,可配合作者提供的转写工具平衡脚本分布。出于合规考虑,使用时需注意原始内容来自YouTube评论,应遵循学术引用规范,并标注数据集的出处以尊重创作者成果。
背景与挑战
背景概述
阿尔及利亚方言(Algerian Darija)作为阿拉伯语的一种口语化地域变体,广泛使用于阿尔及利亚的日常交流与网络互动中,然而其数字资源长期匮乏,制约了自然语言处理(NLP)领域对低资源语言变体的研究。为弥合这一鸿沟,Kharroubi Nasrellah(ENSIA 学生)于2026年创建了DarijaDZ数据集,该数据集源自YouTube阿尔及利亚频道的用户生成文本,规模宏大,涵盖约340万篇评论及4200万词元,内容以阿拉伯字母、拉丁字母(Arabizi)及混合书写形式呈现。作为首个大规模阿尔及利亚方言语料库,DarijaDZ为语言模型预训练、方言识别、情感分析、命名实体识别及机器翻译等任务提供了宝贵资源,显著推动了阿拉伯语方言NLP的研究进程,尤其为探讨多语码转换与非正式网络语言提供了实证基础。
当前挑战
该领域面临的核心挑战在于阿尔及利亚方言的数字化资源稀缺,导致语言模型性能受限,尤其缺乏大规模、多样化的自然语料以捕捉其独特的拼写变体与句法特征。DarijaDZ的构建过程亦非坦途:数据采集需通过YouTube API v3从43个频道、逾2.5万个视频中提取评论,其中混杂广告、噪声及格式杂乱的文本;清洗流程需应对URL、提及、表情符号、连字符、方向控制符等多样性,且需去除近重复文档以保障数据质量;尤为棘手的是阿拉伯字母与Arabizi间的不均衡分布(85.62%对10.71%),促使开发阿拉伯语至Arabizi的音译工具以平衡语料,整个管线依赖精细的启发式规则与MinHash/LSH去重策略,体现了在无标注条件下构建低资源语料库的高度复杂性。
常用场景
经典使用场景
DarijaDZ作为大规模阿尔及利亚达里贾语非结构化文本语料库,其经典使用场景聚焦于低资源语言模型的预训练与继续预训练。该语料蕴含逾340万条用户生成评论及4225万词级token,覆盖阿拉伯字母、拉丁转写(Arabizi)及混合脚本,为语言模型提供了丰富的领域内数据,助力模型捕捉达里贾语的句法、语义及拼写变异特征。此外,该数据集亦广泛用于分词器(tokenizer)的研究与开发,以探索针对多脚本、非规范拼写的高效子词切分策略,从而提升下游自然语言处理任务的性能。其规模与多样性使其成为达里贾语语言学计算研究的基石性资源。
衍生相关工作
DarijaDZ的发布激发了若干代表性衍生工作。一方面,研究者基于该语料训练了专用的达里贾语语言模型,如采用BERT架构进行领域自适应预训练,进而微调后显著提升了方言识别与信息抽取的准确率。另一方面,语料中阿拉伯字母与Arabizi的失衡分布催生了一个阿拉伯语至Arabizi转写工具,该工具不仅平衡了语料的脚本表示,也为跨脚本文本规范化研究提供了新思路。此外,该数据集常与马格里布方言(如摩洛哥、突尼斯)语料结合,用于多方言联合建模及跨方言迁移学习的探索,促进了北非阿拉伯语方言处理技术的协同发展。这些工作共同构建了以DarijaDZ为中心的达里贾语NLP研究生态。
数据集最近研究
最新研究方向
DarijaDZ作为阿尔及利亚方言大规模语料库,正引领低资源阿拉伯语方言自然语言处理的前沿探索。其研究重点在于利用340万条YouTube用户生成内容,推动阿拉伯语方言的预训练语言模型、方言识别、情感分析及命名实体识别等任务的发展,同时为阿拉伯语与拉丁化阿拉伯语(Arabizi)的跨文字转换技术提供数据支撑。该语料库的发布不仅填补了阿尔及利亚方言资源匮乏的空白,还促进了代码切换与在线非正式语言的研究,对阿拉伯语NLP的多样性与包容性具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务