遇见数据集

algerian-darja-corpus

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

Algerian Darja Corpus 是一个高质量的数据集,包含阿尔及利亚达里贾语(阿尔及利亚阿拉伯语方言)的对话转录文本。该语料库收录了自然、真实的讨论、播客和对话,代表了当今达里贾语的口语使用方式。其突出特点是阿尔及利亚阿拉伯语、法语和英语之间存在广泛的语码转换现象,并且文本同时使用阿拉伯字母和拉丁字母(Arabizi/法式阿尔及利亚语)书写。数据集共包含1789个转录文档(对话片段),总计6,524,233个单词和36,367,373个字符,以JSON Lines格式存储。每个数据实例包含三个字段:text(对话片段的完整转录文本)、char_count(转录文本的字符总数)和word_count(转录文本的单词总数)。阿尔及利亚达里贾语是一种口语方言,没有单一的标准化书写系统。本数据集反映了真实世界的正字法选择:包括使用阿拉伯字母按发音书写达里贾词语,以及使用拉丁字母(常融合法语拼写约定或英语借词)书写的Arabizi/法式阿尔及利亚语文本。语码转换频繁,常在同一个句子或话轮中交替使用阿尔及利亚达里贾语、法语和英语。数据来源于多个YouTube播客和谈话节目频道,以及Hugging Face上的相关音频收集数据集。该数据集适用于文本生成等自然语言处理任务,特别是针对方言处理、语码转换研究和多语言模型训练。数据集采用知识共享署名4.0国际许可证(CC BY 4.0)发布。

The Algerian Darja Corpus is a high-quality dataset containing transcribed dialogues in Algerian Darja (an Algerian Arabic dialect). The corpus includes natural and authentic discussions, podcasts, and conversations, representing the contemporary spoken usage of Darja. Its notable features include extensive code-switching between Algerian Arabic, French, and English, with texts written in both Arabic script and Latin script (Arabizi/Franco-Algerian). The dataset comprises 1,789 transcribed documents (dialogue segments), totaling 6,524,233 words and 36,367,373 characters, stored in JSON Lines format. Each data instance includes three fields: text (the full transcribed text of the dialogue segment), char_count (total number of characters in the transcribed text), and word_count (total number of words in the transcribed text). Algerian Darja is a spoken dialect without a single standardized writing system. This dataset reflects real-world orthographic choices: including writing Darja words phonetically using Arabic script, and Arabizi/Franco-Algerian texts written in Latin script (often incorporating French spelling conventions or English loanwords). Code-switching is frequent, often alternating between Algerian Darja, French, and English within the same sentence or turn. The data is sourced from multiple YouTube podcasts and talk show channels, as well as related audio collection datasets on Hugging Face. This dataset is suitable for natural language processing tasks such as text generation, particularly for dialect processing, code-switching research, and multilingual model training. The dataset is released under the Creative Commons Attribution 4.0 International License (CC BY 4.0).

创建时间:
2026-07-17
原始信息汇总

数据集概述

Algerian Darja Corpus 是一个高质量的对话转录数据集,专注于阿尔及利亚达里贾语(阿尔及利亚阿拉伯方言)。该语料库包含真实世界的自然对话、播客和讨论,反映了达里贾语当下的实际使用方式,并突出显示了阿尔及利亚阿拉伯语、法语和英语之间的大量语码转换,文本同时使用阿拉伯字母和拉丁字母(Arabizi/Franco-Algerian)书写。

数据集规模

  • 文档数(转录文本): 1789
  • 总词数: 6,524,233
  • 总字符数: 36,367,373
  • 数据格式: JSON Lines(.jsonl

数据结构

数据字段

每条JSON对象包含以下字段:

  • text(字符串):对话片段的完整转录文本。
  • char_count(整数):转录文本的总字符数。
  • word_count(整数):转录文本的总词数。

数据实例示例

json { "text": "Host: سلام عليكم ومرحباً بكم في حلقة جديدة من podcast FluentlyTalk... Guest: لاباس، والله غير الحمد لله...", "char_count": 23513, "word_count": 4173 }

语言与书写系统

  • 阿拉伯字母: 使用传统阿拉伯字母以音标方式书写达里贾语。
  • 拉丁字母(Arabizi / Franco-Algerian): 使用拉丁字母书写,常融合法语拼写惯例或英语借词。
  • 语码转换: 在同一句子或话轮中频繁交替使用阿尔及利亚达里贾语、法语和英语。

数据来源

转录文本收集自以下YouTube频道:

  • بودكاست المفيد El Moufid Podcast
  • Keepodcast
  • BelkadiManel
  • takicharni
  • ilyesderradji
  • MohamedDjamelTaleb
  • ramziZRT
  • Khoubai
  • Intaj
  • Omar Rahmoun
  • Mouslem khirouni
  • Fluently
  • Zaki Agha CasTea
  • Anis Hamidi
  • BrainerX
  • Raouf Talks
  • Alias Djamel
  • Entrepreneur podcast - بودكاست المقاول
  • NOEST Express
  • Dar El Mic – دار الميك
  • Flown marketing
  • Kings Podcast

以及来自Hugging Face数据集:

  • oddadmix/arabic-audio-collection-algerian-kahwa-postcast
  • oddadmix/arabic-audio-collection-algerian-loubna-stories
  • oddadmix/arabic-audio-collection-algerian-rawi

许可协议

该数据集采用 Creative Commons Attribution 4.0 International (CC BY 4.0) 许可协议分发。

任务类别

  • 文本生成

语言

  • 阿拉伯语
  • 法语

标签

  • darja
  • algerian-darja
  • dialect
  • spoken-language
  • code-switching
  • arabizi

使用方式

可通过Hugging Face datasets 库直接加载:

python from datasets import load_dataset

dataset = load_dataset("touati-kamel/algerian-darja-corpus") print(dataset[train][0])

搜集汇总
数据集介绍
algerian-darja-corpus 数据集图片
构建方式
Algerian Darja Corpus 数据集以阿尔及利亚达里贾(Algerian Darja)口语为核心,采集自多个YouTube频道的播客与脱口秀节目,并整合了来自Hugging Face平台的公开音频语料。原始音频经过转录处理,生成对话片段形式的文本,并以JSON Lines格式存储。每个样本包含完整的对话文本、字符数与词数统计,总计1789条转录文本,涵盖超过650万词,充分反映了阿尔及利亚方言在日常交流中的真实面貌。
使用方法
用户可通过Hugging Face的datasets库直接加载该数据集,仅需调用load_dataset('touati-kamel/algerian-darja-corpus')即可获取训练集。数据以JSON Lines格式提供,每条记录包含'text'、'char_count'与'word_count'字段,方便进行文本分析、模型训练或方言相关的语言学实验。该数据集采用CC BY 4.0许可协议,允许学术与商业用途下的自由使用与分享。
背景与挑战
背景概述
阿尔及利亚达里贾语(Algerian Darja)作为一种口语化的阿拉伯方言,在日常交流中广泛使用,但长期以来缺乏高质量、标准化的语料资源,制约了自然语言处理(NLP)领域对该方言的研究。该数据集由研究者touati-kamel于近期创建,收集了来自播客、脱口秀等自然对话场景的转录文本,共计1789个文档,总词数超过652万。其核心研究问题聚焦于阿尔及利亚达里贾语的代码转换特征,即该方言在阿拉伯语、法语和英语之间的频繁交替使用,并涵盖阿拉伯字母和拉丁字母(Arabizi)两种书写系统。该数据集的发布为低资源方言的NLP研究提供了宝贵的基础资源,有望推动阿拉伯方言处理、代码转换建模以及多语言语音识别等领域的发展。
当前挑战
该数据集面临的挑战首先体现在领域问题上:阿尔及利亚达里贾语缺乏统一的书写标准,文本中阿拉伯字母与拉丁字母混用,且代码转换现象极其普遍,对语言模型的词汇识别、语法解析及语义理解构成了显著困难。此外,构建过程中因数据来源为YouTube播客转录,存在音频清晰度不一、说话人重叠、背景噪声等质量波动问题,需人工校验和清洗。同时,由于该方言属于低资源语言,标注人员稀缺,难以大规模扩展或确保标注一致性,限制了数据集的规模和可用性。最后,跨脚本(阿拉伯文与拉丁文)的对齐与转换也为数据预处理增添了复杂性。
常用场景
经典使用场景
Algerian Darja Corpus作为阿尔及利亚阿拉伯方言的高质量对话语料库,其最经典的使用场景在于推动方言自然语言处理的基础研究。该数据集收录了来自播客、脱口秀等真实场景的1789段对话转录文本,涵盖阿拉伯语、法语和英语之间的频繁语码转换,并以阿拉伯字母和拉丁字母(Arabizi)两种书写系统呈现。研究者可将其用于训练和评估面向低资源方言的语言模型,尤其适合开展方言文本生成、跨语言语码转换分析和口语化表达理解等任务,为阿拉伯语方言的数字化处理提供了稀缺的标准化数据资源。
解决学术问题
该数据集有效回应了阿拉伯语方言区域中阿尔及利亚达里加语缺乏大规模、高质量标注语料的学术困境。其收录的真实对话反映了现代阿尔及利亚社会中语码混用的复杂语言生态,解决了方言文本在书写系统不统一、口语化程度高和跨语言混合频繁等条件下如何被机器理解和建模的核心难题。通过提供超过650万词规模的多样化转录文本,该语料为方言语言学计算研究、语码转换机制建模以及低资源场景下的自然语言生成奠定了基础,显著推动了北非阿拉伯方言在NLP领域中的可计算性进程。
实际应用
在实际应用层面,Algerian Darja Corpus可服务于阿尔及利亚及马格里布地区的智能语音助手开发、社交媒体方言内容分析与自动翻译系统建设。借助该数据集训练的语言模型能够准确理解和生成本地化的达里加语表达,支撑包括方言语音识别后文本处理、阿拉伯语方言翻译引擎优化及多语融合客服系统在内的一系列产品化落地。此外,该语料对于面向阿尔及利亚用户的数字内容个性化推荐、方言文本情感分析和文化遗产数字化保护等场景亦具有直接的应用价值。
数据集最近研究
最新研究方向
在当前阿拉伯方言自然语言处理的前沿探索中,阿尔及利亚达尔贾语料库的发布标志着对马格里布地区非标准口语的数字化研究迈出了关键一步。该数据集聚焦于日常对话、播客与脱口秀等真实交际场景,罕见地系统收录了阿拉伯语、法语与英语之间频繁的语码转换现象,并涵盖阿拉伯字母与拉丁化的Arabizi两种书写系统,为破解低资源方言的语音-文字映射难题提供了宝贵的高质量语料。这一成果不仅推动了方言语音识别与机器翻译等技术在阿尔及利亚本土场景中的应用,也为其他缺乏统一正字法的阿拉伯方言研究树立了可复用的基准,尤其契合内马儿·阿布达利等学者近年来关于‘后阿拉伯语时代’数字语言活力的探讨,对理解北非多语社区的语言变异与身份建构具有深远的学术价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务