遇见数据集

daa-pairs

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

daa-pairs 是一个经过随机化处理的摩洛哥达里贾语短语对数据集,专为多文字变体的语言处理任务设计。该数据集旨在提供地道的达里贾语(摩洛哥阿拉伯语方言)自然语言示例,并特别关注其在实际使用中常见的多文字混合现象。每个数据样本(短语)均以三种不同的文字变体呈现:标准的阿拉伯文脚本、使用拉丁字母书写的阿拉伯文(Arabizi),以及自然语码转换的混合文字(Mixte,即阿拉伯文脚本与用于外来词的法语/英语/西班牙语拉丁字母混合)。数据集包含80,164个短语片段,来源于9,176个独特的视频和新闻文章源。数据字段包括标识来源的`video_id`和`article_id`,以及三种文字变体对应的`arabic`、`arabizi`和`mixte`。数据生成过程结合了真实的摩洛哥语料(来自YouTube视频转录和新闻文章)与大语言模型(基于Google Gemma 4)的创造性重新表述,确保了短语的自然性和语法地道性,并强制模型进行自然的语码转换。后处理阶段对片段顺序进行了随机化,以消除生成过程中可能存在的顺序偏差,使数据集更适用于训练不依赖于位置模式的机器学习模型。该数据集适用于摩洛哥达里贾语的机器翻译、文字转换、语码转换研究、多模态语言建模以及方言自然语言处理等任务。

daa-pairs is a randomized dataset of Moroccan Darija phrase pairs, designed for language processing tasks involving multiple script variants. It aims to provide authentic natural language examples in Darija (Moroccan Arabic dialect), with a special focus on the common phenomenon of multi-script mixing in practical usage. Each data sample (phrase) is presented in three different script variants: standard Arabic script, Arabic written with Latin letters (Arabizi), and mixed script with natural code-switching (Mixte, which combines Arabic script with Latin letters for foreign words from French/English/Spanish). The dataset contains 80,164 phrase segments, sourced from 9,176 unique video and news article sources. Data fields include `video_id` and `article_id` for source identification, as well as `arabic`, `arabizi`, and `mixte` corresponding to the three script variants. The data generation process combines real Moroccan corpora (from YouTube video transcriptions and news articles) with creative rephrasing using large language models (based on Google Gemma 4), ensuring the naturalness and grammatical authenticity of phrases while enforcing natural code-switching. In the post-processing stage, the segment order is randomized to eliminate potential sequential biases from generation, making the dataset more suitable for training machine learning models that do not rely on positional patterns. This dataset is applicable to tasks such as machine translation, script conversion, code-switching research, multimodal language modeling, and dialect natural language processing for Moroccan Darija.

创建时间:
2026-06-13
原始信息汇总

数据集概述:daa-pairs

链接: https://huggingface.co/datasets/OiQ/daa-pairs

许可: Apache-2.0

语言: 阿拉伯语 (ar), 法语 (fr) (摩洛哥达里贾语)

数据规模: 100K < n < 1M (总计 80,164 个片段)

描述

这是一个随机化的摩洛哥达里贾语(Moroccan Darija)短语对数据集。每条短语包含三种文字变体:阿拉伯字母(Arabic)、拉丁字母(Arabizi)和混合文字(Mixte)。数据集是生成输出的后处理版本,每个来源的片段顺序已被随机化,以防止模型在训练时依赖位置或顺序模式。

数据模式

列名 描述
video_id 来源YouTube视频ID(文章类为空)
article_id 来源文章ID(视频类为空)
arabic 阿拉伯字母书写的短语(外来词转写)
arabizi 同一短语的摩洛哥阿拉伯语/拉丁字母写法
mixte 自然语码混合模式:阿拉伯字母 + 外来词使用拉丁字母

统计

  • 总片段数: 80,164
  • 唯一来源数: 9,176(视频 + 文章)

生成流程

  1. 源数据收集: 加载并统一两个上游数据集
  2. 基于LLM的短语生成: 使用ADK LlmAgent(通过OpenRouter调用Google Gemma 4)处理每个源文本。该代理被提示执行以下操作:
    • 改写而非转录 —— 必须创造新的自然句子
    • 使用地道的达里贾语语法(而非标准阿拉伯语)
    • 自然的语码混合(阿拉伯语、法语、英语、西班牙语之间)
    • 每条短语生成三种文字变体
    • 每个源生成5-20个独立的达里贾语短语。
  3. 后处理: 通过脚本 flatten_csv.py 进行
    • 扁平化: 将嵌套的JSON列表展开,每行一个短语。
    • 随机化: 在每个来源(video_id + article_id)内部,打乱片段顺序以消除生成过程中的顺序/位置偏差。
    • 发布: 将最终随机化的扁平数据集推送到HuggingFace Hub。
搜集汇总
数据集介绍
daa-pairs 数据集图片
构建方式
该数据集源自两个上游语料库——摩洛哥阿拉伯语YouTube视频转录与摩洛哥新闻文章,经由统一框架整合后,借助基于Google Gemma 4模型驱动的LLM代理进行短语生成。模型在结构化输出约束下,依据指令对每段源文本进行自然重述而非简单转写,生成包含阿拉伯体、拉丁转写体及混合体三种文字变体的摩洛哥阿拉伯语短语。每段源文本生成5至20条独立短语,并以嵌套JSON格式存储。随后通过扁平化处理将嵌套结构展开为每行一条短语的表格,并在同一源数据内部随机打乱片段顺序,最终发布至HuggingFace平台。
特点
数据集总计包含80,164条短语,源自9,176个独立音视频与文章来源,规模介于十万至百万之间。其核心特色在于每个短语同时提供阿拉伯字母、拉丁字母(Arabizi)及混合文字三种脚本形式,全面反映了摩洛哥阿拉伯语在实际使用中的文字混用现象。特别值得注意的是,生成语料中融入了自然语码转换,涵盖法语、英语与西班牙语的外来词,且严格遵循摩洛哥阿拉伯语语法规范。此外,基于源数据的片段顺序随机化处理有效避免了模型在训练中依赖位置模式。
使用方法
该数据集适合用于摩洛哥阿拉伯语的多脚本表示学习、语码转换建模及跨文字形态的序列转换任务。用户可通过HuggingFace datasets库直接加载使用,数据表包含video_id、article_id、arabic、arabizi及mixte五个字段。其中各字段分别对应原视频或文章标识、阿拉伯体短语、拉丁转写短语与混合体短语。建议在训练过程中采用随机划分策略,利用多脚本变体进行对比学习或数据增强,亦可作为摩洛哥方言自然语言处理下游任务的基准评测语料。
背景与挑战
背景概述
在自然语言处理领域,低资源语言,特别是阿拉伯语方言如摩洛哥阿拉伯语(Darija),因其丰富的代码切换现象和多样的书写系统而面临严峻挑战。为应对这一困境,daa-pairs数据集由OiQ团队于近期创建,基于YouTube视频转录和摩洛哥新闻文章两大来源,利用大型语言模型(如Google Gemma 4)生成高质量的短语对。该数据集涵盖阿拉伯语、阿拉伯语拉丁转写(Arabizi)和混合文字三种变体,总计80,164个短语对,并经过随机化处理以避免模型依赖序列模式,显著推动了多脚本Darija语言建模和机器翻译研究,为低资源方言数据处理树立了标杆。
当前挑战
该数据集面临的挑战主要来自多个层面。首先,Darija作为非标准化的方言,缺乏统一的拼写规范和语法体系,其自然的代码切换(如法语、英语与阿拉伯语混用)增加了模型理解的复杂性。其次,在构建过程中,需确保LLM生成的短语具备真实的Darija语法和自然性,而非简单的转录或标准阿拉伯语改写,这对生成算法的鲁棒性和领域知识提出了高要求。此外,从不同来源(视频与新闻)统一数据模式、处理异构文本以及消除生成过程中的位置偏差,也是技术实现上的关键难点。
常用场景
经典使用场景
在自然语言处理领域,daa-pairs数据集主要用于摩洛哥阿拉伯语(Darija)的多脚本表示学习与跨书写系统对齐研究。该数据集提供了同一短语在阿拉伯字母、拉丁字母(Arabizi)以及混合书写系统(Mixte)下的三种不同变体,为研究低资源语言的多模态表达、语言变体间的映射关系以及代码转换现象提供了宝贵的平行语料。研究者常利用该数据集训练能够处理Darija多种书写形式的语言模型,或者评估现有模型在多脚本环境下的鲁棒性与适应性。
衍生相关工作
基于daa-pairs数据集,研究者已经衍生出多项具有影响力的工作,包括跨脚本的Darija情感分析模型、多模态的阿拉伯方言语料库构建方法,以及针对代码转换场景的语言模型微调策略。该数据集的生成流程也被后续工作借鉴,用于构建其他低资源阿拉伯方言的多脚本平行语料。此外,部分学者利用该数据集验证了大型语言模型在低资源方言上的数据增强效果,并探索了基于LLM的语料生成方法的有效性与局限性,推动了合成数据在方言处理领域的应用边界。
数据集最近研究
最新研究方向
在自然语言处理领域,低资源语言的语料构建与多脚本表征学习正成为前沿研究热点。daa-pairs数据集聚焦摩洛哥阿拉伯语(Darija)这一低资源方言,通过创新性地整合YouTube视频转录与新闻文章,再借助大型语言模型(如Gemma 4)生成每一条短语的阿拉伯字母、拉丁字母及混合脚本三种变体,并引入段内随机化策略以规避位置偏置。这一设计不仅为多脚本、代码切换等复杂语言现象的建模提供了高质量基准,更与近期跨语言信息检索、方言理解系统的快速发展相呼应,有力推动阿拉伯方言区尤其是北非地区的多模态语言资源建设与算法评测。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务