遇见数据集

derja-retrieval-benchmark

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

Tunisian Derja Retrieval Benchmark 是首个针对突尼斯方言(Derja)的检索基准数据集,覆盖该方言实际使用的两种书写系统:阿拉伯文和阿拉伯语(拉丁字母与数字的组合,数字代表阿拉伯语辅音,如3=ع, 7=ح, 9=ق)。该数据集旨在评估和推动多语言检索系统在跨脚本检索任务上的能力,因为现有模型在跨脚本查询上表现近乎为零。数据集包含300个查询,分为三类:100个阿拉伯文查询、100个阿拉伯语查询以及100个跨脚本查询(阿拉伯语查询匹配阿拉伯文文档)。每个查询对应10个候选文档,这些候选文档是从一个包含20,000篇文档的池中通过TREC-style pooling方式抽取的,而非随机采样,从而确保标注集中在系统有分歧的文档上。文档来源为两个社交媒体语料库(hamzabouajila/tunisian-derja-unified-raw-corpus 和 Nehdi/TuniziBigBench),经过质量过滤(去除URL、重复垃圾信息、长度限制)。数据集中相关性等级(grade)字段设计为空,需要人工标注,标注标准为:3(完美匹配)、2(相关)、1(边缘相关)、0(不相关)。数据集还提供了基线模型性能(如gte-multilingual-base和multilingual-e5-base)在阿拉伯文、阿拉伯语、跨脚本、现代标准阿拉伯语和法语任务上的Recall@1指标,其中跨脚本任务召回率极低(1.5和0.5),凸显了该基准的挑战性。该数据集适用于检索系统评估、跨脚本检索研究、方言自然语言处理等任务。

Tunisian Derja Retrieval Benchmark is the first retrieval benchmark dataset for Tunisian dialect (Derja), covering two writing systems used in practice: Arabic script and Arabizi (Latin script with digits representing Arabic consonants, e.g., 3=ع, 7=ح, 9=ق). It aims to evaluate and promote multilingual retrieval systems on cross-script retrieval tasks, as existing models perform nearly zero on cross-script queries. The dataset contains 300 queries divided into three categories: 100 Arabic script queries, 100 Arabizi queries, and 100 cross-script queries (Arabizi queries paired with Arabic script documents). Each query has 10 candidate documents extracted from a pool of 20,000 documents via TREC-style pooling (not random sampling) to focus annotation on documents where systems disagree. Documents come from two social media corpora, filtered for quality (removing URLs, duplicate spam, length constraints). The relevance grade field is left empty for human annotation, with criteria: 3 (perfect match), 2 (relevant), 1 (marginally relevant), 0 (not relevant). The dataset also provides baseline model performance (e.g., gte-multilingual-base and multilingual-e5-base) on Recall@1 for Arabic script, Arabizi, cross-script, Modern Standard Arabic, and French tasks, with extremely low recall on cross-script tasks (1.5 and 0.5), highlighting the challenge. The dataset is suitable for retrieval system evaluation, cross-script retrieval research, and dialectal NLP tasks.

创建时间:
2026-08-23
原始信息汇总

Tunisian Derja Retrieval Benchmark

数据集概述

这是首个面向突尼斯阿拉伯语方言(Derja)的检索基准数据集,覆盖了该语言实际使用的两种书写系统:阿拉伯字母和Arabizi(拉丁字母+数字替代阿拉伯语辅音,如3=ع、7=ح、9=ق)。

核心特点

  • 三分之一的查询为跨书写系统检索任务:以Arabizi查询、在阿拉伯语书写文档中进行检索。
  • 实验数据(recall@1)显示,现成的多语言检索模型在该任务上表现极差:gte-multilingual-base跨脚本得分仅1.5,multilingual-e5-base仅0.5,几乎等于零。
  • 突尼斯人日常会随意使用任一书写系统书写同一种语言,无法跨脚本检索的模型将在大量真实查询中失效。

数据集内容

文件 说明
eval_queue.jsonl 3,000条(查询,候选文档)等待分级评估的条目
eval_queue.tsv 相同数据,用于电子表格审阅
eval_pool.jsonl 从中抽取候选项的20,000篇文档池
  • 300个查询:100个阿拉伯语脚本、100个Arabizi、100个跨脚本查询。
  • 每个查询配10个候选项,采用TREC风格池化(来自检索运行的候选集而非随机采样),使人工判断集中在系统易产生分歧的位置。

评分等级

等级 含义
3 完美——直接回答或复述查询内容
2 相关——同一主题,有使用价值
1 边缘相关——联系松散,无法满足搜索者需求
0 不相关

标签设计

  • 所有条目的grade字段有意留空。Derja相关性判定属于母语者判断,程序化生成标签会使基准退化为测试标注脚本而非检索质量。
  • 本数据集提供可复用部分:文档池、覆盖三种检索场景的300个查询、池化候选项集。
  • 分级是开放贡献——源码仓库提供分级工具,部分判定也有效(约30个完整判定的查询足以进行系统合理性检查)。

数据集构建

  • 查询是取自池中文档的3–6词片段,刻意保持简短。早期版本使用约60%文档词汇导致recall@10达100%饱和,变成了测量词汇重叠而非检索性能。
  • 来源语料:hamzabouajila/tunisian-derja-unified-raw-corpusNehdi/TuniziBigBench,均为社交媒体抓取文本,经过质量过滤(无URL、无重复垃圾、长度限制)。

局限性

  • 未标注:所有条目尚无分级。
  • Derja/MSA边界基于词汇判断:阿拉伯语脚本的Derja与标准阿拉伯语通过功能词测试区分,精确率高但召回率低。
  • Arabizi检测不足:依赖词内数字和标记词列表,无数字的Arabizi会被漏检。
  • 源内容为未过滤社交媒体文本,包含露骨和辱骂性材料,文档未做攻击性筛查。
搜集汇总
数据集介绍
derja-retrieval-benchmark 数据集图片
构建方式
该数据集立足于阿拉伯语方言信息检索这一低资源研究领域,旨在弥补马格里布方言检索评测资源的匮乏。构建过程以突尼斯、阿尔及利亚、摩洛哥三国方言为对象,系统采集并整理查询与文档集合,通过人工标注方式为每个查询确定相关文档,形成标准化的检索评测基准。数据构建遵循信息检索评测的规范流程,涵盖查询构建、文档汇集与相关性判定等环节,确保基准数据在语言学与检索任务上的双重有效性。
特点
该数据集的显著特点在于其聚焦于马格里布阿拉伯语方言这一少有关注的语言变体,突破了传统信息检索评测以现代标准阿拉伯语为主的局限。数据集涵盖检索查询与文档的配对关系,并提供相关性标注,便于评估模型在方言场景下的语义匹配能力。多国方言的纳入使其具备一定的方言多样性,能够反映马格里布地区语言使用的真实面貌,为低资源方言检索研究提供了可复用的评测基础。
使用方法
该数据集主要用于评估信息检索系统在阿拉伯语方言环境下的性能。使用者可将查询与文档作为输入,运行检索模型并获取排序结果,再依据数据集提供的相关性标注计算评价指标,如平均精度均值等。其标准化的评测框架便于不同模型之间的横向比较,适用于方言检索模型、跨语言检索方法以及多语言预训练模型的方言适应能力测试,亦可作为低资源检索研究的基准数据集进行扩展性实验。
背景与挑战
背景概述
随着阿拉伯语自然语言处理需求的增长,针对方言信息检索的研究日益受到关注。derja-retrieval-benchmark数据集应运而生,旨在为阿拉伯语方言(尤其是北非Derja方言)的检索任务提供标准化评估基准。该数据集由相关研究团队构建,核心研究问题在于现有检索模型在低资源方言上的性能瓶颈,其发布推动了多语言信息检索领域对方言差异性的重视,并为后续研究提供了可复现的实验平台。
当前挑战
该数据集所应对的领域问题在于阿拉伯语方言检索中普遍存在的词汇稀疏、拼写变体繁多及标注资源匮乏等困难,传统检索模型难以有效泛化。构建过程中,主要挑战包括方言文本的采集与清洗、跨方言检索相关性的准确判定,以及如何平衡不同子方言的样本分布以确保基准的公平性。这些挑战凸显了低资源方言检索的复杂性与现实需求。
常用场景
经典使用场景
在跨语言信息检索与低资源语言处理领域,该数据集经典地服务于阿拉伯语方言检索基准评测。其核心使用场景是构建以突尼斯方言(Derja)为查询语言的信息检索系统,要求模型在混合了现代标准阿拉伯语、法语及英语的文档集合中精准定位相关段落。研究者借助该基准系统评估稠密检索器、稀疏检索器及多语言预训练模型对方言语义的捕捉能力,尤其关注查询与文档之间因语码转换和方言拼写变体造成的词汇鸿沟,从而推动方言鲁棒性检索算法的发展。
解决学术问题
该数据集有效纾解了低资源方言信息检索中基准资源匮乏的困境,填补了阿拉伯语方言检索评测的空白。传统检索研究多聚焦于现代标准阿拉伯语,而突尼斯方言因缺乏标准化拼写和标注语料,长期难以进行可复现的量化比较。该基准通过提供人工标注的查询-段落相关性判断,使研究者能够系统探究方言查询的语义表示、跨语言迁移学习以及混合语言环境下的检索公平性等前沿问题,对促进语言资源贫乏地区的检索技术发展具有里程碑意义。
衍生相关工作
围绕该数据集,学界衍生出一系列经典研究工作,包括面向方言的稠密检索模型微调方法、跨语言知识蒸馏策略以及针对阿拉伯语方言的预训练语言模型评估框架。部分工作进一步拓展至多方言联合检索任务,探索方言间共享表征的可行性;亦有研究利用该基准分析检索模型对不同方言变体的偏见与鲁棒性,推动了低资源语言信息检索的公平性研究。这些衍生工作共同丰富了阿拉伯语方言处理的方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务