derja-retrieval-benchmark
收藏资源简介:
Tunisian Derja Retrieval Benchmark 是首个针对突尼斯方言(Derja)的检索基准数据集,覆盖该方言实际使用的两种书写系统:阿拉伯文和阿拉伯语(拉丁字母与数字的组合,数字代表阿拉伯语辅音,如3=ع, 7=ح, 9=ق)。该数据集旨在评估和推动多语言检索系统在跨脚本检索任务上的能力,因为现有模型在跨脚本查询上表现近乎为零。数据集包含300个查询,分为三类:100个阿拉伯文查询、100个阿拉伯语查询以及100个跨脚本查询(阿拉伯语查询匹配阿拉伯文文档)。每个查询对应10个候选文档,这些候选文档是从一个包含20,000篇文档的池中通过TREC-style pooling方式抽取的,而非随机采样,从而确保标注集中在系统有分歧的文档上。文档来源为两个社交媒体语料库(hamzabouajila/tunisian-derja-unified-raw-corpus 和 Nehdi/TuniziBigBench),经过质量过滤(去除URL、重复垃圾信息、长度限制)。数据集中相关性等级(grade)字段设计为空,需要人工标注,标注标准为:3(完美匹配)、2(相关)、1(边缘相关)、0(不相关)。数据集还提供了基线模型性能(如gte-multilingual-base和multilingual-e5-base)在阿拉伯文、阿拉伯语、跨脚本、现代标准阿拉伯语和法语任务上的Recall@1指标,其中跨脚本任务召回率极低(1.5和0.5),凸显了该基准的挑战性。该数据集适用于检索系统评估、跨脚本检索研究、方言自然语言处理等任务。
Tunisian Derja Retrieval Benchmark is the first retrieval benchmark dataset for Tunisian dialect (Derja), covering two writing systems used in practice: Arabic script and Arabizi (Latin script with digits representing Arabic consonants, e.g., 3=ع, 7=ح, 9=ق). It aims to evaluate and promote multilingual retrieval systems on cross-script retrieval tasks, as existing models perform nearly zero on cross-script queries. The dataset contains 300 queries divided into three categories: 100 Arabic script queries, 100 Arabizi queries, and 100 cross-script queries (Arabizi queries paired with Arabic script documents). Each query has 10 candidate documents extracted from a pool of 20,000 documents via TREC-style pooling (not random sampling) to focus annotation on documents where systems disagree. Documents come from two social media corpora, filtered for quality (removing URLs, duplicate spam, length constraints). The relevance grade field is left empty for human annotation, with criteria: 3 (perfect match), 2 (relevant), 1 (marginally relevant), 0 (not relevant). The dataset also provides baseline model performance (e.g., gte-multilingual-base and multilingual-e5-base) on Recall@1 for Arabic script, Arabizi, cross-script, Modern Standard Arabic, and French tasks, with extremely low recall on cross-script tasks (1.5 and 0.5), highlighting the challenge. The dataset is suitable for retrieval system evaluation, cross-script retrieval research, and dialectal NLP tasks.
Tunisian Derja Retrieval Benchmark
数据集概述
这是首个面向突尼斯阿拉伯语方言(Derja)的检索基准数据集,覆盖了该语言实际使用的两种书写系统:阿拉伯字母和Arabizi(拉丁字母+数字替代阿拉伯语辅音,如3=ع、7=ح、9=ق)。
核心特点
- 三分之一的查询为跨书写系统检索任务:以Arabizi查询、在阿拉伯语书写文档中进行检索。
- 实验数据(recall@1)显示,现成的多语言检索模型在该任务上表现极差:
gte-multilingual-base跨脚本得分仅1.5,multilingual-e5-base仅0.5,几乎等于零。 - 突尼斯人日常会随意使用任一书写系统书写同一种语言,无法跨脚本检索的模型将在大量真实查询中失效。
数据集内容
| 文件 | 说明 |
|---|---|
eval_queue.jsonl |
3,000条(查询,候选文档)等待分级评估的条目 |
eval_queue.tsv |
相同数据,用于电子表格审阅 |
eval_pool.jsonl |
从中抽取候选项的20,000篇文档池 |
- 共300个查询:100个阿拉伯语脚本、100个Arabizi、100个跨脚本查询。
- 每个查询配10个候选项,采用TREC风格池化(来自检索运行的候选集而非随机采样),使人工判断集中在系统易产生分歧的位置。
评分等级
| 等级 | 含义 |
|---|---|
| 3 | 完美——直接回答或复述查询内容 |
| 2 | 相关——同一主题,有使用价值 |
| 1 | 边缘相关——联系松散,无法满足搜索者需求 |
| 0 | 不相关 |
标签设计
- 所有条目的
grade字段有意留空。Derja相关性判定属于母语者判断,程序化生成标签会使基准退化为测试标注脚本而非检索质量。 - 本数据集提供可复用部分:文档池、覆盖三种检索场景的300个查询、池化候选项集。
- 分级是开放贡献——源码仓库提供分级工具,部分判定也有效(约30个完整判定的查询足以进行系统合理性检查)。
数据集构建
- 查询是取自池中文档的3–6词片段,刻意保持简短。早期版本使用约60%文档词汇导致recall@10达100%饱和,变成了测量词汇重叠而非检索性能。
- 来源语料:
hamzabouajila/tunisian-derja-unified-raw-corpus和Nehdi/TuniziBigBench,均为社交媒体抓取文本,经过质量过滤(无URL、无重复垃圾、长度限制)。
局限性
- 未标注:所有条目尚无分级。
- Derja/MSA边界基于词汇判断:阿拉伯语脚本的Derja与标准阿拉伯语通过功能词测试区分,精确率高但召回率低。
- Arabizi检测不足:依赖词内数字和标记词列表,无数字的Arabizi会被漏检。
- 源内容为未过滤社交媒体文本,包含露骨和辱骂性材料,文档未做攻击性筛查。





