acqad-rag-cag-subsets
收藏资源简介:
ACQAD RAG-CAG Splits 是一个专门为比较阿拉伯语检索增强生成(RAG)和上下文感知生成(CAG)系统而构建的评估数据集。它基于 ACQAD 原始数据集,经过处理生成了三个不同规模(small, medium, large)的多跳问答(multi-hop QA)子集。这些子集在构建时考虑了 Token 预算限制,旨在用于评估相关系统在阿拉伯语多跳问答任务中的答案生成质量以及在线推理延迟。数据集仅包含测试集,适用于问答任务类别,尤其关注多跳推理场景。
ACQAD RAG-CAG Splits is an evaluation dataset specifically constructed for comparing Arabic Retrieval-Augmented Generation (RAG) and Context-Aware Generation (CAG) systems. It is based on the original ACQAD dataset and has been processed to generate three subsets of different scales (small, medium, large) for multi-hop question answering (multi-hop QA). These subsets are built with consideration of Token budget constraints, aiming to evaluate the answer generation quality and online inference latency of relevant systems in Arabic multi-hop QA tasks. The dataset includes only a test set and is suitable for the question-answering task category, with a particular focus on multi-hop reasoning scenarios.
数据集名称
ACQAD RAG-CAG Splits
语言
- 阿拉伯语 (ar)
任务类别
- 问答 (question-answering)
标签
- 多跳 (multi-hop)
- 检索增强生成 (RAG)
- 缓存增强生成 (CAG)
许可协议
- CC BY-NC 4.0 (非商业使用)
数据集简介
该数据集是基于 ACQAD 多跳问答数据集,按 token 预算划分的子集,专门用于对比阿拉伯语 RAG 与 CAG 系统的性能。
数据集配置与文件
该数据集包含三个配置,每个配置仅包含 test 分割:
| 配置名称 | 默认 | 文件路径 |
|---|---|---|
| small | 是 (default) | acqad_multihop_small.json |
| medium | 否 | acqad_multihop_medium.json |
| large | 否 | acqad_multihop_large.json |
来源
用途
用于评估阿拉伯语多跳问答任务中,RAG 和 CAG 系统的答案质量及在线延迟。
相关代码





