issai/RAGBench_Kazakh
收藏资源简介:
RAGBench_Kazakh是原始RAGBench基准的哈萨克语机器翻译版本,旨在评估检索增强生成(RAG)系统,重点关注模型如何使用检索到的上下文生成接地气的答案。数据集包含来自多个RAGBench子集的测试集,覆盖生物医学研究、通用知识、法律文档、客户支持和金融等领域。每个样本包括一个问题、一组检索到的文档和一个参考答案,所有内容均为哈萨克语翻译,同时保留了原始结构以便进行跨语言比较。数据集共包含11,431个样本,覆盖12个子集,如COVID-19研究相关的生物医学问答、合同文档的法律问答、客户支持和幻觉相关的问答等。
RAGBench_Kazakh is a machine-translated Kazakh version of the original RAGBench benchmark, designed to evaluate retrieval-augmented generation (RAG) systems, focusing on how well models use retrieved context to produce grounded answers. The dataset is built from the test splits of multiple RAGBench subsets covering domains such as biomedical research, general knowledge, legal documents, customer support, and finance. Each example includes a question, retrieved documents, and a reference answer translated into Kazakh, while preserving the original structure for cross-lingual comparison. The dataset contains 11,431 examples in total, covering 12 subsets such as biomedical QA focused on COVID-19 research, legal QA over contract documents, customer-support and hallucination-focused QA, etc.




