遇见数据集

bharatrag-benchmark

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

该数据集是一个用于问答幻觉检测研究的多语言多领域数据集,采用MIT许可证。数据集包含80个训练样本,每个样本由唯一ID、语言标识、领域分类、问题文本、上下文文本、真实答案和幻觉答案七个字段构成。其中幻觉答案字段专门标注了与上下文信息不符的模型生成答案,使其适用于问答系统幻觉检测、模型可靠性评估等任务。数据集结构清晰,体积紧凑,便于快速实验和基准测试。

This dataset is a multilingual, multi-domain dataset for research on question-answering hallucination detection, licensed under the MIT License. It contains 80 training samples, each consisting of seven fields: unique ID, language identifier, domain classification, question text, context text, true answer, and hallucinated answer. The hallucinated answer field specifically annotates model-generated answers that are inconsistent with the context information, making it suitable for tasks such as hallucination detection in question-answering systems and model reliability evaluation. The dataset has a clear structure and compact size, facilitating rapid experiments and benchmark testing.

创建时间:
2026-07-05
原始信息汇总

数据集概述:BharatRAG Benchmark

  • 数据集名称:BharatRAG Benchmark
  • 许可证:MIT
  • 数据集大小:数据集总大小为 83,267 字节(约 81 KB),下载大小为 42,024 字节(约 41 KB)
  • 数据集划分:仅包含训练集(train),共 80 个样本

数据特征

数据集包含 7 个字段,类型均为字符串(string):

  • id:样本唯一标识符
  • language:语言
  • domain:领域
  • question:问题
  • context:上下文
  • ground_truth_answer:真实答案
  • hallucinated_answer:幻觉答案

数据用途推测

该数据集旨在用于评估或训练 RAG(检索增强生成)模型在检测或避免幻觉方面的能力,通过提供问题、上下文、真实答案与可能包含幻觉的答案进行对比分析。

搜集汇总
数据集介绍
bharatrag-benchmark 数据集图片
构建方式
在信息技术飞速发展的当下,大型语言模型在自然语言处理领域展现出卓越能力,但其在处理多语言任务时面临的幻觉问题亟待解决。bharatrag-benchmark数据集正是为此而生,它由80个精心设计的示例构成,涵盖多个语种与领域。每个样本均包含问题、上下文、真实答案以及幻觉答案,通过对比真实与幻觉内容,系统化构建了评估语言模型幻觉倾向的基准。数据集以JSON格式存储,通过拆分文件组织在data/train-*路径下,确保数据加载的便捷性与一致性。
特点
该数据集的核心特色在于其聚焦于多语言场景下的幻觉检测,覆盖了广泛的领域与语言维度,为评估模型的跨语言鲁棒性提供了独特视角。每个样本不仅提供标准的事实依据,还精心构造了具体的幻觉示例,使得研究者能够量化分析模型在哪些环节容易偏离真实信息。尽管数据量仅为80条,但每条样本都经过精挑细选,兼顾了代表性、挑战性与多样性,旨在用最小的规模激发最深入的分析,堪称精准评估幻觉问题的微型利器。
使用方法
使用bharatrag-benchmark时,首先需通过HuggingFace的datasets库加载default配置下的训练集,自动读取data/train-*路径下的全部数据文件。加载后,每条记录包含id、language、domain等字段,研究者可基于question与context向目标模型提问,将其输出与ground_truth_answer及hallucinated_answer进行对比。推荐采用精确匹配、语义相似度或人工评估来度量模型生成答案的真实性,并分析不同语言、领域下的幻觉分布,从而洞察模型的脆弱环节并优化其表现。
背景与挑战
背景概述
在自然语言处理领域,模型生成事实性错误内容的问题被称为幻觉(Hallucination),极大地阻碍了大型语言模型在医疗、法律等高风险场景中的可靠部署。bharatrag-benchmark数据集由印度研究机构于近期构建,旨在系统性评估和缓解多语言检索增强生成(RAG)系统中的幻觉现象。该数据集以印度语言为核心,覆盖多个领域,包含80个精心设计的样本,每个样本提供问题、上下文、真实答案及幻觉答案,为研究者度量模型在信息检索与生成过程中忠实于事实的能力提供了标准化测试基准。通过聚焦低资源语言环境下的幻觉挑战,该数据集对推动多语言AI系统的安全性与实用性具有重要价值。
当前挑战
该数据集致力于解决的领域问题在于,现有幻觉评估基准多集中于英语等资源丰富语言,对印度本土语言的覆盖严重不足,导致多语言RAG系统在真实部署中表现出无法预知的事实错误。构建过程中面临的核心挑战包括:如何从零构建覆盖多领域、多语言的标准化问题-上下文对,以确保样本的真实性与多样性;如何由领域专家精准标注“真实答案”与“幻觉答案”以区分正确响应与错误生成;以及在小样本(仅80例)条件下确保基准的统计效度和泛化能力,避免因数据稀缺造成评估偏差。
常用场景
经典使用场景
在自然语言处理领域,特别是针对低资源语言的语义理解与生成任务中,bharatrag-benchmark数据集提供了一个重要的评测基准。它专为评估检索增强生成(RAG)系统在多语言、多领域场景下的鲁棒性而设计,通过精心构造的问答对与上下文,涵盖印度次大陆的多种语言,使得研究者能够系统性地检验模型在跨语言信息检索与回答生成中的表现,尤其聚焦于对幻觉现象的发现与规避。
实际应用
在实际应用中,该数据集可直接用于测试和优化面向印度多样化语言用户群体的智能问答与客服系统。例如,企业部署的多语言知识库助手,可通过该基准检验其对用户使用印地语、泰米尔语等方言提出的查询,能否从混杂的上下文或外部知识库中提取准确答案而不产生误导性响应。此外,新闻聚合与教育辅助平台也能借此评估跨语言内容摘要和事实核查工具的真实可靠性,从而提升服务在低资源语言环境下的用户信任度与实用性。
衍生相关工作
围绕bharatrag-benchmark,已有若干经典衍生工作涌现。一方面,研究者基于该数据集开发了特定的幻觉检测算法,通过对比模型输出与给定的幻觉答案模板,提出了多语言忠实性度量指标。另一方面,该基准激发了面向低资源语言的RAG系统微调策略,例如利用其训练子集对多语言预训练模型进行适应性增强,显著降低了特定领域(如法律或医疗)中的虚假信息生成频率。此外,部分团队将其扩展为跨语言对抗样本集合,用于鲁棒性测试,进一步促进了检索模块与生成模块联合优化的理论探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务