遇见数据集

mukunda1729/rag-quality-benchmarks-mini

收藏
Hugging Face2026-04-27 更新2026-05-03 收录
官方服务:

资源简介:

这是一个用于RAG(检索增强生成)评估的小型基准测试数据集,包含15个手工制作的评估查询,每个查询都有真实文档ID和参考答案。数据集特别包含一个负控制查询,用于验证系统在检索为空时不会产生幻觉。数据集的类别包括事实型、操作指南、技术性、政策、比较、总结、安全性和负控制。数据结构包括查询ID、用户问题、真实文档ID、预期答案、类别和难度级别。数据集建议的评估指标包括检索召回率@k、答案匹配和拒绝召回率。

A small, fast benchmark for sanity-checking your retriever + answerer in CI before you reach for the heavyweight benchmarks. It includes 15 hand-crafted RAG (Retrieval-Augmented Generation) eval queries with ground-truth document IDs and reference answers. The dataset features a negative-control query (no relevant docs exist) to verify your system doesnt hallucinate when retrieval comes back empty. Categories include factoid, how-to, technical, policy, comparison, summary, security, and negative-control. The schema includes query ID, user question, ground truth doc IDs, expected answer, category, and difficulty level. Suggested metrics include retrieval recall@k, answer match, and refusal recall.

提供机构:
mukunda1729
二维码
社区交流群
二维码
科研交流群
商业服务