遇见数据集

groundtruth-hallucination-bench-sample

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

Groundtruth Hallucination Bench 是一个用于评估 AI 模型事实陈述准确性的幻觉测试基准。本免费样本包含 100 个机器可运行的测试用例,从完整的 Groundtruth 数据集中采样(完整数据集包含 17 个经过验证的 ground-truth 数据集,共 918 个评估案例)。该数据集专门用于衡量模型是否陈述事实还是编造事实(幻觉)。每个测试用例的预期答案均通过独立从实时主要来源(如 openFDA、SEC EDGAR、USASpending、USPTO、ClinicalTrials.gov、Companies House REST API、Wikidata、NIST、Project Gutenberg 全文、固定解释器版本上的真实代码执行等)重新推导而来,而非爬取、生成或从模型记忆中回忆。每个样本都附带来源 URL。数据经过三重对抗审计:专门的怀疑论者针对实时来源尝试反驳每一行,发现并修复了约 55 个真实错误,每次修正均行内披露,甚至有一次审计捕获并回滚了错误的早期“修正”。数据集具有抗污染性:行基于日期的实时查询验证,每月添加新的训练后截止日期事实(例如当前模型无法从训练数据中得知的 2026 年 6 月 FDA 召回)。每个样本包含以下字段:question(问题)、expected_answer(预期答案)、grading_context(评分上下文)、grading_mode(评分模式:exact、numeric 或 judge)、difficulty(难度)、tags(标签)、source_urls(来源 URL)以及一个前沿模型的实际冷启动评分尝试作为基线(reference_model)。在完整数据集的 874 个已评分案例上,Claude Sonnet 5 的基线性能为:70.8% 正确、10.1% 幻觉、18.6% 回避。该数据集适用于问答系统的事实准确性评估、幻觉检测、事实验证等任务。本样本采用 CC BY 4.0 许可(署名“Groundtruth”)。

The Groundtruth Hallucination Bench is a benchmark for evaluating the factual accuracy of AI model statements. This free sample contains 100 machine-runnable test cases sampled from the full Groundtruth dataset (which includes 17 validated ground-truth datasets with 918 evaluation cases). The dataset is specifically designed to measure whether models state facts or fabricate information (hallucinate). Each test cases expected answer is independently derived from real-time primary sources (such as openFDA, SEC EDGAR, USASpending, USPTO, ClinicalTrials.gov, Companies House REST API, Wikidata, NIST, Project Gutenberg full text, real code execution on a fixed interpreter version, etc.), rather than crawled, generated, or recalled from model memory. Each sample includes source URLs. The data undergoes triple adversarial auditing: dedicated skeptics attempt to refute each line against live sources, discovering and fixing approximately 55 real errors, with each correction disclosed inline, and even one audit that caught and rolled back an erroneous early fix. The dataset is contamination-resistant: lines are validated by real-time queries based on dates, with new post-training cutoff facts added monthly (e.g., an FDA recall from June 2026 that current models cannot know from training data). Each sample contains fields: question, expected_answer, grading_context, grading_mode (exact, numeric, or judge), difficulty, tags, source_urls, and a baseline from a frontier models actual cold-start scoring attempt (reference_model). On the 874 scored cases of the full dataset, Claude Sonnet 5 baseline performance is: 70.8% correct, 10.1% hallucination, 18.6% abstention. The dataset is suitable for factual accuracy evaluation of QA systems, hallucination detection, fact verification, etc. This sample is licensed under CC BY 4.0 (attribution Groundtruth).

创建时间:
2026-08-21
原始信息汇总

Groundtruth Hallucination Bench(免费样例)数据集概述

基本信息

  • 数据集名称:Groundtruth Hallucination Bench (free sample)
  • 许可证:CC BY 4.0
  • 任务类别:问题回答(question-answering)
  • 语言:英语
  • 数据规模:少于1000条(免费样例含100条测试用例)
  • 标签:幻觉检测、评估、基准测试、事实验证、真实数据

数据来源与构建方式

  • 该样例取自 Groundtruth 目录,完整目录包含 17个经核实的真实数据集,共 918个评估案例,核心功能是衡量AI模型是陈述事实还是编造信息。
  • 每条预期答案均为从实时主要来源独立重新推导(包括openFDA、SEC EDGAR、USASpending、USPTO、ClinicalTrials.gov、Companies House REST API、Wikidata、NIST、Project Gutenberg全文以及固定解释器版本上的真实代码执行),并非抓取、生成或从模型记忆中提取,且每条数据附带来源URL。
  • 数据经过三重对抗性审计:专门的怀疑者针对实时来源逐条证伪,发现并修复了约55处真实错误,每项修正均在行内披露。

字段结构

每条数据为独立案例,包含以下字段:

  • question(问题)
  • expected_answer(预期答案)
  • grading_context(评分上下文)
  • grading_mode(评分模式:精确 | 数值 | 裁判)
  • difficulty(难度)
  • tags(标签)
  • source_urls(来源URL)
  • reference_model(参考模型及其冷评分尝试)

基线表现

在全部874个已评分案例中(冷启动、无工具、无检索),Claude Sonnet 5 的表现:

  • 70.8% 正确
  • 10.1% 幻觉
  • 18.6% 回避作答
  • 各领域幻觉率从 0%(历史)到 32.6%(引文图谱问题)不等

运行方式

支持通过命令行工具运行评估:

  • 支持 Anthropic API 及任意 OpenAI 兼容端点(如 Ollama)
  • 支持通过自定义命令接入任意模型

完整数据集说明

  • 当前样本约占完整数据的10%
  • 完整目录包含17个数据集、918个案例及一个171家公司的已核实AI/ML生态数据集
  • 提供一次性导出或月度定期复核的Living版本(含漂移变更日志及新的抗污染行)
  • 基础事实源自公共领域/美国政府/CC0主要来源,每行均标注引用来源
搜集汇总
数据集介绍
groundtruth-hallucination-bench-sample 数据集图片
构建方式
本数据集为Groundtruth Data产品公开的预览样本,精选自各领域已核验的数据记录,涵盖18个代表性领域,每个领域包含10条样本,共计180条。每一条数据均以结构化JSON格式呈现,包含问题、经核验的答案、核验摘要、来源URL及难度等级等字段。其构建过程依托官方API、主要注册表、代码执行与数学计算等权威源头,对内部产品导出的数据进行字段重命名与整理,确保信息源可追溯且原数据集未作改动。
特点
该数据集以来源锚定与核验透明为核心特色,每条样本均附有简洁的核验摘要与权威源链接,支持确定性或来源感知的评分模式。其覆盖领域广泛,从临床实验、法律文本到代码执行与历史事实,均以统一的模式组织,便于跨域比较。此外,数据集中嵌入了参考模型响应及判定结果,但未观察到的模型输出不会被虚构,确保了数据的真实性与可靠性。
使用方法
此样本适用于模型幻觉检测与事实性评估的起步探索。用户可基于其question字段发起查询,将模型输出与verified_answer进行比对,并借助verification_summary理解核验逻辑。grading_mode字段提示了可采用的评分方式,difficulty则辅助分层测试。由于样本量有限,不适用于全面性能估算,但可作为构建更大规模验证集或开发自动化评估管线的参考蓝图。
背景与挑战
背景概述
groundtruth-hallucination-bench-sample数据集由Groundtruth Data团队构建,于近期发布,旨在应对大语言模型(LLM)在事实性问答中的幻觉问题。该团队专注于利用权威来源数据构建验证评估与修复数据集,其商业流程涵盖模型失败定位、大规模验证、针对性修复及留出验证。此公开样本包含180条跨域示例,覆盖18个领域,如科学、法律、金融等,每种10条,每条记录均关联可验证答案、验证摘要及来源溯源。该数据集的价值在于其方法学贡献,展示了基于权威数据源(如SEC EDGAR、FDA、OpenAlex等)的验证范式,为评估LLM事实性提供了可复现的基准,推动了幻觉检测与缓解研究的发展。
当前挑战
当前挑战主要源于领域问题的复杂性与构建过程的高门槛。领域层面,LLM生成的幻觉内容难以用传统指标衡量,尤其在跨领域事实核查(如临床、法律、金融)中,答案需高度精确且依赖动态权威源,对评估框架的鲁棒性和可扩展性提出要求。构建过程面临多重障碍:一是数据采集需整合异构权威源(如API、注册表),并处理许可与版权限制,确保来源合规;二是验证流程需自动化与人工复核结合,以保证答案的可靠性,尤其对于代码执行、数学计算等非文本验证;三是保持样本代表性,避免偏差,同时平衡规模与成本,确保持续更新以反映最新事实。这些挑战凸显了该数据集在促进可靠AI评估中的前沿性。
常用场景
经典使用场景
在自然语言处理与大型语言模型评测领域,该数据集作为一项精炼的基准测试样本,常用于评估模型在源引证基础上的事实性回答能力。其设计初衷在于通过涵盖多领域的、带有严格溯源标注的问答对,检验模型是否会产生与权威来源相悖的幻觉内容。研究者可借此样本快速开展模型鲁棒性诊断,特别是在跨领域事实核查、代码执行验证及法律文书等专业性较强的场景中,分析模型输出与事实基准的偏差,从而为构建更可靠的评测体系奠定基础。
实际应用
在产业实践中,该数据集构建了一套从模型弱点发现到验证、修复及最终确认的闭环工作流。企业可运用其公开样本进行前期概念验证,快速定位模型在医疗、法律、金融等高严谨度领域的潜在错误回答;随后基于扩充的验证集和定向训练数据实施精细调优,最终利用未触碰的隔离验证数据确保优化效果的可靠性。这种诊断-修复-验证的实践路径,尤其适用于RAG系统的事实一致性监控、客户服务机器人的风险管控以及专业辅助工具的准确性保障,能显著降低因模型幻觉引发的运营风险。
衍生相关工作
该数据集的架构理念催生了一系列围绕事实性评测与知识溯源的研究工作。其领域细分模式启发了专业评估基准的构建,例如针对科学文献引用的核实基准、临床实验结论的验证集,以及跨源信息一致性分析框架。其源码追溯与多级验证方案,促进了对抗性幻觉样本的生成技术和注意力机制可解释性研究的发展;同时,基于其分级数据集角色划分,衍生出了关于训练-验证数据隔离策略、主动学习采样效率以及小样本提示优化等方向的探讨,这些工作共同丰富了大型语言模型可靠性工程的方法体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务