BookEvidence(书籍归因长文本问答基准)
收藏官方服务:
资源简介:
BookEvidence(书籍归因长文本问答基准)是一个用于训练、评估和分析长上下文问答中证据归因能力的基准,旨在评估模型在复杂、跨领域长文本条件下,将生成内容与可验证证据进行精细对齐的能力。BookEvidence 包括:一个高质量的长上下文问答数据集,问题与证据来源于书籍级或章节级文档,覆盖法律、金融、历史、哲学、教育等多个领域。每个样本要求模型在生成答案的同时,以句子为粒度标注其支持证据,用于评估细粒度证据归因能力。一个统一的评估框架,基于 Trust-Score,从答案正确性、证据不足条件下的拒答行为以及引用准确性三个维度综合衡量模型表现。一个公开排行榜(Leaderboard),用于系统性比较不同开源与闭源模型在 BookEvidence 上的表现,揭示现有方法在长上下文证据归因方面的能力差异BookEvidence 采用与模型无关的数据与评测格式,适用于任何能够处理长文本并生成带证据引用回答的系统。其目标是推动真实长文本场景下可解释、可信问答系统的研究,并为证据归因能力的泛化评估提供一个具有挑战性且可复现的标准基准。
提供机构:
maas创建时间:
2026-02-15



