FACTBENCH
收藏资源简介:
FACTBENCH是由密歇根大学计算机科学与工程系创建的一个动态基准数据集,用于评估语言模型在真实世界交互中的事实性。该数据集包含1000个多样化的信息查询提示,涵盖150个主题,旨在捕捉语言模型在生成错误和不明确响应时面临的挑战。数据集的创建过程包括从LMSYS-Chat-1M数据集中提取提示,并通过VERIFY管道进行验证和分类。FACTBENCH的应用领域主要集中在语言模型的事实性评估,旨在解决模型在处理复杂和多样化查询时可能产生的幻觉问题。
FACTBENCH is a dynamic benchmark dataset developed by the Department of Computer Science and Engineering at the University of Michigan, designed to evaluate the factuality of language models during real-world interactions. This dataset includes 1,000 diverse informational query prompts spanning 150 topics, aiming to capture the challenges that language models face when generating erroneous or ambiguous responses. The dataset construction process involves extracting prompts from the LMSYS-Chat-1M dataset, followed by validation and classification via the VERIFY pipeline. The main application of FACTBENCH focuses on factuality evaluation for language models, with the goal of addressing the hallucination problems that models may produce when handling complex and diverse queries.
FactBench 数据集概述
数据集信息
- 许可证: CC BY 4.0
- 版本: 1.0
数据文件
- tier_1:
tier_1.csv - tier_2:
tier_2.csv - tier_3:
tier_3.csv
内容分类
- 支持: 基于检索到的网络证据,内容单元被分类为支持、不支持或无法确定。
- 相关性: VERIFY 的事实判断与人类评估的相关性优于现有方法。
数据集特点
- 幻觉提示: 识别出在不同主题下引发最高错误率或不可验证的 LM 响应的提示。
- 主题覆盖: 数据集包含 985 个提示,涵盖 213 个细粒度主题。
- 更新频率: 数据集定期更新新提示,以捕捉现实世界中 LM 交互中的新兴事实性挑战。
致谢
- Serper 团队: 感谢 Serper 团队提供对 Google Search API 的访问权限,这显著促进了基准的制作并加速了幻觉提示的评估。

- 1FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation密歇根大学计算机科学与工程系 · 2024年



