遇见数据集

naf-bench

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

NAF-Bench是一个用于评估大语言模型在默认否定推理(指定否定逻辑编程语义,如SLDNF、well-founded、credulous和skeptical stable-model)下表现的数据集。其主要指标是联合准确率(JOINT accuracy),即仅当模型对四种指定阅读方式都给出正确回答时,才计为一个正确样本。数据集由生成器新鲜生成,确保无污染,且生成器开源,可无限生成新的无污染实例。数据共有三个标准划分:训练集(1320个样本,带gold标签)、验证集(495个样本,带gold标签)和测试集(495个样本,gold为null,用于竞赛排行榜)。每个样本包含字段:id(唯一标识)、prompt(问题文本)、cond(条件)、gold(正确答案:A表示肯定yes,B表示肯定no,C表示无法确定)、rec_id(记录ID)、axis(轴)、difficulty(难度)。其中none条件的gold为null且不计分。此外,还提供了三个上下文预算层级的测试文件(inputs_8k-lite、inputs_16k、inputs_full)以及早期版本(dev_v1、dev_v2)和示例文件(sample_with_gold)。数据集可通过HuggingFace Datasets库直接加载,使用方式为:load_dataset("qbao775/naf-bench")。提交预测需生成JSONL格式的文件(每行包含id和prediction,prediction为A/B/C),并通过GitHub PR提交至仓库。该数据集适用于文本分类、逻辑推理、否定理解等任务,许可证为MIT,语言为英语。

NAF-Bench is a dataset for evaluating the performance of large language models under default negation inference (specifying negation logic programming semantics such as SLDNF, well-founded, credulous, and skeptical stable-model). Its main metric is JOINT accuracy, which counts a sample as correct only if the model gives correct answers for all four specified reading approaches. The dataset is freshly generated by a generator to ensure no contamination, and the generator is open-source, allowing infinite generation of new uncontaminated instances. The data has three standard splits: training set (1320 samples with gold labels), validation set (495 samples with gold labels), and test set (495 samples with gold as null, used for leaderboard). Each sample contains fields: id (unique identifier), prompt (question text), cond (condition), gold (correct answer: A for yes, B for no, C for uncertain), rec_id (record ID), axis (axis), difficulty (difficulty). Samples with none condition have gold as null and are not scored. Additionally, three context budget level test files are provided (inputs_8k-lite, inputs_16k, inputs_full), along with early versions (dev_v1, dev_v2) and an example file (sample_with_gold). The dataset can be loaded via the HuggingFace Datasets library using: load_dataset("qbao775/naf-bench"). Submissions should be in JSONL format (each line with id and prediction, prediction as A/B/C) and submitted via GitHub PR. This dataset is suitable for tasks such as text classification, logical reasoning, and negation understanding. License: MIT, Language: English.

创建时间:
2026-08-12
原始信息汇总

NAF-Bench 数据集概述

基本信息

  • 数据集名称:NAF-Bench
  • 许可证:MIT
  • 任务类型:文本分类(text-classification)
  • 语言:英语(en)
  • 标签:推理(reasoning)、逻辑(logic)、否定(negation)、基准测试(benchmark)

数据集目的

NAF-Bench 用于评估大语言模型(LLM)是否能够遵循指定的默认否定阅读方式(包括 SLDNF、良基语义、可信语义、怀疑稳定模型四种)。数据集由求解器认证且全新生成,确保无污染。主要指标为联合准确率(JOINT accuracy)——一个程序只有在四种指定阅读方式全部正确时才被计数。

数据划分

划分 行数 说明
train 1320 行 含金标签(gold),全新实例,用于训练
validation 495 行 含金标签(gold),公开 hard_v3 开发集
test 495 行 金标签为 null(竞赛测试集,标签隐藏)

三个划分之间互不重叠(训练/验证/隐藏测试之间无共享实例)。

数据格式

每一行包含字段:{id, prompt, cond, gold, rec_id, axis, difficulty}。其中:

  • gold 取值为 A(确定是)、B(确定否)、C(无法确定)
  • none 条件下的实例 gold=null,不计分

提交与排行榜

在测试集上预测,逐行输出 {"id": ..., "prediction": "A|B|C"},在 GitHubsubmissions/ 目录下提交 PR。GitHub Action 会根据私有金标签评分并更新排行榜。

其他文件(非默认划分的额外配置)

  • inputs_8k-lite.jsonl / inputs_16k.jsonl / inputs_full.jsonl:三个上下文预算层级的测试集(8k-lite ⊂ 16k ⊂ full),排行榜会分别评分
  • dev_v1.jsonl / dev_v2.jsonl:早期基准版本(含金标签),供溯源使用,但可猜测(基线准确率 76.5% / 100%),已被 hard_v3 取代
  • sample_with_gold.jsonl:少量带金标签的示例,用于格式参考

生成训练数据

生成器是开源的,可使用新种子重新生成无限的全新、认证、无污染实例。命令示例: bash python leaderboard/make_hard_v3.py --out more_train.jsonl --seed-offset 999 --variants 40

加载方式

python from datasets import load_dataset ds = load_dataset("qbao775/naf-bench") ds["train"] # 训练集 ds["validation"] # 验证集 ds["test"] # 测试集

参考资源

搜集汇总
数据集介绍
naf-bench 数据集图片
构建方式
NAF-Bench数据集是专为评估大型语言模型在否定默认推理(如SLDNF、良基语义、可信与怀疑的稳定模型)上的遵循能力而构建。该数据集通过开源生成器动态生成新鲜实例,每个实例均经过求解器认证,确保逻辑一致性,并有效避免数据污染。数据集已预先划分为互不相交的训练集(1320条)、验证集(495条)和隐藏测试集(495条),其中测试集的真实标签不对公开,以支持可靠的基准评估。
特点
该数据集的核心特点是其独特的评估指标——联合精确度(JOINT accuracy),即模型需在所有四种指定语义下均正确预测才算通过,这严格考验了模型对否定语义的精细区分。每个样本包含提示、条件、答案标签(A/B/C)及难度等属性,其中'none'条件不计分。此外,数据集还提供了不同上下文预算级别的测试输入(8k-lite、16k、full),以及早期版本用于溯源,确保了多样性和公平性。
使用方法
使用NAF-Bench十分便捷,可通过HuggingFace的datasets库一键加载,直接获得训练、验证和测试分割。研究人员可利用开源生成器自定义生成更多训练数据,增强模型。对于测试集,参与者需提交JSONL格式的预测结果,通过GitHub仓库发起PR,由自动评分系统对照私有标签计算分数并更新排行榜。此外,数据集支持多档上下文预算的独立评分,便于深入分析模型在不同资源限制下的表现。
背景与挑战
背景概述
NAF-Bench数据集诞生于大型语言模型(LLM)在逻辑推理与自然语言理解领域迅猛发展之际,由研究团队于2024年创建,旨在系统评估模型对默认否定(default negation)不同语义解读的遵循能力。该基准由Qbao等人构建,聚焦于逻辑编程与自然语言接口的交叉点,核心研究问题在于LLM能否区分并正确应用稳定模型语义、良基语义等四种指定读取方式。作为首个专门针对否定推理的求解器认证基准,NAF-Bench通过生成全新实例并隐藏测试标签,有效避免了数据污染,为逻辑推理评估树立了新的标杆,对推动LLM在形式语义理解方面的发展具有重要影响力。
当前挑战
NAF-Bench所应对的领域挑战十分尖锐:默认否定在逻辑编程中存在多种语义解释(如SLDNF、良基语义、怀疑与轻信稳定模型),LLM往往难以精确捕捉这些细微差异,导致推理结果不稳定。数据集的构建过程同样充满挑战,需要保证生成的每个实例都经过求解器认证,以确保语义标注的准确性,同时维持训练、验证与测试集之间的严格不重叠,防止数据泄露。此外,构建者还需精心设计不同难度级别(如hard_v3)与上下文预算分层(8k、16k、full),在控制计算成本的同时,提升基准的区分度与评估的全面性,最终实现一个既能有效训练模型,又能可靠衡量其逻辑推理能力的评测工具。
常用场景
经典使用场景
NAF-Bench数据集在自然语言处理与形式逻辑的交汇领域,为评估大型语言模型对默认否定(default negation)语义理解能力提供了严谨的基准。其设计理念源于逻辑编程中的否定即失败(Negation as Failure)及应答集编程的语义框架,通过区分SLDNF、良基语义、可信与怀疑的稳定模型四种解读,构造了覆盖不同逻辑流派的判定任务。该数据集以联合准确率(JOINT accuracy)为核心指标,要求模型在四种指定语义下均正确推断,从而严格检验模型对微妙逻辑差异的捕捉能力,成为探究LLM逻辑推理深度与一致性的重要工具。
解决学术问题
该数据集针对当前大语言模型在逻辑推理评估中普遍面临的语义模糊、易受数据污染等问题,提供了一种全新生成的、经求解器认证的对抗性测试集。它有效解决了传统基准(如开发集v1/v2)因可猜测性过高(基线高达100%)而缺乏区分度的问题,通过构建难度提升的hard_v3版本,能够精准揭示模型在默认否定不同语义解读下的性能短板。此基准为逻辑编程与神经符号研究提供了可靠评估平台,推动了对LLM内在推理机制的理解,并助力开发更具鲁棒性的逻辑推理模型。
衍生相关工作
基于NAF-Bench的发布,催生了一系列相关研究,例如针对其四种默认否定语义的专项模型微调方法、结合神经符号推理的增强策略,以及跨语言否定理解迁移的研究。该数据集也被用作对抗性风险测试集,用于评估生成式AI在逻辑对抗攻击下的稳定性。其公开的排行榜与代码库促进了基准的迭代更新,衍生出更复杂、更贴近真实场景的变体,如融入常识推理的否定理解任务,从而持续推动逻辑推理评估方法论的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务