遇见数据集

MisFactQA

收藏
arXiv2026-08-26 更新2026-08-28 收录
官方服务:

资源简介:

MisFactQA是一个包含多种程度事实错误的基准数据集,由中国人民大学、东南大学和浙江大学联合创建,旨在评估大语言模型在面对用户输入中事实扰动时的鲁棒性。数据集涵盖虚假前提、矛盾陈述和复合错误等三类典型错误模式,模拟真实用户查询中的复杂错误场景,通过人工构造与自动生成相结合的方式创建,确保错误类型的多样性与真实性。该数据集主要服务于推动模型从被动响应转向主动错误检测与纠正的研究,弥补现有基准缺乏复杂错误查询的不足,为提升模型在误导性输入下的可靠性提供系统评估平台。

MisFactQA is a benchmark dataset containing factual errors of varying degrees, jointly created by Renmin University of China, Southeast University, and Zhejiang University. It aims to evaluate the robustness of Large Language Models (LLMs) against factual perturbations in user inputs. The dataset covers three typical error patterns: false premises, contradictory statements, and complex errors. It simulates complex error scenarios in real-world user queries, and is constructed through a combination of manual construction and automatic generation to ensure the diversity and authenticity of error types. This dataset primarily serves to advance research on shifting models from passive response generation to proactive error detection and correction, addressing the gap that existing benchmarks lack complex erroneous queries, and providing a systematic evaluation platform for improving the reliability of models under misleading inputs.

创建时间:
2026-08-26
原始信息汇总

Deduce 数据集详情

数据集概述

Deduce 是一个针对大型语言模型(LLM)在面临包含事实错误、虚假前提或矛盾主张的输入问题时的鲁棒性增强项目(EMNLP 2026)。其核心方法是通过 检测(Detect)→ 策略设计(Devise)→ 纠正(Correct) 的三阶段流水线来提升模型表现。项目主要包含以下资源:

  • MisFactQA:一个构建的评估/训练数据集资源
  • Deduce-P:基于提示词的多阶段方法
  • Deduce-T:两阶段微调方法
  • 基线方法(Baselines)评估(Evaluation) 脚本

数据集内容

MisFactQA 是该项目的主要构建数据集,其数据来源主要包括 Prize、EchoMist 的子集以及 Hugging Face 上的公开数据集 hallucinations-dpo,并经过过滤、重构和数据增强处理。

数据集布局

text dataset/ ├── MisFact/ │ ├── train/ │ │ ├── complex_error_train_140.jsonl # 140 个样本 │ │ └── mix_qa_sampled_400.jsonl # 400 个样本 │ └── test/ │ └── Mis_Fact_overall.jsonl # 599 个样本 ├── Falseqa/ │ ├── train/ │ │ └── false_qa_train.jsonl # 2374 个样本 │ └── test/ │ └── false_qa_test.jsonl # 899 个样本 └── truthfulqa_mc.jsonl

数据格式(JSONL)

每行是一个 JSON 对象,典型字段如下:

json { "question": "...", "answer": "...", "label": "1" }

  • label = "1":问题包含虚假/误导性主张(主要评估对象)
  • label = "0":问题在事实上是有效的

方法说明

Deduce-P(提示版本)

基于提示词实现 检测、策略设计、纠正 三阶段概念,共四个可执行步骤:

阶段 步骤 功能
检测 Step 1 从问题中提取显式/隐式原子前提
检测 Step 2 验证每个前提,检测真实前提间的冲突,并生成 has_error + mis_evidence
策略设计 Step 3 基于问题和 mis_evidence 生成可执行的纠正策略(开放式或多项选择模式)
纠正 Step 4 执行策略生成最终答案;若 has_error=No 则直接回答问题

Deduce-T(微调版本)

采用两阶段微调方法:先训练 检测(Detect) 阶段,再训练 策略设计(Devise) 阶段模型。所有模型基于 LLaMA-Factory 进行训练,支持 LoRA 等高效微调、多 GPU 训练、量化等特性。

训练数据:

阶段 文件 样本数
检测 Deduce-T/training_data/detect_train_golden.json 2433
策略设计 Deduce-T/training_data/devise_train_qwen_14b_selected.json 2079

数据采用 Alpaca 格式(instruction / input / output)。

评估指标

评估脚本为 evaluation/evaluate.py,采用 LLM-as-judge 方式,输出以下指标:

指标 描述
Accuracy 预测结果被判为事实正确的比例
Clarify Score(1–5) 预测识别和澄清虚假主张的能力
MR(误导率) 在含错误的问题中,仍被误导的比例
CR(纠正率) 在含错误的问题中,成功纠正的比例

支持模型

  • Deduce-P:任何 Ollama 聊天模型(如 Qwen2.5、Llama-3.1、Gemma-3)
  • Deduce-T:微调后的 Qwen2.5-7B / Llama-3.1-8B / Gemma3-12B
  • 基线方法:对应后端的脚本
  • 评估器(Judge):兼容 OpenAI API 的接口

环境需求

  • Python 依赖(见 requirements.txt
  • Ollama(用于 Deduce-P 及多数基线)
  • LLaMA-Factory(用于 Deduce-T 训练)
  • PyTorch + Transformers / Accelerate(用于 Deduce-T 推理脚本)
  • OpenAI 兼容端点(用于 LLM-as-judge 评估)
搜集汇总
数据集介绍
MisFactQA 数据集图片
构建方式
MisFactQA数据集的构建融合了Prize、EchoMist及公开问答数据源,通过筛选、重构与增强流程,系统性地注入事实扰动。具体而言,从原始问题与参考回答中提取(主体,关系,客体)事实三元组,通过替换客体生成语义合理但事实错误的声明,并将其嵌入不同位置以构造三类查询:单一错误前提、内部矛盾描述及复合错误。每一条目均配备显式识别错误并提供正确信息的纠正性答案,经由Claude-3.5-Sonnet自动初筛与双人独立人工核验,仅在完全一致时保留,确保数据的高质量与可靠性。
特点
MisFactQA的独特之处在于其覆盖从单一错误到复合错误的完整错误复杂度谱系,挑战模型对蕴含错误前提、自相矛盾及多重错误并发等多样场景的鲁棒性。所有问题基于相同背景知识构建,确保性能差异源于错误类型而非领域偏差。数据集包含900对共享上下文但错误类型不同的问题,以及1140个引入多重扰动的问题,为评估模型在事实扰动下的检测、纠正与可靠应答能力提供了细致且客观的基准。
使用方法
MisFactQA可无缝衔接现有大语言模型评估流程,研究者可直接采用其标注的查询-响应对测试模型在事实扰动下的表现。配套的细粒度评估指标——误导率、纠正率与澄清分数——从三个维度量化模型行为,其中澄清分数采用1至5级评分,刻画从完全误导到完整澄清的渐变状态。该数据集亦支持微调场景,其构建的DDetect与DDevise+Correct训练数据可分别用于检测与纠正能力的专项训练,为提升模型对用户侧事实错误的鲁棒性提供了标准化的评测与训练资源。
背景与挑战
背景概述
MisFactQA数据集由中国人民大学、东南大学及浙江大学的研究人员于2026年提出,旨在应对大语言模型在面对输入中事实扰动(如错误前提、矛盾陈述和复合错误)时产生的幻觉问题。该数据集源于对用户输入质量对模型可靠性影响的深入探究,核心研究问题是构建一个模拟真实用户错误输入的基准,评估模型在误导性查询下的鲁棒性。MisFactQA整合了Prize、EchoMist等公开数据源,构建了1140条包含三种错误类型的测试样本,并提出了细粒度的评估指标(如误导率、纠正率、澄清分数),为输入侧幻觉缓解研究提供了标准化评测平台,推动了从被动响应到主动纠错的范式转变。
当前挑战
MisFactQA所应对的领域挑战在于:现有幻觉缓解研究多假设用户输入可靠,忽视了事实扰动对模型推理的系统性误导,导致模型在错误前提前缺乏主动识别与纠正能力。构建过程中的挑战则涉及:1)错误注入需保证语义合理且隐蔽,避免简单替换或明显矛盾;2)复合错误需覆盖多种错误类型的组合,且需确保错误可追溯至真实事实;3)评估指标需超越传统准确率,以刻画模型的误导、部分纠正及完全澄清等细微行为差异。此外,数据构建依赖GPT-4o与Claude-3.5-Sonnet进行自动生成与双重审核,需平衡生成质量与人工校验成本,确保数据的真实性和可靠性。
常用场景
经典使用场景
MisFactQA数据集的核心应用在于评估与提升大语言模型在面对事实扰动输入时的鲁棒性。具体而言,它通过精心构造包含虚假前提、内在矛盾及复合错误等多样化事实错误的查询,系统性地测试模型能否识别并纠正用户输入中的谬误,而非被动地继承错误信息。该数据集为自然语言处理领域提供了一套严苛的评测基准,促使研究者关注从被动应答到主动纠错的能力转变。
衍生相关工作
MisFactQA的提出催生了一系列相关经典工作。首先,它推动了针对输入事实扰动的检测与纠正方法研究,如DEDUCE框架这类三阶段系统。其次,它的构建思路启发了后续对多类型错误(如虚假前提与矛盾)进行联合建模的评测集设计,如FalseQA与TruthfulQA的扩展。此外,该数据集所倡导的澄清分数等指标,也促进了LLM评估方法从单一准确率向多维行为评估的转变,为后续在更强模型上验证鲁棒性提供了基准。
数据集最近研究
最新研究方向
MisFactQA数据集的构建聚焦于探究用户输入中的事实扰动对大型语言模型推理的误导效应,其研究前沿在于提出并验证‘检测-设计-纠正’(DEDUCE)框架,以增强模型对虚假前提、矛盾描述及复合错误等多样事实错误的主动识别与修正能力。该数据集系统性地模拟了现实用户查询中隐含的事实错误场景,辅以误导率、纠正率与澄清分数等多维评估指标,弥补了传统基准在衡量模型鲁棒性上的不足。其影响在于推动语言模型从被动应答向主动纠错转变,为构建更可靠、更值得信赖的AI系统提供了关键评测资源与方法论支撑,尤其在医疗、法律等高风险领域具有重要意义。
相关研究论文
  • 1
    From Passive Response to Proactive Correction: Enhancing LLM Robustness Against Input Fact Perturbations中国人民大学; 东南大学; 浙江大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务