MisFactQA
收藏资源简介:
MisFactQA是一个包含多种程度事实错误的基准数据集,由中国人民大学、东南大学和浙江大学联合创建,旨在评估大语言模型在面对用户输入中事实扰动时的鲁棒性。数据集涵盖虚假前提、矛盾陈述和复合错误等三类典型错误模式,模拟真实用户查询中的复杂错误场景,通过人工构造与自动生成相结合的方式创建,确保错误类型的多样性与真实性。该数据集主要服务于推动模型从被动响应转向主动错误检测与纠正的研究,弥补现有基准缺乏复杂错误查询的不足,为提升模型在误导性输入下的可靠性提供系统评估平台。
MisFactQA is a benchmark dataset containing factual errors of varying degrees, jointly created by Renmin University of China, Southeast University, and Zhejiang University. It aims to evaluate the robustness of Large Language Models (LLMs) against factual perturbations in user inputs. The dataset covers three typical error patterns: false premises, contradictory statements, and complex errors. It simulates complex error scenarios in real-world user queries, and is constructed through a combination of manual construction and automatic generation to ensure the diversity and authenticity of error types. This dataset primarily serves to advance research on shifting models from passive response generation to proactive error detection and correction, addressing the gap that existing benchmarks lack complex erroneous queries, and providing a systematic evaluation platform for improving the reliability of models under misleading inputs.
Deduce 数据集详情
数据集概述
Deduce 是一个针对大型语言模型(LLM)在面临包含事实错误、虚假前提或矛盾主张的输入问题时的鲁棒性增强项目(EMNLP 2026)。其核心方法是通过 检测(Detect)→ 策略设计(Devise)→ 纠正(Correct) 的三阶段流水线来提升模型表现。项目主要包含以下资源:
- MisFactQA:一个构建的评估/训练数据集资源
- Deduce-P:基于提示词的多阶段方法
- Deduce-T:两阶段微调方法
- 基线方法(Baselines) 与 评估(Evaluation) 脚本
数据集内容
MisFactQA 是该项目的主要构建数据集,其数据来源主要包括 Prize、EchoMist 的子集以及 Hugging Face 上的公开数据集 hallucinations-dpo,并经过过滤、重构和数据增强处理。
数据集布局
text dataset/ ├── MisFact/ │ ├── train/ │ │ ├── complex_error_train_140.jsonl # 140 个样本 │ │ └── mix_qa_sampled_400.jsonl # 400 个样本 │ └── test/ │ └── Mis_Fact_overall.jsonl # 599 个样本 ├── Falseqa/ │ ├── train/ │ │ └── false_qa_train.jsonl # 2374 个样本 │ └── test/ │ └── false_qa_test.jsonl # 899 个样本 └── truthfulqa_mc.jsonl
数据格式(JSONL)
每行是一个 JSON 对象,典型字段如下:
json { "question": "...", "answer": "...", "label": "1" }
label = "1":问题包含虚假/误导性主张(主要评估对象)label = "0":问题在事实上是有效的
方法说明
Deduce-P(提示版本)
基于提示词实现 检测、策略设计、纠正 三阶段概念,共四个可执行步骤:
| 阶段 | 步骤 | 功能 |
|---|---|---|
| 检测 | Step 1 | 从问题中提取显式/隐式原子前提 |
| 检测 | Step 2 | 验证每个前提,检测真实前提间的冲突,并生成 has_error + mis_evidence |
| 策略设计 | Step 3 | 基于问题和 mis_evidence 生成可执行的纠正策略(开放式或多项选择模式) |
| 纠正 | Step 4 | 执行策略生成最终答案;若 has_error=No 则直接回答问题 |
Deduce-T(微调版本)
采用两阶段微调方法:先训练 检测(Detect) 阶段,再训练 策略设计(Devise) 阶段模型。所有模型基于 LLaMA-Factory 进行训练,支持 LoRA 等高效微调、多 GPU 训练、量化等特性。
训练数据:
| 阶段 | 文件 | 样本数 |
|---|---|---|
| 检测 | Deduce-T/training_data/detect_train_golden.json |
2433 |
| 策略设计 | Deduce-T/training_data/devise_train_qwen_14b_selected.json |
2079 |
数据采用 Alpaca 格式(instruction / input / output)。
评估指标
评估脚本为 evaluation/evaluate.py,采用 LLM-as-judge 方式,输出以下指标:
| 指标 | 描述 |
|---|---|
| Accuracy | 预测结果被判为事实正确的比例 |
| Clarify Score(1–5) | 预测识别和澄清虚假主张的能力 |
| MR(误导率) | 在含错误的问题中,仍被误导的比例 |
| CR(纠正率) | 在含错误的问题中,成功纠正的比例 |
支持模型
- Deduce-P:任何 Ollama 聊天模型(如 Qwen2.5、Llama-3.1、Gemma-3)
- Deduce-T:微调后的 Qwen2.5-7B / Llama-3.1-8B / Gemma3-12B
- 基线方法:对应后端的脚本
- 评估器(Judge):兼容 OpenAI API 的接口
环境需求
- Python 依赖(见
requirements.txt) - Ollama(用于 Deduce-P 及多数基线)
- LLaMA-Factory(用于 Deduce-T 训练)
- PyTorch + Transformers / Accelerate(用于 Deduce-T 推理脚本)
- OpenAI 兼容端点(用于 LLM-as-judge 评估)

- 1From Passive Response to Proactive Correction: Enhancing LLM Robustness Against Input Fact Perturbations中国人民大学; 东南大学; 浙江大学 · 2026年



