RuFalseQA
收藏资源简介:
RuFalseQA 是一个基于 AI 生成、经过人工筛选的数据集,包含 500 个高难度的对抗性提示,专门用于评估大语言模型在幻觉抵抗、前提验证、谄媚和事实鲁棒性方面的表现。数据集中的每个样本都嵌入了一个虚假、捏造、扭曲或不存在的前提,要求模型能够检测出虚假前提、独立验证事实并质疑错误前提,而不是盲目接受并给出错误答案。提示语言为俄语,文档为英语。数据格式为 JSON 数组,每个样本包含七个字段:唯一标识符(id)、虚假前提类别(category,包括 NONEXISTENT_ENTITY、DISTORTED_FACT、FABRICATED_QUOTE_OR_ATTRIBUTION、FALSE_CAUSALITY_OR_SCIENCE、FALSE_EVENT)、难度等级(difficulty,easy/medium/hard)、对抗性提示问题(question)、虚假前提描述(false_premise)、正确答案(correct_answer)、理想模型行为(ideal_model_behavior)。数据创建过程采用多阶段 AI 辅助流程:首先由大语言模型生成对抗性问题,然后由另一个 LLM 进行事实验证,最后经过人工审核筛选和编辑,确保提示的自然性和质量。该数据集受原始 FalseQA 数据集(Hu et al., 2023)启发,但并非翻译或衍生版本,而是独立的俄语基准测试,扩展了字段结构和分类体系。建议使用者将其视为 AI 辅助、人工筛选的基准测试,注意其事实准确性依赖于 LLM 验证而非人类专家逐条核查。数据集采用 CC BY 4.0 许可证发布。
RuFalseQA is an AI-generated, human-filtered dataset containing 500 high-difficulty adversarial prompts, specifically designed to evaluate large language models in terms of hallucination resistance, premise verification, sycophancy, and factual robustness. Each sample embeds a false, fabricated, distorted, or non-existent premise, requiring the model to detect the false premise, independently verify facts, and question the incorrect premise rather than blindly accepting it and providing a wrong answer. The prompts are in Russian, and the documentation is in English. The data format is a JSON array, with each sample containing seven fields: unique identifier (id), false premise category (category, including NONEXISTENT_ENTITY, DISTORTED_FACT, FABRICATED_QUOTE_OR_ATTRIBUTION, FALSE_CAUSALITY_OR_SCIENCE, FALSE_EVENT), difficulty level (difficulty, easy/medium/hard), adversarial prompt question (question), false premise description (false_premise), correct answer (correct_answer), and ideal model behavior (ideal_model_behavior). The data creation process adopts a multi-stage AI-assisted pipeline: first, an LLM generates adversarial questions, then another LLM performs fact verification, and finally, human review filters and edits to ensure the naturalness and quality of the prompts. This dataset is inspired by the original FalseQA dataset (Hu et al., 2023) but is not a translation or derivative; it is an independent Russian benchmark with extended field structure and classification system. Users are advised to treat it as an AI-assisted, human-filtered benchmark, noting that its factual accuracy relies on LLM verification rather than human expert verification for each item. The dataset is released under the CC BY 4.0 license.
RuFalseQA 数据集详情
数据集概览
RuFalseQA 是一个俄语对抗性评测基准数据集,包含 500 条人工精选的对抗性提示,专门用于评估大型语言模型在以下方面的能力:
- 幻觉抵抗(Hallucination Resistance)
- 前提验证(Premise Verification)
- 谄媚行为抵抗(Sycophancy)
- 事实稳健性(Factual Robustness)
该数据集的核心设计逻辑是:每条数据将一个虚假、捏造、扭曲或不存在的前提嵌入用户查询中,考察模型能否识别虚假前提、独立验证事实并挑战用户,而非盲目接受并产生看似自信的错误答案。
基本信息
- 语言:提示文本为俄语(RU),文档说明为英语
- 许可证:CC BY 4.0
- 格式:原生 JSON 数组,符合严格 JSON Schema
- 数据规模:少于 1K 条(具体为 500 条)
虚假前提分类体系
数据集将虚假前提划分为 5 个类别:
| 类别 | 描述 |
|---|---|
NONEXISTENT_ENTITY |
虚构法律、不存在的生物细胞器、伪造术语 |
DISTORTED_FACT |
历史与科学谬误、错误作者归属、时间线篡改 |
FABRICATED_QUOTE_OR_ATTRIBUTION |
伪造引文、错误归属、真实引文的语境曲解 |
FALSE_CAUSALITY_OR_SCIENCE |
伪科学、虚假因果关系、都市传说、已被推翻的健康/物理说法 |
FALSE_EVENT |
捏造或扭曲的历史/时事、错误日期、结果反转或无中生有的事件 |
数据字段结构
每条数据包含 7 个必填字段:
| 字段 | 类型 | 说明 |
|---|---|---|
id |
整数 | 唯一标识符 |
category |
枚举字符串 | 上述分类之一 |
difficulty |
枚举字符串 | easy / medium / hard,表示虚假前提的隐蔽程度 |
question |
字符串 | 俄语对抗性提示(含嵌入的虚假前提) |
false_premise |
字符串 | 虚假内容的明确描述及原因 |
correct_answer |
字符串 | 事实准确的答案或修正 |
ideal_model_behavior |
字符串 | 理想模型的应有回应模式描述 |
数据构建流程
RuFalseQA 采用 多阶段 AI 辅助流水线 + 人工监督 的方式构建:
- 生成阶段:由大语言模型生成对抗性问题及其嵌入的虚假前提。
- 事实验证阶段:由独立的第二个 LLM 逐批次验证
false_premise和correct_answer的事实准确性。 - 人工策展阶段:人工审阅者根据措辞质量、自然度和风格契合度筛选和编辑条目,但不从头复核底层事实。
需要特别注意的是,该数据集的事实准确性依赖 LLM 验证而非独立人工事实核查,可能存在残余误差,建议将之视为 AI 辅助、人工策展的基准数据集 而非完全人工验证的参考数据集。
与 FalseQA 的关系
RuFalseQA 受原始 FalseQA 数据集(Hu 等人, ACL 2023)的假前提问答范式启发,但并非翻译或衍生版本,而是独立的俄语数据集,具备以下扩展特征:
- 采用五字段结构(较原版的 question/answer/label 更丰富)
- 提出独立的虚假前提类型分类法
- 使用原生俄语提示,针对跨语言对齐稳健性评估
原始 FalseQA 提供约 2,365 条人工撰写的英语假前提问题,而 RuFalseQA 专注于俄语场景的对抗性评估。




