遇见数据集

RuFalseQA

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

RuFalseQA 是一个基于 AI 生成、经过人工筛选的数据集,包含 500 个高难度的对抗性提示,专门用于评估大语言模型在幻觉抵抗、前提验证、谄媚和事实鲁棒性方面的表现。数据集中的每个样本都嵌入了一个虚假、捏造、扭曲或不存在的前提,要求模型能够检测出虚假前提、独立验证事实并质疑错误前提,而不是盲目接受并给出错误答案。提示语言为俄语,文档为英语。数据格式为 JSON 数组,每个样本包含七个字段:唯一标识符(id)、虚假前提类别(category,包括 NONEXISTENT_ENTITY、DISTORTED_FACT、FABRICATED_QUOTE_OR_ATTRIBUTION、FALSE_CAUSALITY_OR_SCIENCE、FALSE_EVENT)、难度等级(difficulty,easy/medium/hard)、对抗性提示问题(question)、虚假前提描述(false_premise)、正确答案(correct_answer)、理想模型行为(ideal_model_behavior)。数据创建过程采用多阶段 AI 辅助流程:首先由大语言模型生成对抗性问题,然后由另一个 LLM 进行事实验证,最后经过人工审核筛选和编辑,确保提示的自然性和质量。该数据集受原始 FalseQA 数据集(Hu et al., 2023)启发,但并非翻译或衍生版本,而是独立的俄语基准测试,扩展了字段结构和分类体系。建议使用者将其视为 AI 辅助、人工筛选的基准测试,注意其事实准确性依赖于 LLM 验证而非人类专家逐条核查。数据集采用 CC BY 4.0 许可证发布。

RuFalseQA is an AI-generated, human-filtered dataset containing 500 high-difficulty adversarial prompts, specifically designed to evaluate large language models in terms of hallucination resistance, premise verification, sycophancy, and factual robustness. Each sample embeds a false, fabricated, distorted, or non-existent premise, requiring the model to detect the false premise, independently verify facts, and question the incorrect premise rather than blindly accepting it and providing a wrong answer. The prompts are in Russian, and the documentation is in English. The data format is a JSON array, with each sample containing seven fields: unique identifier (id), false premise category (category, including NONEXISTENT_ENTITY, DISTORTED_FACT, FABRICATED_QUOTE_OR_ATTRIBUTION, FALSE_CAUSALITY_OR_SCIENCE, FALSE_EVENT), difficulty level (difficulty, easy/medium/hard), adversarial prompt question (question), false premise description (false_premise), correct answer (correct_answer), and ideal model behavior (ideal_model_behavior). The data creation process adopts a multi-stage AI-assisted pipeline: first, an LLM generates adversarial questions, then another LLM performs fact verification, and finally, human review filters and edits to ensure the naturalness and quality of the prompts. This dataset is inspired by the original FalseQA dataset (Hu et al., 2023) but is not a translation or derivative; it is an independent Russian benchmark with extended field structure and classification system. Users are advised to treat it as an AI-assisted, human-filtered benchmark, noting that its factual accuracy relies on LLM verification rather than human expert verification for each item. The dataset is released under the CC BY 4.0 license.

创建时间:
2026-09-05
原始信息汇总

RuFalseQA 数据集详情

数据集概览

RuFalseQA 是一个俄语对抗性评测基准数据集,包含 500 条人工精选的对抗性提示,专门用于评估大型语言模型在以下方面的能力:

  • 幻觉抵抗(Hallucination Resistance)
  • 前提验证(Premise Verification)
  • 谄媚行为抵抗(Sycophancy)
  • 事实稳健性(Factual Robustness)

该数据集的核心设计逻辑是:每条数据将一个虚假、捏造、扭曲或不存在的前提嵌入用户查询中,考察模型能否识别虚假前提、独立验证事实并挑战用户,而非盲目接受并产生看似自信的错误答案。

基本信息

  • 语言:提示文本为俄语(RU),文档说明为英语
  • 许可证:CC BY 4.0
  • 格式:原生 JSON 数组,符合严格 JSON Schema
  • 数据规模:少于 1K 条(具体为 500 条)

虚假前提分类体系

数据集将虚假前提划分为 5 个类别

类别 描述
NONEXISTENT_ENTITY 虚构法律、不存在的生物细胞器、伪造术语
DISTORTED_FACT 历史与科学谬误、错误作者归属、时间线篡改
FABRICATED_QUOTE_OR_ATTRIBUTION 伪造引文、错误归属、真实引文的语境曲解
FALSE_CAUSALITY_OR_SCIENCE 伪科学、虚假因果关系、都市传说、已被推翻的健康/物理说法
FALSE_EVENT 捏造或扭曲的历史/时事、错误日期、结果反转或无中生有的事件

数据字段结构

每条数据包含 7 个必填字段

字段 类型 说明
id 整数 唯一标识符
category 枚举字符串 上述分类之一
difficulty 枚举字符串 easy / medium / hard,表示虚假前提的隐蔽程度
question 字符串 俄语对抗性提示(含嵌入的虚假前提)
false_premise 字符串 虚假内容的明确描述及原因
correct_answer 字符串 事实准确的答案或修正
ideal_model_behavior 字符串 理想模型的应有回应模式描述

数据构建流程

RuFalseQA 采用 多阶段 AI 辅助流水线 + 人工监督 的方式构建:

  1. 生成阶段:由大语言模型生成对抗性问题及其嵌入的虚假前提。
  2. 事实验证阶段:由独立的第二个 LLM 逐批次验证 false_premisecorrect_answer 的事实准确性。
  3. 人工策展阶段:人工审阅者根据措辞质量、自然度和风格契合度筛选和编辑条目,但不从头复核底层事实

需要特别注意的是,该数据集的事实准确性依赖 LLM 验证而非独立人工事实核查,可能存在残余误差,建议将之视为 AI 辅助、人工策展的基准数据集 而非完全人工验证的参考数据集。

与 FalseQA 的关系

RuFalseQA 受原始 FalseQA 数据集(Hu 等人, ACL 2023)的假前提问答范式启发,但并非翻译或衍生版本,而是独立的俄语数据集,具备以下扩展特征:

  • 采用五字段结构(较原版的 question/answer/label 更丰富)
  • 提出独立的虚假前提类型分类法
  • 使用原生俄语提示,针对跨语言对齐稳健性评估

原始 FalseQA 提供约 2,365 条人工撰写的英语假前提问题,而 RuFalseQA 专注于俄语场景的对抗性评估。

搜集汇总
数据集介绍
RuFalseQA 数据集图片
构建方式
RuFalseQA的构建融合了人工智能辅助生成与人工精校的双重机制,旨在打造一个高难度、对抗性的俄语问答基准。其构建流程起始于利用大型语言模型批量生成内嵌虚假前提的对抗性问题,随后由独立的第二语言模型对每个条目的虚假前提及正确答案进行事实性核验,最后经由人类评审者对语料进行细致筛选与润色,确保问题的自然流畅与风格统一。这一流程虽非完全人工撰写,但通过多阶段验证与人工把关,显著提升了数据集的质量与可靠性,从而区别于原始的FalseQA数据集。
特点
RuFalseQA的显著特色在于其精心设计的五类虚假前提分类体系,涵盖虚构实体、扭曲事实、伪造引述、伪科学因果及虚构事件,全面检验模型对虚假信息的识别与挑战能力。数据集包含500个难度层级各异的对抗性提示,均以俄语撰写,用以探究跨语言情境下的推理鲁棒性与事实核查能力。每个条目均附带详尽的字段注释,包括问题的虚假前提说明、正确答案及理想模型行为描述,为模型的系统性评估提供了丰富的维度与清晰的标准。
使用方法
RuFalseQA旨在作为严苛的评估基准,用于衡量大语言模型在幻觉抵抗、前提验证及谄媚倾向方面的表现。使用者可通过HuggingFace的datasets库便捷加载数据,并以JSON格式解析条目。在评估模型时,可依据数据集中提供的'理想模型行为'字段作为参照,检验模型是否能主动识别虚假前提、进行独立事实核查并予以反驳而非简单逢迎。该数据集尤其适用于跨语言对齐稳健性的测试,以及比较不同模型在应对误导性信息时的能力差异,为AI安全与可信赖性研究提供重要支持。
背景与挑战
背景概述
RuFalseQA是在大型语言模型(LLM)幻觉与谄媚行为问题日益凸显的背景下,由Squeal-Studio团队于近期构建的对抗性基准数据集。该数据集包含500个精心设计的人工策展提示,旨在评估模型在俄语环境下对虚假前提的识别与反驳能力。其研究核心源自FalseQA(Hu等人,ACL 2023)所开创的虚假前提问答范式,但创新性地拓展至跨语言领域,并引入五类细粒度谬误分类体系。RuFalseQA对幻觉抵抗、前提验证及谄媚行为研究具有重要推动作用,为多语言LLM对齐鲁棒性评估提供了稀缺资源,尤其凸显了非英语场景中模型安全与事实性的挑战。
当前挑战
RuFalseQA所应对的领域挑战在于,当前LLM常盲目采信用户问题中的隐含虚假前提,生成看似自信实则谬误的应答,此现象在幻觉与谄媚双重机制下被加剧,而现有基准多集中于英语场景,俄语等低资源语言的评估近乎空白。在构建过程中,数据集面临多重困境:确保虚假前提的真实性需依赖双重LLM验证与人工筛选,但验证环节难以媲美逐条人工事实核查,存留潜在误差;合成生成步骤易引入模型特有表述模式,影响自然度;此外,如何设计兼具隐蔽性与多样性的提示以有效区分模型能力,亦构成显著挑战,使该基准在严谨性与可用性间需精密权衡。
常用场景
经典使用场景
RuFalseQA作为一种高难度的对抗性评测基准,在俄语语境下严谨地检验大语言模型对虚构前提的辨识与拒答能力。其设计蕴含五类精确划分的虚假前提,从伪造实体到扭曲事实,层层递进地考验模型在复杂推理中维持事实一致性的功底。研究者在评估模型鲁棒性时,常以此数据集为标尺,通过分析模型面对陷阱问题时的应答模式,深入剖析其在跨语言、跨文化场景下对于虚假信息的敏感度与防御机制。
衍生相关工作
RuFalseQA的问世催生了一系列相关探索,一方面,后续研究以该基准为鉴,借鉴其多维度虚假前提分类框架,拓展至其他低资源语言,构建全球化、多语种的对抗性评测资源;另一方面,基于该数据集在训练阶段的对抗性微调方法应运而生,旨在增强模型的核心事实核查能力。此外,该基准亦被用作探究模型谄媚行为与参数规模、解码策略间关联的测试床,推动了可解释性分析在幻觉抑制领域的长足发展。
数据集最近研究
最新研究方向
RuFalseQA作为一项针对大型语言模型幻觉抵抗、前提验证与谄媚倾向的严苛对抗性基准,其最新研究方向聚焦于跨语言推理鲁棒性与对齐稳健性的深度剖析。该数据集通过植入五类精巧伪前提的俄语提示,旨在揭示模型在多元文化语境下能否坚守事实边界、抵御虚假信息渗透。当前研究前沿尤为关注模型对虚构实体、扭曲史实及伪科学归因的辨识能力,并探索人类与AI协同构建评估体系的范式革新,推动从单语基准向多语种认知安全评估的跨越,为构建可信赖的通用人工智能提供关键衡量标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务