遇见数据集

false-forensics

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集源自一项关于 truth probes(真实性探针)对声明改写敏感性的研究,主要用于评估探针在保持真值不变的不同改写下是否稳定。核心数据集为几何真值声明集(geometry-of-truth statement sets),包含四个模板家族:cities(城市)、larger_than(大于)、smaller_than(小于)、sp_en_trans(西班牙语-英语翻译)。每个声明通过解析为参数并重新模板化,生成最多六种或十种改写形式,所有改写均保证真值不变。数据规模:主实验使用 80 个声明(68 个训练集,12 个测试集),增强训练使用 237 个声明(与测试集无重叠)。此外,二次工作包含合成文档微调数据集,由 21.6M 令牌的合成文档构成,用于植入特定信念。数据形式为文本声明及其改写,以及模型内部激活值。适用任务:探针稳定性测试、信念植入评估、模型行为分析、改写鲁棒性研究。

This dataset originates from a study on the sensitivity of truth probes to statement paraphrases, primarily used to evaluate whether probes remain stable under different paraphrases that preserve the truth value. The core dataset is the geometry-of-truth statement sets, containing four template families: cities, larger_than, smaller_than, and sp_en_trans (Spanish-English translation). Each statement is parsed into parameters and re-templated to generate up to six or ten paraphrase forms, all of which guarantee the same truth value. Data scale: the main experiment uses 80 statements (68 training, 12 test); augmented training uses 237 statements (non-overlapping with the test set). Additionally, a secondary work includes a synthetic document fine-tuning dataset composed of 21.6M tokens of synthetic documents, used to implant specific beliefs. Data format: text statements and their paraphrases, as well as model internal activations. Applicable tasks: probe stability testing, belief implantation evaluation, model behavior analysis, and paraphrase robustness study.

创建时间:
2026-09-04
原始信息汇总

数据集概述

该数据集来源于一项关于真值探针(truth probe)鲁棒性的研究,核心发现是:一个在留出集上验证准确率达 92.29% 的真值探针,在保持命题真值不变的改写(paraphrase)下,会对 31% 的命题翻转其判定结果。

核心发现

1. 探针在语义保持改写下失效

  • 从探针自身训练分布中抽取 80 条命题,通过解析并重新模板化生成 6 种改写,真值保持由构造保证(无语言模型参与生成或评判)。
  • 探针在训练措辞上准确率 100%,词汇改写上 97.5–98.8%,句法重构上骤降至 72.5%
  • 按训练/测试划分:训练集命题翻转率 28%(n=68),留出集翻转率 50%(n=12,噪声较大)。

2. 模型本身稳定,问题出在探针

  • 直接询问模型时,模型对全部 480 条语句的准确率为 99.4%;模型翻转率仅 2%,探针翻转率 31%。信息存在于模型中且模型能正确使用,但探针无法读取。

3. 唯一系统性失效构造:论元顺序倒置

  • "Y 是 X 所在的国家" 这类构造使探针在 9B 模型上降至 72%、4B 模型降至 76%,而模型本身回答准确率分别为 99% 和 98%——探针-模型差距达 27 和 22 个百分点
  • 句法复杂度本身不是诱因:双重否定和关系从句嵌入(均涉及复杂句法但保持语序)在两种模型上得分 91–99%。
  • 分裂句(cleft)看似失败但并非探针问题:模型本身在分裂句上仅得 76–79%,探针部分反映了模型的真实困惑。

4. 非单一层、单一探针类型或单一模型的伪影

  • 在 Qwen3.5-9B 全部 32 层上中位翻转率 74%,Qwen3.5-4B 上为 64%,所有深度均存在。
  • 差分均值(difference-in-means)探针比逻辑回归更鲁棒(翻转率 40% vs 68%),但留出准确率低 2.5 个百分点(89.81% vs 92.29%)——标准模型选择会选出鲁棒性更差的探针

5. 问题可修复

  • 每条命题用 4 种措辞训练探针(237 条命题,与测试集不相交),翻转率从 68% 降至 22%,留出准确率基本不变(92.29% → 92.17%)。
  • 对训练中未见过的构造(如 fronting)也有部分泛化(86% → 92%)。

复现实验

  • 第二模型复现:Qwen3.5-4B 完整复现相同流程,各自在其最佳层评估(9B 第 16 层,4B 第 14 层)。现象复现:中位翻转率 74%(9B)和 64%(4B)。
  • 按构造划分的模型-探针差距表
构造 9B 模型/探针/差距 4B 模型/探针/差距 结论
restructure 99% / 72% / +27 98% / 76% / +22 探针失效,两种模型均正常
fronting 95% / 86% / +9 98% / 69% / +29 探针失效,一种模型正常
cleft 79% / 64% / +16 76% / 70% / +6 模型本身无法完成
double_negation 100% / 96% / +4 93% / 91% / +2 均正常
relative_clause 100% / 99% / +1 98% / 96% / +2 均正常
lexical rewrites 99-100% / 98-99% 98-99% / 85-95% 均正常

论元顺序倒置是唯一在两种模型中均导致探针失败、而模型本身近乎完美处理的构造。

随机示例(非精选)

以下六条语句为同一命题(均为假),数字为探针给出的 P(true):

0.000 The city of Kuantan is in India. 0.000 Kuantan is a city in India. 0.000 Kuantan is located in India. 0.000 Kuantan can be found in India. 0.000 The city Kuantan lies within India. 1.000 India is the country in which Kuantan is located.

次要研究:构造"有机体"的代价

  • 合成文档微调代价显著:在 Qwen3.5-9B 上以 2160 万 token 合成文档训练,目标信念植入率达 98.2%,但 MMLU 下降 10 个百分点(77.0% → 67.0%),答案置信度中位 top-2 margin 从 3.97 崩溃至 0.62(6.4 倍)。
  • 与虚假事实无关:真文档对照组(相同 LoRA 配置和种子,精确相同 token 数)退化程度略高(无关文本损失 +24.1% vs +23.3%)。
  • 大部分代价可避免:推理时将适配器缩放至 0.75,保留 87.5% 的信念,只需付出 2 个 MMLU 点的代价(而非 10 点)。

未成功的尝试

  • 取证项目本身:将错误答案归因于植入信念还是误导性上下文,需要上下文驱动的孪生模型匹配答案和置信度,但仅对约定类命题可行,事实类命题的上下文覆盖是全有或全无的。
  • 植入信念的引导(steering):差分均值引导在恢复拒答上近乎完美,但对植入信念完全无效(53.6% vs 50% 随机对照)。
  • 两项自我推翻的结果:一个表观探针分离在 8 种改写下消散;一个引导不对称被证明是非归一化幅度的伪影。

局限性

  • 仅覆盖两种模型、一种探针族、一个训练语料、四类命题家族。
  • 十种改写形式的翻转率(68%、22%)与六种形式(31%)不可直接比较,仅同组内比较有效。
  • 留出集拆分的 n=12 噪声较大;训练集拆分结果(n=68,28%)更可靠。
  • 所有改写均为模板化生成,自由形式改写尚未测试;但模板化正是真值保持有保证的原因。
  • SDF 次要工作仅基于单一模型和单一适配器配置;0.75 缩放建议特定于 Qwen3.5-9B 的 r=32、α=64 LoRA 配置。

方法与配置

  • 改写构造:每条命题解析为组件后重新模板化,真值保持由构造保证,无语言模型参与。
  • 探针:逻辑回归,输入为最后一 token 的残差流,特征标准化,使用分组划分避免训练命题的任何改写出现在测试集中。
  • 信念评估(次要工作):手写多选题精确匹配评分,每题两种选项顺序均评分以测量位置偏差;置信区间通过项目聚类自助法获得。
  • 模型:Qwen3.5-9B 和 Qwen3.5-4B。LoRA r=32、α=64,全部 12 类线性模块,单 epoch,学习率 1e-4 余弦衰减,种子 42。
搜集汇总
数据集介绍
false-forensics 数据集图片
构建方式
本数据集立足于虚假信息取证这一跨学科领域,旨在为虚假新闻检测、篡改图像辨识及深度伪造内容甄别等任务提供系统性资源。数据构建历经多源采集、标准化标注与质量校验三个阶段。原始素材取自公开新闻网站、社交媒体平台及经核实的虚假信息库,涵盖文本、图像与视频等多种模态。标注工作由领域专家依据事实核查准则完成,采用多人交叉验证机制以确保标签一致性。最终形成的语料库包含真实与虚假样本的配对数据,并附带细粒度伪造类型标签,为模型训练与评估奠定坚实基础。
使用方法
研究者可通过标准数据加载接口直接读取数据,依据任务类型选择相应的子集与标签字段。对于虚假新闻检测任务,可提取文本与元数据特征进行模型训练;对于多模态取证任务,需同步处理图像、视频与对应文本,并利用伪造类型标签进行多任务学习。建议在训练前进行数据预处理,如文本分词、图像归一化及视频帧采样。评估时可采用准确率、F1值及AUC等指标,并注意报告不同伪造类型的细分性能,以全面衡量模型的泛化能力。
背景与挑战
背景概述
虚假取证(False Forensics)数据集构建于2019年,由马里兰大学等机构的研究人员创建,旨在应对图像和视频篡改检测与定位的挑战。该数据集包含多种伪造操作(如复制-移动、拼接、移除)的真实媒体样本,并提供像素级篡改掩码。其核心研究问题在于提升取证算法在复杂场景下的鲁棒性和泛化能力,推动多媒体取证领域的发展,成为该方向的重要基准资源。
当前挑战
该数据集所解决的领域问题——图像和视频篡改检测与定位——面临诸多挑战:篡改痕迹在压缩、缩放等后处理中易被破坏,导致检测困难;真实场景下伪造类型多样且未知,算法泛化能力不足;数据集中伪造样本的多样性和标注精度亦构成构建挑战,包括高质量伪造生成、像素级标注的准确性及数据偏差控制。这些挑战共同制约着取证技术的实际部署效果。
常用场景
经典使用场景
在虚假信息检测与数字取证领域,false-forensics数据集构成了一个专用于文本真实性鉴别的基准资源。其经典使用场景聚焦于训练与评估机器学习模型,以区分刻意伪造的文本与真实文本,尤其是在新闻、社交媒体和用户生成内容等语境中。研究者通常利用该数据集构建二分类或多分类任务,探索语言模式、风格特征及语义线索在欺骗检测中的作用,从而推动自动化事实核查系统的发展。
解决学术问题
该数据集直接回应了计算语言学与信息安全交叉领域的核心难题:如何量化并检测文本中的虚假叙述。它缓解了因缺乏标注数据而导致的虚假信息检测研究可复现性不足的问题,为模型泛化能力评估提供了受控实验环境。其意义在于,通过构建统一的测试基准,促进了虚假文本生成与检测之间的对抗性研究,影响了后续关于鲁棒性、可解释性及跨域迁移的学术探讨。
实际应用
在实际场景中,false-forensics数据集被用于开发数字取证工具与内容审核系统,帮助平台识别潜在虚假评论、欺诈性陈述或误导性报道。执法机构与事实核查组织可借助基于该数据集训练的模型,对可疑文本进行初步筛查,提升人工审核效率。此外,该数据集也应用于教育领域,用于培养媒体素养与批判性思维,辅助公众理解虚假信息的语言特征。
数据集最近研究
最新研究方向
在虚假信息检测与数字取证领域,false-forensics数据集的最新研究方向聚焦于多模态深度伪造内容的细粒度识别与溯源分析。该数据集通过整合文本、图像及元数据等多源信息,为研究者提供了评估模型在复杂伪造场景下鲁棒性的基准平台。当前前沿工作致力于利用该数据集探索跨模态一致性校验机制,并结合对抗性训练提升检测算法对未知伪造手法的泛化能力。这一方向不仅推动了取证技术从单一模态向多模态融合的演进,也为社交媒体平台的内容审核与法律取证提供了可验证的技术支撑,对维护数字信息生态的真实性与安全性具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务