遇见数据集

GenText-Forensics_third_place_additional_materials

收藏
Hugging Face2026-06-22 更新2026-06-23 收录
官方服务:

资源简介:

本数据集是ACM MM 2026 GenText-Forensics挑战赛第三名团队(MSU团队)解决方案的附加材料,包含模型权重、代码和复现产物。该解决方案旨在对多语言文档文本图像中的伪造内容进行检测、定位、分类和解释,采用了一个分解式思维链管道,包括文档篡改检测器(DTD)、Qwen过滤器和Qwen语义侦探三个主要组件。数据集内容主要包括:训练好的DTD检查点(`dtd.pth`)、DTD模型代码及骨干网络初始权重、用于DTD频率流的JPEG量化表pickle文件、两个阶段的LoRA适配器(过滤器和语义侦探)。此外,还提供了约6.5k张测试图像的中间产物,包括带有DTD区域红色标注框的图像、每张图像的DTD区域与OCR重叠的JSON文件、两个阶段的渲染提示,以及约4.3k条用于训练的精炼思维链数据。数据集适用于文档取证、伪造检测、篡改文本检测等研究任务,支持英语、中文、泰语、马来语、印尼语和阿拉伯语等多语言文档图像。数据集遵循CC-BY-NC-4.0许可证,仅限研究和非商业用途。

This dataset is the supplementary material for the third-place team (MSU team) solution in the ACM MM 2026 GenText-Forensics challenge, containing model weights, code, and reproduction outputs. The solution aims to detect, localize, classify, and explain forged content in multilingual document text images using a decomposed chain-of-thought pipeline, which includes three main components: 1) Document Tampering Detector (DTD), an external pixel-level visual tampering detector for generating tampering probability maps and converting them into numbered candidate regions; 2) Qwen Filter, a LoRA fine-tuned Qwen3-VL-32B model for verifying each DTD region (keep/discard) and assigning preliminary forgery types; 3) Qwen Semantic Detective, another LoRA fine-tuned Qwen3-VL-32B model for merging and relocating retained regions, discovering pure semantic anomalies, and generating final forensic reports. Both Qwen models are trained using chain-of-thought trajectories distilled from the privileged teacher model Qwen3-VL-235B. The dataset content mainly includes: trained DTD checkpoints (`dtd.pth`), DTD model code and backbone network initial weights, JPEG quantization table pickle files for DTD frequency flow, LoRA adapters for two stages (filter and semantic detective). Additionally, it provides intermediate outputs for approximately 6.5k test images, including images with red bounding boxes for DTD regions, JSON files of DTD region overlaps with OCR for each image, rendered prompts for two stages, and about 4.3k refined chain-of-thought data for training. The dataset is suitable for research tasks such as document forensics, forgery detection, and tampered text detection, supporting multilingual document images in English, Chinese, Thai, Malay, Indonesian, and Arabic. The dataset follows the CC-BY-NC-4.0 license, restricted to research and non-commercial use.

创建时间:
2026-06-20
原始信息汇总

数据集概述

  • 数据集名称: GenText-Forensics 2026 — Team MSU Third-Place Additional Materials
  • 许可证: CC-BY-NC-4.0(非商业研究用途)
  • 语言: 英语、中文、泰语、马来语、印度尼西亚语、阿拉伯语
  • 任务类别: 图像分割、图像到文本
  • 数据量: 1K < n < 10K

数据集内容

该数据集包含了Team MSU在ACM MM 2026 GenText-Forensics挑战赛中获得第三名的解决方案所需的人工制品,包括模型权重、代码和复现材料。

方法概述

采用分解式思维链(Chain-of-Thought)流水线,用于对多语言文档文本图像中的伪造进行检测、定位、分类和解释,具体分为三个步骤:

  1. DTD(文档篡改检测器):外部的像素级视觉篡改检测器,生成篡改概率图,并转换为编号候选区域。
  2. Qwen Filterer(筛选器):使用LoRA适配后的Qwen3-VL-32B模型,对每个DTD区域进行验证(保留/丢弃),并分配初步伪造类型。
  3. Qwen Semantic Detective(语义侦探):使用LoRA适配后的Qwen3-VL-32B模型,合并并重新定位保留区域,发现纯语义异常,并撰写最终的法医报告。

两个Qwen模型均在从特权教师模型Qwen3-VL-235B蒸馏得到的思维链轨迹上进行训练。

仓库内容

路径/文件夹 说明
dtd.pth 训练好的DTD模型检查点
dtd_backbones/ DTD模型代码及骨干网络初始权重
dtd_qt_table_ori.pk DTD频率流使用的JPEG量化表pickle文件
qwen_filterer/ 阶段1(筛选器)的LoRA适配器
qwen_semantic_detective/ 阶段2(语义侦探)的LoRA适配器
test_annotated/ 约6.5k张测试图像,标注了DTD区域框
test_dtd_ocr/ 约6.5k个JSON文件,包含DTD区域、区域与OCR的重叠信息及完整OCR输出
test_prompts_stage1/ 约6.5k个渲染的阶段1提示
test_prompts_stage2/ 约6.5k个渲染的阶段2提示
train_cot/ 约4.3k条训练图像的蒸馏思维链(教师模型输出,用于LoRA SFT)

使用方式

可直接通过huggingface_hubsnapshot_download下载所有资源:

python from huggingface_hub import snapshot_download

local = snapshot_download( repo_id="cmcshnik/GenText-Forensics_third_place_additional_materials", repo_type="dataset", )

预期用途与限制

  • 这些材料发布用于研究和可复现性目的,针对RealText-V2/GenText-Forensics基准上的文档伪造检测。
  • 模型专为法医分析调整,应在人类监督下使用;对于身份、金融或医疗文件的自动判决可能带来严重后果。
  • DTD检测器是一个外部组件(来源:Qu et al., CVPR 2023)。
  • 基础VLM为Qwen/Qwen3-VL-32B-Instruct,受其自身许可证约束。

许可证

数据集以CC-BY-NC-4.0许可证发布(研究、非商业用途),与RealText-V2数据集卡一致。附带的解决方案代码采用MIT许可证。基础模型和DTD检测器受各自上游许可证约束。

搜集汇总
数据集介绍
GenText-Forensics_third_place_additional_materials 数据集图片
构建方式
该数据集源自ACM MM 2026 GenText-Forensics挑战赛中MSU团队获得季军的解决方案,旨在推动多语言文档图像中伪造文本的检测、定位、分类与解释。构建方式采用分解式思维链流水线:首先借助外部像素级篡改检测器(DTD)生成篡改概率图并转化为候选区域;随后通过经LoRA微调的Qwen3-VL-32B模型对区域进行验证与初步分类;最后利用第二个LoRA适配模型合并有效区域、识别纯语义异常并生成最终取证报告。两个视觉语言模型的训练数据来源于从特权教师模型Qwen3-VL-235B蒸馏出的思维链轨迹,确保了模型在复杂伪造场景下的推理能力。
特点
该数据集的核心特点在于其多层次、多语言的伪造文本分析能力。它涵盖了英语、中文、泰语、马来语、印尼语和阿拉伯语六种语言,支持从像素级篡改检测到语义级异常识别的完整流程。数据集不仅提供了DTD模型的训练权重与代码,还包含了超过6000张测试图像的标注信息,如DTD区域边界框、OCR结果与区域重叠数据,以及约4300条训练图像的蒸馏思维链。其分解式架构将视觉篡改证据与语言理解相结合,使得模型能够输出结构化的取证报告,显著提升了可解释性与鲁棒性。
使用方法
使用该数据集时,研究人员可通过Hugging Face的snapshot_download函数下载完整资源,包括DTD模型权重、两个LoRA适配器及配套代码。加载方式为先基于Transformers库加载Qwen3-VL-32B基础模型,再通过PEFT库附加过滤器和语义侦探适配器,分阶段调用以实现从区域筛选到报告生成的完整推理。DTD检查点需以weights_only=False方式加载以保留训练状态。数据集专为学术研究与可重复性设计,遵循CC-BY-NC-4.0许可,建议在人工监督下用于文档取证分析,避免在身份、金融或医疗文档中直接给出自动判决。
背景与挑战
背景概述
GenText-Forensics 数据集诞生于2026年ACM MM国际会议举办的文档取证挑战赛中,由莫斯科国立大学的Kirill Koltsov、Aleksandr Gushchin、Anastasia Antsiferova和Dmitriy Vatolin等研究人员构建。该数据集聚焦于多语言文档图像中的文本伪造检测、定位、分类与解释这一核心研究问题,旨在推动视觉语言模型在文档取证领域的应用。作为该挑战赛季军解决方案的附加材料,该数据集包含经过精细标注的测试图像、链式思维推理轨迹以及LoRA微调适配器权重,为后续研究提供了可复现的基准。其影响力体现在首次将分解式链式思维管道与多模态大模型结合,为文档伪造检测任务提供了全新的技术范式。
当前挑战
该数据集所解决的领域挑战在于文档图像伪造检测的复杂性和多样性,包括跨语言文本篡改(支持中、英、泰等六种语言)、像素级伪造区域定位与语义异常识别。传统检测方法难以同时处理视觉伪造痕迹与文本语义矛盾,而本数据集通过DTD检测器与Qwen3-VL模型的级联管道实现了分层验证。构建过程中的挑战则体现在三个方面:一是需要从235B参数的教师模型中蒸馏出高效的链式思维训练轨迹;二是需协调DTD产生的候选区域与OCR文本的精准对齐(约6.5k测试图像中每个图像平均处理580个OCR项);三是LoRA适配器的双阶段设计要求两套独立适配器在共享基座上实现功能分离,同时保持推理效率。
常用场景
经典使用场景
GenText-Forensics 2026 挑战赛第三名解决方案的附加材料(由MSU团队提交)在文档图像取证领域具有典型应用。该数据集专门用于多语言文档图像中的文本篡改检测与定位研究,支持英文、中文、泰文、马来文、印尼文和阿拉伯文等多种语言。使用时,研究者可基于其提供的结构化流程复现冠军系统:首先利用DTD模块生成像素级篡改概率图并提取候选区域,随后通过LoRA适配的Qwen3-VL-32B模型进行区域验证与初步伪造类型判定,最后由语义侦探模块合并区域、发现纯语义异常并生成最终取证报告。该流程体现了视觉语言模型与链式思维推理的深度融合,为文档篡改检测提供了端到端的可复现范式。
解决学术问题
该数据集解决方案直接回应了文档图像取证领域的几个核心学术挑战。其一,现有方法难以在多语言场景下同时检测像素级伪造(如复制移动、拼接)和语义级篡改(如内容替换、逻辑矛盾),而本方案通过解耦的DTD视觉检测与Qwen语义分析,实现了双重异常捕获。其二,解决了训练数据中细粒度伪造注释匮乏的问题——团队从235B参数的教师模型蒸馏出链式思维轨迹,用于训练32B学员模型,显著降低了标注成本。其三,突破了视觉语言模型在文档取证中可解释性不足的瓶颈,通过分阶段输出候选区域、验证理由和最终报告,使检测过程透明化。这些贡献促进了自动化取证工具在学术研究中的可靠性与泛化能力提升。
衍生相关工作
该数据集衍生了多项具有影响力的研究工作。技术核心的DTD模块基于Qu等人(CVPR 2023)的文档篡改检测方法,本方案将其整合为流程化组件。链式思维蒸馏策略启发了后续研究者探索小模型从大模型中学习专业知识的新范式,例如类似架构被用于伪造视频字幕检测。LoRA适配器的双阶段设计(滤除器+语义侦探)推动了视觉语言模型在细粒度任务中模块化调优的发展,有工作尝试将其扩展至手写文档伪造检测。此外,该方案在GenText-Forensics 2026挑战赛的第三名成绩,促使学术界重新评估“视觉外观”与“语义逻辑”结合的必要性,相关分析和消融实验已为后续的篡改检测基准测试提供了参照基线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务