PIXAR
收藏资源简介:
PIXAR是一个包含420K+对的基准数据集,具有像素级忠实标签和8种操作类型。它用于视觉语言模型(VLM)图像篡改的检测、定位和描述任务,相比之前的SOTA方法,实现了2.7倍的IoU提升。
PIXAR is a benchmark dataset containing over 420K image pairs, with pixel-level faithful labels and 8 types of manipulation operations. It is designed for the tasks of detection, localization and description of image tampering for vision-language models (VLMs), and achieves a 2.7-fold IoU improvement compared with previous state-of-the-art (SOTA) methods.
PIXAR 数据集概述
数据集基本信息
- 数据集名称:PIXAR
- 核心贡献:一个新的、大规模的视觉语言模型(VLM)图像篡改检测基准与训练框架。
- 主要目标:解决现有基于掩码的篡改基准中存在的标签与真实编辑信号错位的问题,将VLM图像篡改检测重新定义为像素级、语义感知和语言感知的任务。
数据集规模与构成
- 总规模:超过420,000个训练图像对。
- 测试集:一个精心平衡的、包含40,000个图像对的测试集。
- 数据对构成:每个数据对包含原始图像与生成(篡改)图像。
- 标签信息:每个数据对提供像素级篡改图、语义类别标签和自然语言描述。
关键创新与特性
- 新分类法:涵盖8种编辑原语(替换、移除、拼接、修复、属性编辑、着色等),并与被篡改对象的语义类别相关联。
- 新基准:使用像素差异图($D = |I_{ ext{orig}} - I_{ ext{gen}}|$)和可调阈值($ au$)生成动态的真实标签($M_ au$),取代了传统的粗粒度对象掩码,实现了与生成足迹的精确对齐。
- 新评估指标:通过定位量化像素级正确性,基于真实编辑强度评估置信度,并通过语义感知分类和自然语言描述来衡量对篡改含义的理解。
数据内容与任务
- 支持任务:分类(真实/篡改)、定位(像素级)、描述(自然语言)。
- 标签类型:
- 像素级 $M_ au$ 篡改图。
- 语义类别(81个COCO类别)。
- 文本描述。
- 二分类标签(篡改或未篡改)。
数据获取与格式
-
获取方式:
- 推荐:从Google Drive下载预处理的完整数据集(链接:https://drive.google.com/drive/folders/1Zwhi403Ozy26cR1CW7EfuomFnE9qDmze?usp=drive_link)。
- 自定义:下载原始图像对和像素差异图,使用提供的脚本在自定义阈值 $ au$ 下重新生成标签。
-
文件结构:
dataset_dir/ ├── train/ # 训练集 │ ├── real/ # 真实图像 │ ├── tampered/ # AI篡改图像 │ ├── masks/ # 用于生成篡改图像的掩码 │ ├── soft_masks/ # 像素差异图 M_τ │ └── metadata/ # JSON元数据(包含类别和文本描述) └── validation/ # 验证集(结构同训练集)
-
阈值($ au$)选择指南:
- 0.05:默认值,平衡的灵敏度(推荐)。
- 0.01:捕捉微编辑和细微像素变化。
- 0.1:仅包含高置信度的语义变化。
- 0.2:保守,仅包含大型、明显的编辑。
关联模型
基于该数据集训练了多个VLM检测器,能够同时定位、分类和描述篡改区域。发布的模型包括:
- PIXAR-7B 与 PIXAR-7B_lite
- PIXAR-13B 与 PIXAR-13B_lite 模型可在HuggingFace获取(链接:https://huggingface.co/jiachengcui888/PIXAR-7B)。
许可证
- 数据集遵循 MIT 许可证。




