遇见数据集

AINPAINT

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

AINPAINT是一个大规模视频取证数据集,专为像素级视频修复定位任务而构建。随着生成式人工智能的快速发展,视频修复和对象移除技术变得高度逼真,对多媒体完整性构成严重威胁。现有取证检测器主要依赖高频噪声或特定伪影特征,这些特征容易被H.264/HEVC压缩和AI后处理等真实世界退化所破坏。为填补这一关键空白,AINPAINT数据集包含了超过25,000个视频序列,这些序列使用九种不同的生成技术(包括OPN、STTN、FGVC、DSTT、CoCoCo、LDVI、FuseFormer、GMCNN、DiffuEraser)进行了操纵。数据集明确包含了经过时间平滑和重度压缩处理的变体,以模拟真实场景。核心内容为同一组源视频剪辑(分辨率432×240)提供配对数据:原始未操纵视频剪辑(标签0,真实)、九种修复方法生成的对应操纵版本(标签1,伪造),以及像素级的真值定位掩码(提供original和resized_432x240两种版本),与视频剪辑逐帧对齐。数据规模方面,总共有28,080个视频实例(包括25,272个伪造视频和2,808个真实视频),共计涉及711,148个PNG帧和1,422,264个解码的MP4帧。每个修复技术包含9种变体,模拟不同处理流程(如PNG帧文件夹和重新压缩的MP4视频)。数据集适用于视频修复定位、视频取证、媒体真实性验证和深度伪造检测等任务,以tar存档形式分发,基于CC-BY-4.0许可证发布。

AINPAINT is a large-scale video forensics dataset built specifically for pixel-level video inpainting localization tasks. With the rapid development of generative AI, video inpainting and object removal technologies have become highly realistic, posing severe threats to multimedia integrity. Existing forensic detectors primarily rely on high-frequency noise or specific artifact features, which are easily corrupted by real-world degradations such as H.264/HEVC compression and AI post-processing. To fill this critical gap, the AINPAINT dataset contains over 25,000 video sequences manipulated using nine different generation techniques: OPN, STTN, FGVC, DSTT, CoCoCo, LDVI, FuseFormer, GMCNN, and DiffuEraser. The dataset explicitly includes variants subjected to temporal smoothing and heavy compression to simulate real-world scenarios. The core content of the dataset is paired data for the same set of source video clips (with a resolution of 432×240): 1) `input_frames`: original, unmanipulated video clips (label 0, authentic/real); 2) corresponding manipulated versions generated by the nine inpainting methods (label 1, forged); 3) `input_masks`: pixel-level ground-truth localization masks with two variants (`original` and `resized_432x240`), aligned frame-by-frame with the video clips. In terms of data scale, there are 28,080 total video instances, including 25,272 forged videos (9 methods × 9 variants × 312 videos) and 2,808 authentic videos (`input_frames` × 9 variants × 312 videos), totaling 711,148 PNG frames and 1,422,264 decoded MP4 frames. Each "container" (i.e., each inpainting technique) includes nine variants to simulate different processing pipelines: three are provided as PNG frame folders (original raw output, post-processed by the OPN temporal consistency network, and post-processed again with Deep Video Prior), and six are provided as re-compressed MP4 videos (the aforementioned PNG outputs encoded with H.264 or HEVC at a Constant Rate Factor (CRF) of 23). Only two variants of mask data are provided: `original` and `resized_432x240`. This dataset is applicable to tasks including video inpainting localization, video forensics, media authenticity verification, and deepfake detection. It is distributed as tar archives for on-demand downloading. After extraction, files are organized by `input_frames`, `input_masks`, and the names of each inpainting technique. The official code repository provides data split files for training and evaluation. The dataset has good completeness, with only 5 clips having fewer than 30 frames due to inherent source video length or specific processing (DVP). The dataset is released under the CC-BY-4.0 license.

创建时间:
2026-07-24
原始信息汇总

AINPAINT 数据集概述

AINPAINT 是一个面向视频修复定位(Video Inpainting Localization)的大规模取证数据集,用于在像素级别定位视频中被修复(inpainted)的区域,相关论文发表于 Computer Vision and Image Understanding (CVIU) 2026。

核心信息

  • 许可证:CC-BY-4.0(Creative Commons Attribution 4.0),但数据集为派生数据,受上游方法及源数据集的许可证约束。
  • 数据类型:图像分割(image-segmentation),具体为视频修复定位任务。
  • 数据规模:10K–100K 级别。总计 28,080 个视频实例,包含 25,272 个修复视频(9 种修复方法 × 9 种变体 × 312 个视频)和 2,808 个真实视频。共 711,148 张 PNG 帧和 1,422,264 个解码后的 MP4 帧。
  • 分辨率:432×240。

内容构成

每个视频容器包含以下内容:

  • input_frames — 原始未修复的真实视频片段(标签 0)。
  • 9 种修复方法 — 同一视频经对象移除修复后的结果(标签 1),包括:OPN, STTN, FGVC, DSTT, CoCoCo, LDVI, FuseFormer, GMCNN, DiffuEraser
  • input_masks — 像素级地面真值定位掩码,提供 originalresized_432x240 两个版本,与视频帧逐帧对齐。

变体与处理溯源

每个容器包含 9 个变体,涵盖 PNG 帧和重压缩 MP4 格式:

变体 类型 说明
432x240 PNG 帧 原始修复输出
432x240_postprocessed PNG 帧 经 OPN 时间一致性网络(TCN)进行时间平滑
432x240_postprocessed_dvp PNG 帧 额外经过 Deep Video Prior / IRT 处理
432x240_recompressed_h264 MP4 H.264 重压缩(CRF 23)
432x240_recompressed_hevc MP4 HEVC 重压缩(CRF 23)
432x240_postprocessed_recompressed_h264 MP4 时间平滑 → H.264 重压缩
432x240_postprocessed_recompressed_hevc MP4 时间平滑 → HEVC 重压缩
432x240_postprocessed_dvp_recompressed_h264 MP4 时间平滑 + DVP → H.264 重压缩
432x240_postprocessed_dvp_recompressed_hevc MP4 时间平滑 + DVP → HEVC 重压缩

input_masks 仅提供 originalresized_432x240 两个变体。

打包与结构

数据集以 11 个 tar 归档文件形式分发(无压缩,提取即时完成),每个归档对应一个容器:

  • input_frames.tar(约 11 GB)、input_masks.tar(约 0.14 GB)
  • 9 个修复方法归档,每个约 5.4–11.0 GB

提取后的目录布局:

DATASET_AInpaint/ ├── input_frames/ 432x240/<video_id>/0000.png ... ├── input_masks/ resized_432x240/<video_id>/0000.png └── <TECHNIQUE>/ 432x240/<video_id>/0000.png ... 432x240_recompressed_h264/<video_id>.mp4 ...

该布局与官方代码库(AINPAINT-CVIU26)的训练和评估代码兼容,可通过 --dataset_root 参数指定数据集根目录。论文的数据划分(train/val/test)在代码库的 splits/ 中提供。

完整性说明

每个(容器 × 变体)单元均包含完整的 312 个视频。仅 5 个视频片段少于 30 帧,均为源数据固有情况或 DVP 处理导致的确定性帧丢失,而非处理缺陷。

相关资源

  • 论文:https://www.sciencedirect.com/science/article/pii/S107731422600233X
  • 代码:https://github.com/MMLab-unitn/AINPAINT-CVIU26
  • 数据集:https://huggingface.co/datasets/Truebees/AINPAINT
  • 维护方:Truebees(https://www.truebees.eu/)
搜集汇总
数据集介绍
AINPAINT 数据集图片
构建方式
AINPAINT数据集专为像素级视频修复定位任务而构建,其核心设计理念在于模拟真实世界中视频修复操作可能遭遇的各类后处理与压缩退化。该数据集基于312个原始视频片段,通过九种先进的生成式修复技术(包括OPN、STTN、FGVC、DSTT、CoCoCo、LDVI、FuseFormer、GMCNN与DiffuEraser)生成对应的修复视频,并配以精确的像素级掩码作为定位真值。为贴近实际应用场景,每个修复视频进一步衍生出九个变体版本,涵盖了原始输出、经时间平滑后处理(TCN)、结合深度视频先验(DVP)扰动,以及施加H.264与HEVC重压缩后的多种组合,最终形成了超过28,000个视频实例的庞大规模。
使用方法
AINPAINT以11个独立的tar存档文件形式发布,分别对应于原始帧、掩码及每种修复技术,用户可根据需求仅下载特定方法的数据。使用Hugging Face的`hf download`或`huggingface_hub`库即可快速获取,并通过简单的`tar -xf`命令完成解压。解压后的目录结构遵循固定的层级约定,与配套的代码仓库(AINPAINT-CVIU26)无缝衔接,代码中的训练与评估脚本通过指定`--dataset_root`参数即可加载数据。该代码仓库还提供了论文章节中使用的精确数据集划分文件(train/val/test),确保实验结果的可复现性。
背景与挑战
背景概述
随着生成式人工智能技术的迅猛发展,视频修复与目标移除技术已臻至高度逼真的境地,对多媒体内容的真实性与完整性构成了严峻威胁。为应对这一挑战,Andrea Montibeller、Giulia Boato与Luisa Verdoliva等于2026年在《Computer Vision and Image Understanding》期刊上提出了AINPAINT数据集,该数据集由意大利特伦托大学多媒体实验室与Truebees公司联合创建。其核心研究问题在于实现像素级别的视频修复定位,即精准识别视频中经过修复操作的区域。AINPAINT数据集包含超过25,000个视频序列,涵盖了九种不同的生成式修复技术,并明确引入了时间平滑与重度压缩等现实世界退化因素的变体,为视频取证领域提供了大规模、多样化的基准资源,对推动媒体真实性验证与深度伪造检测技术的发展具有重要影响力。
当前挑战
AINPAINT数据集所解决的领域核心挑战在于,现有视频取证方法过度依赖高频噪声或特定伪影特征,这些特征在面对H.264/HEVC压缩及AI后处理等现实退化时极易失效。数据集构建过程中面临的挑战包括:1) 如何系统性地模拟真实世界中的视频加工场景,涵盖九种生成式修复技术及其与多种压缩和时序平滑处理的多重组合;2) 确保数据规模与多样性,通过生成超28,000个视频实例以覆盖广泛的操作变体,同时维护超过70万帧的像素级标注数据;3) 解决因修复方法或后处理导致的帧数不一致问题,如少数片段因时序网络确定性丢弃帧而出现长度缩短,需在标注与评估中保持严谨的完整性控制。
常用场景
经典使用场景
在视频取证与多媒体完整性验证领域,AINPAINT数据集被广泛用于像素级视频修复定位任务。该数据集包含了超过25,000个经由九种不同生成式修复算法处理的视频序列,涵盖OPN、STTN、FGVC、DSTT等主流方法,并特别引入了时间平滑与H.264/HEVC重压缩等真实世界退化变体。研究者可基于该数据集训练和评估模型,以精准识别视频中哪些区域被修复或物体被移除,从而为数字内容真实性分析提供关键基准。
解决学术问题
该数据集解决了现有视频修复检测方法对真实世界退化(如压缩、后处理)鲁棒性不足的学术难题。此前,多数取证检测器依赖高频噪声或特定伪影特征,极易被H.264、HEVC压缩及AI后处理所破坏。AINPAINT通过系统性地引入九种退化变体,使得研究者能够探究在复杂退化条件下如何有效区分语义空间特征与运动时序异常,从而为视频取证领域提供了更为可靠和泛化的解决方案。
实际应用
在实际应用中,AINPAINT数据集可服务于社交媒体平台、新闻机构及法律取证部门,用于自动验证视频内容的原始性和完整性。例如,当一段视频在网络传播中经历了多次压缩或编辑后,基于该数据集训练的模型仍能有效定位并标记被修复区域,防止虚假信息或深度伪造内容误导公众。此外,该数据集还可用于开发视频编辑软件的审核工具,辅助内容创作者确保其作品未被篡改。
数据集最近研究
最新研究方向
在深度伪造检测与视频取证领域,AINPAINT数据集的出现恰逢生成式人工智能技术迅猛发展、视频修复与物体移除效果日益逼真之际。该数据集聚焦于一个极具挑战性的前沿方向——在H.264、HEVC等现实视频压缩以及AI时域平滑后处理等退化条件下,实现像素级视频修复定位。其创新性地构建了包含超过25,000个视频序列、涵盖九种主流生成技术及多种后处理变种的大规模基准,并基于LoRA适配的DINOv2骨干网络提出双分支架构,分别探索空间语义特征与光流时域异常在定位任务中的互补效用。这一工作不仅系统评估了现实降解对现有检测器的破坏性影响,更为多媒体取证领域提供了在复杂操作环境下如何权衡空间与运动线索的决策指南,推动了视频篡改检测向真实世界应用场景迈出关键一步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务