CopyMark
收藏资源简介:
CopyMark是由南加州大学和伊利诺伊大学厄巴纳-香槟分校的研究团队创建的一个用于评估扩散模型成员推断攻击(MIA)的现实世界基准数据集。该数据集包含了多个预训练的扩散模型及其对应的未偏移的非成员数据集,旨在提供一个公平和真实的评估环境。通过引入额外的测试数据集,CopyMark能够进行盲测试,从而更准确地评估MIA方法在实际应用中的表现。该数据集主要应用于检测预训练扩散模型中的未授权数据使用问题,帮助在AI版权诉讼中提供证据。
CopyMark is a real-world benchmark dataset developed by research teams from the University of Southern California and the University of Illinois Urbana-Champaign for evaluating membership inference attacks (MIA) against diffusion models. This dataset contains multiple pre-trained diffusion models and their corresponding unbiased non-member datasets, aiming to provide a fair and realistic evaluation environment. By incorporating additional test datasets, CopyMark supports blind testing, enabling more accurate assessment of the performance of MIA methods in real-world applications. This dataset is primarily used to detect unauthorized data utilization in pre-trained diffusion models, assisting in providing evidence for AI copyright litigation.
CopyMark 数据集概述
数据集内容
CopyMark 数据集包含以下内容:
-
diffusers 目录:
- assets:用于案例研究的数据,包括图像。
- datasets:存放数据集的目录。
- experiments:原始实验结果的记录数据。
- utils:用于准备数据集和生成元数据的脚本。
-
ui/custom_nodes/assets:用于版权检测推理的元数据。
数据集用途
CopyMark 数据集用于版权检测,主要应用于以下场景:
- 在 Latent Diffusion Model、Stable Diffusion 和 SDXL 模型上进行版权检测的基准测试。
- 提供图形用户界面(GUI),用于检测扩散模型训练数据中的版权图像。
数据集结构
数据集的代码结构如下:
CopyMark
│ README.md
│ requirements.txt
│
└───diffusers # 基准测试
│ └───assets # 案例研究图像数据
│ └───copymark # 版权检测的 diffusers 管道代码
│ └───datasets # 数据集存放目录
│ └───experiments # 原始实验结果记录
│ └───scripts # 版权检测方法的脚本
│ └───utils # 数据集准备和元数据生成脚本
│
└───ui
│ └───custom_nodes
│ └───assets # 版权检测推理的元数据
│ └───diffusers_ui # 版权检测的 diffusers 管道代码
│ │ copymark.py # 版权检测功能代码
│ │ encode_diffusers.py # 图像和文本编码功能代码
│ │ load_diffusers.py # 模块加载功能代码
│ │ nodes_copymark.py # 版权检测的自定义节点代码
│ │ nodes_diffusers.py # 适配 diffusers 到 comfyui 的自定义节点代码




