NearID-Flux
收藏资源简介:
NearID-Flux 数据集是 NearID 项目的一部分,包含通过 FLUX.1 修复生成的近身份干扰物,分辨率为 512×512。该数据集旨在通过语义相似但不同的实例(放置在参考图像的完全相同背景上)来学习身份表示,从而消除上下文捷径并隔离身份作为唯一的判别信号。每个样本包含最多 3 个干扰图像(nimg1、nimg2、nimg3),这些图像是通过 FLUX.1 修复在相同背景下生成的。数据集结构包括样本 ID、对象类别、类别描述、干扰图像、生成提示和质量标签等字段。该数据集适用于图像特征提取和图像到图像任务,特别适用于身份嵌入和度量学习。数据集发布在 CC-BY-4.0 许可下,并需要引用 NearID 和 SynCD 相关论文。
NearID-Flux 数据集概述
数据集基本信息
- 数据集名称: NearID-Flux (Near-Identity Distractors)
- 托管地址: https://huggingface.co/datasets/Aleksandar/NearID-Flux
- 语言: 英语
- 许可证: CC-BY-4.0
- 数据规模: 10K < n < 100K
- 任务类别: 图像特征提取、图像到图像
- 标签: nearid, near-identity-distractors, identity-embedding, inpainting, synthetic, metric-learning
数据集描述
该数据集包含通过 FLUX.1 修复技术生成的 近身份干扰项,分辨率为 512×512,是 NearID 项目的一部分。NearID 引入了一个使用近身份干扰项进行身份表示学习的框架:这些干扰项是语义相似但不同的实例,被放置在与参考图像完全相同的背景上。这种方法消除了上下文捷径,并将身份隔离为唯一的判别信号。
每个样本包含最多 3 张干扰图像 (nimg1, nimg2, nimg3):这些是不同的、但视觉上相似的实例,被修复到与基础数据集 Aleksandar/NearID 中对应锚点图像 完全相同的背景/上下文 中。这些干扰项用于训练和评估能够区分真实身份与上下文捷径的身份嵌入模型。
数据集结构
| 列名 | 类型 | 描述 |
|---|---|---|
id |
int64 | 样本ID(与基础 NearID 数据集匹配) |
category |
string | 对象类别 (rigid) |
category_description |
string | 对象的自然语言描述 |
nimg1, nimg2, nimg3 |
image | 近身份干扰图像(每个样本最多3张) |
n_images |
int64 | 有效干扰图像的数量 |
objaverse_id |
string | 源 Objaverse 对象标识符 |
prompts1, prompts2, prompts3 |
string | 每个干扰项的生成提示词 |
quality |
string | 质量标签 |
数据划分
- train: 训练集
干扰项生成方法
- 为基础 NearID 数据集中的每个锚点身份,检索一个语义相似但 不同 的对象实例。
- 使用 FLUX.1 修复技术 将干扰项实例修复到与锚点 相同的背景 中。
- 分辨率:512×512 像素。
所有 NearID 数据集系列
| 数据集 | 描述 | 分辨率 |
|---|---|---|
| Aleksandar/NearID | 多视角正样本(锚点 + 正样本视角) | 基础分辨率 |
| Aleksandar/NearID-Flux | 通过 FLUX.1 修复生成的近身份干扰项 | 512×512 |
| Aleksandar/NearID-Flux_1024 | 通过 FLUX.1 修复生成的近身份干扰项 | 1024×1024 |
| Aleksandar/NearID-FluxC | 通过 FLUX.1 Canny 引导修复生成的近身份干扰项 | 512×512 |
| Aleksandar/NearID-FluxC_1024 | 通过 FLUX.1 Canny 引导修复生成的近身份干扰项 | 1024×1024 |
| Aleksandar/NearID-PowerPaint | 通过 PowerPaint 修复生成的近身份干扰项 | 512×512 |
| Aleksandar/NearID-Qwen | 通过基于 Qwen 的修复生成的近身份干扰项 | 512×512 |
| Aleksandar/NearID-Qwen_1328 | 通过基于 Qwen 的修复生成的近身份干扰项 | 1328×1328 |
| Aleksandar/NearID-SDXL | 通过 Stable Diffusion XL 修复生成的近身份干扰项 | 512×512 |
| Aleksandar/NearID-SDXL_1024 | 通过 Stable Diffusion XL 修复生成的近身份干扰项 | 1024×1024 |
相关资源
- 模型: Aleksandar/nearid-siglip2 — NearID 身份嵌入模型
- 论文: NearID: Identity Representation Learning via Near-identity Distractors
- 代码: https://github.com/Gorluxor/NearID
- 项目主页: https://gorluxor.github.io/NearID/
许可证与归属
该数据集根据 CC-BY-4.0 许可证发布。它源自 SynCD 数据集(MIT 许可证,版权所有 2022 SynCD)。如果使用此数据集,请同时引用 NearID 和 SynCD。
引用
bibtex @article{cvejic2026nearid, title={NearID: Identity Representation Learning via Near-identity Distractors}, author={Cvejic, Aleksandar and Abdal, Rameen and Eldesokey, Abdelrahman and Ghanem, Bernard and Wonka, Peter} }




