SynCD
收藏资源简介:
该数据集是针对可变形类别和刚性对象类别生成的多图像合成数据,使用描述性提示和遮罩共享注意力(MSA)在图像的前景对象区域之间促进视觉一致性。对于刚性对象类别,还额外使用深度和跨视图扭曲以及现有的Objaverse资产来确保三维多视角一致性。使用DINOv2和美学分数过滤出低质量图像,以创建最终的训练数据集。
This dataset is multi-image synthetic data generated for deformable and rigid object categories. Descriptive prompts and Masked Shared Attention (MSA) are utilized to foster visual consistency across foreground object regions within images. For rigid object categories, depth information, cross-view warping and existing Objaverse assets are additionally adopted to guarantee 3D multi-view consistency. Low-quality images are filtered out using DINOv2 and aesthetic scores to construct the final training dataset.
数据集概述:Synthetic Customization Data (SynCD)
数据集简介
SynCD 是一个合成数据集,用于生成具有不同光照、姿态和背景的同一物体的多张图像。该数据集可以基于显式的 3D 物体资产或通过不同视图之间的遮罩共享注意力(MSA)更隐式地使用。数据集用于训练一个新的基于编码器的模型,用于定制化/个性化。
数据集组成
- 数据集包含多个图像,这些图像是同一物体在不同条件下的合成。
- 数据集生成流程针对可变形类别使用描述性提示和 MSA,对于刚性物体类别,则额外使用深度和跨视图扭曲。
数据集用途
- 用于训练一个预训练的 IP-Adapter 基模型,并进行微调以注入全局特征。
- 在训练过程中,使用 MSA 在图像的目标和参考特征之间进行细粒度特征注入。
数据集获取
- 数据集将通过 GitHub 释放,具体时间预计在 2 月 10 日前。
- 用户可以通过 Git 克隆和一系列环境配置步骤来获取和准备数据集。
数据集引用
@article{kumari2025syncd, title={Generating Multi-Image Synthetic Data for Text-to-Image Customization}, author={Kumari, Nupur and Yin, Xi and Zhu, Jun-Yan and Misra, Ishan and Azadi, Samaneh}, journal={ArXiv}, year={2025} }




