FudanCVL/SA-Z
收藏资源简介:
SA-Z数据集是一个用于文本到图像生成任务的数据集,特别关注遮挡(occlusion)和布局到图像(layout-to-image)的生成。它包含图像、全局提示(描述整个场景的文本)、实例级几何(如边界框和分割掩码)和文本注释(描述单个物体的文本),以及成对遮挡顺序信息(指示物体之间的遮挡关系)。该数据集适用于训练和评估需要处理复杂场景布局和物体遮挡关系的生成模型,例如在图像生成中考虑物体层次结构或注意力控制。
The SA-Z dataset is a dataset for text-to-image generation tasks, with a particular focus on occlusion and layout-to-image generation. It contains images, global prompts (text describing the entire scene), instance-level geometry (such as bounding boxes and segmentation masks), text annotations (text describing individual objects), and paired occlusion order information that indicates the occlusion relationships between objects. This dataset is suitable for training and evaluating generative models that need to handle complex scene layouts and object occlusion relationships, such as models that consider object hierarchies or utilize attention control during image generation.



