Multi-dSprites, Objects Room, CLEVR (with masks), Tetrominoes, CATER (with masks)
收藏资源简介:
这是一个基于dSprites的数据集,每个图像包含多个椭圆、心形或方形精灵(有些遮挡),背景为均匀颜色。我们发布了三个版本,每个版本包含1M数据点:1.1二值化:每个图像有2-3个白色精灵在黑色背景上。1.2彩色精灵在灰度上:每个场景有2-5个随机彩色HSV精灵在随机采样的灰度背景上。1.3彩色精灵和背景:每个场景有1-4个精灵。所有颜色都是随机采样的RGB值。每个数据点包含一个图像,多个背景和对象掩码,以及每个对象的以下地面真实特征:x和y位置,形状,颜色(rgb值),方向和比例。最后,可见性是一个二进制特征,指示哪些对象不为空。
This dataset is based on dSprites, where each image contains multiple sprites of ellipses, hearts, or squares (some occluded) against a uniform color background. We have released three versions, each containing 1M data points: 1.1 Binarized: Each image features 2-3 white sprites on a black background. 1.2 Colored sprites on grayscale: Each scene includes 2-5 randomly colored HSV sprites on a randomly sampled grayscale background. 1.3 Colored sprites and background: Each scene contains 1-4 sprites. All colors are randomly sampled RGB values. Each data point comprises an image, multiple background and object masks, and the following ground truth features for each object: x and y positions, shape, color (RGB values), orientation, and scale. Finally, visibility is a binary feature indicating which objects are not empty.
数据集概述
本数据集集合包含用于多对象表示学习的多个数据集,主要用于开发场景分解方法,如MONet、IODINE和SIMONe等。以下是具体的数据集列表及其特点:
-
Multi-dSprites
- 基于dSprites数据集,包含多个椭圆、心形或方形形状的精灵,背景为均匀颜色。
- 提供三种版本:二值化、彩色精灵在灰度背景上、彩色精灵和背景。
- 每个数据点包含图像、背景和对象掩码,以及每个对象的
x和y位置、形状、颜色、方向和比例等特征。
-
Objects Room
- 基于MuJoCo环境和3d-shapes数据集,训练集包含1M场景,最多三个对象。
- 提供三种测试变体:空房间、六个对象、颜色相同。
- 数据点包含图像和固定数量的掩码,前四个掩码对应天空、地板和墙壁,其余对应前景对象。
-
CLEVR (with masks)
- 通过改编Johnson等人的开源脚本生成,提供场景的地面真值分割掩码。
- 图像和掩码大小为320x240,提供所有原始数据集中的地面真值因子,包括
x、y、z位置、像素坐标、旋转、大小、材料、形状和颜色等。
-
Tetrominoes
- 包含类似俄罗斯方块的形状(即tetrominoes),每个35x35图像包含三个tetrominoes。
- 提供每个tetromino的
x和y位置、形状和颜色等特征。
-
CATER (with masks)
- 通过改编Girdhar等人的开源脚本生成,提供视频的地面真值分割掩码。
- 视频和掩码大小为64x64,包含33帧,提供
camera_matrix和object_positions等特征。
数据集特征
- 所有数据集包含多对象场景,每个图像或视频都伴随有场景中所有对象的地面真值分割掩码。
- 部分数据集(除Objects Room和CATER外)还提供每个对象的生成因子,包括描述和渲染对象所需的所有必要和充分特征。
数据集使用
- 数据集可通过Google Cloud Storage下载,每个数据集为一个TFRecords文件。
- 下载后,可通过提供的读取器作为
tf.data.Dataset实例读取。 - 提供了一个TensorFlow实现的调整兰德指数(adjusted Rand index),用于比较推断的对象分割与地面真值分割掩码。
引用信息
若在工作中使用这些数据集,请按以下方式引用:
bibtex @misc{multiobjectdatasets19, title={Multi-Object Datasets}, author={Kabra, Rishabh and Burgess, Chris and Matthey, Loic and Kaufman, Raphael Lopez and Greff, Klaus and Reynolds, Malcolm and Lerchner, Alexander}, howpublished={https://github.com/deepmind/multi-object-datasets/}, year={2019} }




