SLIM Dataset
收藏资源简介:
该数据集包含在MuJoCo中渲染的虚拟场景,每个场景有多个视角,每个视角呈现多种模态:图像和合成或自然语言描述。每个场景包含两到三个物体放置在一个方形围墙房间内,每个摄像机视角渲染一个3D视图以及一个合成生成的场景描述。此外,还包括通过Amazon Mechanical Turk收集的人工标注的自然语言描述,描述对象的形状、颜色、相对位置和大小。
This dataset comprises virtual scenes rendered in MuJoCo, each scene featuring multiple viewpoints, with each viewpoint presenting various modalities: images and synthetic or natural language descriptions. Each scene contains two to three objects placed within a square-walled room, with each camera viewpoint rendering a 3D view along with a synthetically generated scene description. Additionally, it includes natural language descriptions manually annotated through Amazon Mechanical Turk, detailing the shape, color, relative position, and size of the objects.
数据集概述
数据集组成
- 虚拟场景:数据集包含在MuJoCo中渲染的虚拟场景,每个场景有多个视图。
- 多模态呈现:每个视图以图像和合成或自然语言描述的形式呈现。
- 场景元素:场景中包含两到三个物体,放置在一个有围墙的方形房间内。
- 视图数量:每个场景从10个不同的摄像机视点渲染3D视图和合成描述。
数据类型
- 合成数据:
- 包含两到三个彩色的3D物体以及浅灰色的墙壁和地板。
- 语言描述通过程序生成,考虑场景图和摄像机坐标来描述物体从每个视点的空间排列。
- 人工标注数据:
- 通过Amazon Mechanical Turk收集自然语言描述。
- 要求标注者描述图像中的房间,如同向未见图像的朋友描述以便其绘制。
- 描述需包括物体形状、颜色、相对位置和相对大小。
- 共标注了6,604个场景,每个场景有10个描述,对应每个视点。
数据集用途
- 用于训练Spatial Language Integrating Model (SLIM),特别是在“Encoding Spatial Relations from Natural Language”论文中。
数据集访问
- 原始数据文件可从此处下载。
引用信息
@article{ramalho2018, author = {Tiago Ramalho and Tomav{s} Kov{cisky and Frederic Besse and S. M. Ali Eslami and Gabor Melis and Fabio Viola and Phil Blunsom and Karl Moritz Hermann}, title = {Encoding Spatial Relations from Natural Language}, journal={arXiv preprint}, year = {2018}, }




