RGB-D Object Dataset
收藏资源简介:
RGB-D对象数据集是一个包含300个常见家用对象的大型数据集。这些对象被组织成51个类别,使用WordNet超类-子类关系排列(类似于ImageNet)。该数据集使用Kinect风格的3D相机记录,同步并校准640x480 RGB和深度图像,帧率为30 Hz。每个对象放置在转盘上,捕获一个完整旋转的视频序列。对于每个对象,有3个视频序列,每个序列在不同的高度记录,以便从不同的角度观察对象。
The RGB-D Object Dataset is a comprehensive collection comprising 300 common household items, meticulously organized into 51 categories based on WordNet hypernym-hyponym relationships, akin to the structure of ImageNet. This dataset was captured using a Kinect-style 3D camera, which synchronizes and calibrates 640x480 RGB and depth images at a frame rate of 30 Hz. Each object was placed on a turntable to capture a full rotation video sequence. For every object, there are three video sequences, each recorded at different heights to provide varied perspectives of the object.
数据集概述
数据集名称
RGB-D Object Dataset
数据集来源
http://rgbd-dataset.cs.washington.edu/index.html
数据集描述
RGB-D Object Dataset包含300个常见家用物品,分为51个类别,使用WordNet超类-子类关系组织。数据集通过Kinect风格的3D相机记录,同步并校准640x480 RGB和深度图像,频率为30 Hz。每个物品放置在转盘上,捕获完整旋转的视频序列。每个物品有3个视频序列,相机在不同高度记录,以从不同角度观察物品。
数据集用途
- 改善现实生活中的拥挤图像表示,如人群控制和交通管理。
- 利用深度信息在噪声图像中同时进行图像检测。
- 提高侧面视图预测概率。
- 最终用于创建先进的3D真实世界物体检测,提供更快和更精确的准确性。
技术挑战
- YOLO无法从深度图像中提取相关信息,需转换为HHA图像格式。
- 难以将RGB和深度图像结合在单一神经网络中训练,需训练两个不同的神经网络并结合结果以提高准确性。
使用技术
- python
- TensorFlow
- keras
- numpy
- Pandas
- YOLO
- darkflow
- Fast CNN
- Google Colab




