遇见数据集

scannetv2

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

ScanNet是一个3D场景数据集,用户需通过ScanNet项目页面申请访问权限。数据集包含点云文件(_vh_clean_2.ply)、聚合标注文件(.aggregation.json)、分割文件(_vh_clean_2.0.010000.segs.json)和文本文件(.txt)。本数据集是ScanNet的一个子集,以支持ScanRefer任务(可能涉及3D场景中的对象引用或理解)。

ScanNet is a 3D scene dataset. Users need to apply for access through the ScanNet project page. The dataset includes point cloud files (_vh_clean_2.ply), aggregation annotation files (.aggregation.json), segmentation files (_vh_clean_2.0.010000.segs.json), and text files (.txt). This dataset is a subset of ScanNet to support the ScanRefer task (which may involve object reference or understanding in 3D scenes).

创建时间:
2026-07-27
原始信息汇总

数据集概述:ScanNet v2

  • 数据集用途:用于3D场景理解与视觉定位任务(如ScanRefer),提供室内场景的点云、语义分割及实例分割标注数据。

  • 访问方式

    • 需通过ScanNet项目页面申请访问权限。
    • 申请获批后将获得下载脚本download-scannet.py,通过该脚本下载所需子集。
  • 下载内容

    • 点云文件:_vh_clean_2.ply(类型标识:--type _vh_clean_2.ply
    • 聚合标注:.aggregation.json(类型标识:--type .aggregation.json
    • 分割标注:_vh_clean_2.0.010000.segs.json(类型标识:--type _vh_clean_2.0.010000.segs.json
    • 文本文件:.txt(类型标识:--type .txt
  • 下载命令示例: shell python2 download-scannet.py -o data/scannet --type _vh_clean_2.ply python2 download-scannet.py -o data/scannet --type .aggregation.json python2 download-scannet.py -o data/scannet --type _vh_clean_2.0.010000.segs.json python2 download-scannet.py -o data/scannet --type .txt

  • 注意事项

    • 仅需下载ScanNet数据集中的特定子集,而非完整数据集。
    • 下载脚本运行环境为Python 2。
搜集汇总
数据集介绍
scannetv2 数据集图片
构建方式
ScanNet v2数据集由斯坦福大学等机构通过RGB-D相机采集真实室内场景构建。数据采集过程涉及超过700个室内场景,涵盖办公室、客厅、厨房等多种空间类型。研究者使用RGB-D传感器记录场景的几何结构与视觉信息,并借助半自动流程进行三维重建,生成带标签的网格模型。每个场景均包含语义标注、实例分割标签以及相机位姿信息,为三维视觉任务提供了丰富的基准数据。
特点
该数据集的核心特点在于其大规模、多模态与高标注质量。凭借超过2.5亿个三维点与1500个语义类别实例,ScanNet v2成为室内场景理解领域的标杆性资源。其标注体系不仅包含逐点的语义标签,还提供了场景级别的场景图与物体间关系信息。此外,数据集的实时相机轨迹与RGB-D帧序列使其同时支持三维重建、语义分割、实例分割与视觉定位等任务,展现出极强的通用性。
使用方法
使用ScanNet v2数据集需先通过官方项目页面申请访问权限,获批后将获得专用的下载脚本。针对ScanRefer等下游任务,用户需使用Python 2运行脚本,选择性下载四类核心文件:_vh_clean_2.ply格式的三维网格、.aggregation.json存储的实例聚合标注、_vh_clean_2.0.010000.segs.json超体素分割信息以及.txt文本记录标注映射关系。这些文件组合起来能够支撑三维视觉语言导航与跨模态场景理解的研究。
背景与挑战
背景概述
ScanNetv2数据集由斯坦福大学等研究机构于2017年提出,旨在解决三维场景理解中的核心问题,即如何从RGB-D视频流中高效地进行语义分割、实例分割及三维重建。该数据集包含1513个室内场景的扫描数据,涵盖超过250万帧的RGB-D图像及其对应的三维标注,为三维视觉领域提供了大规模、高质量的训练基准。ScanNetv2的发布极大地推动了诸如场景解析、导航及增强现实等前沿技术的发展,成为该领域内最具影响力的基准数据集之一。
当前挑战
ScanNetv2所面临的挑战包括多维度问题:首先,该数据集解决了三维场景理解中从二维图像到三维空间映射的复杂性问题,当前研究难点在于如何提升模型对非结构化室内环境的泛化能力及细粒度语义分割精度。其次,构建过程中遭遇的挑战涉及大规模数据采集的标注成本高昂,需要开发高效标注工具以降低人工干预;同时,确保扫描数据中深度信息的准确性与一致性也是一个技术难题,此外还需处理大面积场景中遮挡、光照变化及动态物体带来的数据噪声问题。
常用场景
经典使用场景
ScanNet v2 作为大规模室内三维场景理解领域的基石数据集,其最经典的使用场景在于为三维语义分割、实例分割和三维目标检测等任务提供丰富的标注数据。研究者通常利用该数据集中的点云、RGB-D图像及语义标签,训练深度学习模型以实现对复杂室内环境的精准感知。通过其涵盖的700余个室内场景,该数据集成为评估和比较不同三维理解算法性能的权威基准。
实际应用
在实际应用中,ScanNet v2的训练成果广泛应用于增强现实、机器人导航和智能家居系统。基于该数据集训练的模型能够帮助机器人在未知室内环境中实现精准的物体定位与场景解析,例如让扫地机器人有效识别并避开家具,或让AR眼镜实时解析周围物体并叠加虚拟信息。这些技术正在逐步提升人机交互的智能化水平,推动三维视觉技术在消费电子和工业自动化领域的落地。
衍生相关工作
ScanNet v2 衍生了一系列具有深远影响力的经典研究工作,如ScanRefer和ReferIt3D等语言引导的3D视觉定位任务,这些工作利用ScanNet的场景数据和语义标签,构建了三维空间中的自然语言与视觉信息桥梁。此外,该数据集还催生了用于三维场景分割的MinkowskiNet和PointGroup等高效网络结构,这些模型在ScanNet基准上取得了突破性性能,并持续推动三维深度学习领域的技术迭代与创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务