遇见数据集

ffp

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

FoundationPose Paired Synthetic Renders数据集是一个用于3D视觉任务的合成渲染数据集,包含来自GSO(Google Scanned Objects)和Objaverse的配对视图。数据集分为四个配置:gso-scenes、gso-assets、objaverse-scenes和objaverse-assets,其中场景配置包含训练和验证分割,资产配置仅包含训练分割。每个场景行提供两个同步视图,并标注了每个对象的姿态、掩码ID、边界框、可见性和遮挡信息。数据以多种格式存储:深度数据为float32 NPY字节,RGB图像和uint32实例掩码为PNG字节。矩阵使用行主序扁平化数组表示,并采用规范的列向量名称(如camera_from_world和world_from_object),同时保留了原始源变换。资产表仅包含稳定的源标识符,渲染档案引用外部USD几何体,不包含可重用的网格资产。该数据集适用于对象姿态估计、场景理解和计算机视觉研究,支持基于合成渲染数据的模型训练和评估。

The FoundationPose Paired Synthetic Renders dataset is a synthetic rendering dataset for 3D vision tasks, containing paired views sourced from GSO (Google Scanned Objects) and Objaverse. The dataset is divided into four configurations: gso-scenes, gso-assets, objaverse-scenes, and objaverse-assets. Among these, the scene configurations include training and validation splits, while the asset configurations only contain training splits. Each scene entry provides two synchronized views, with annotations including pose, mask ID, bounding box, visibility, and occlusion information for each object. Data is stored in multiple formats: depth data is stored as float32 NPY binary files, while RGB images and uint32 instance masks are stored as PNG-encoded binary data. Matrices are represented as row-major flattened arrays, following standard column-vector naming conventions (e.g., camera_from_world and world_from_object), while retaining the original source transformations. The asset tables only contain stable source identifiers, and the render archives reference external USD geometry without including reusable mesh assets. This dataset is applicable to object pose estimation, scene understanding, and computer vision research, supporting model training and evaluation based on synthetic rendering data.

创建时间:
2026-06-22
搜集汇总
数据集介绍
ffp 数据集图片
构建方式
该数据集基于FoundationPose框架构建,通过合成渲染的方式生成配对数据。数据集的构建分为场景(scenes)和资产(assets)两类配置,分别源自GSO和Objaverse两大三维模型库。每个场景记录包含两个同步视角的渲染结果,并附有每个物体的姿态、掩码ID、边界框、可见性及遮挡注释。深度信息以原始float32格式的NPY字节存储,RGB图像与uint32实例掩码则编码为PNG字节。变换矩阵采用行主序扁平化数组,并遵循标准的柱向量命名约定(如camera_from_world和world_from_object),原始源变换也一并保留。资产表仅包含稳定的源标识符,渲染档案引用外部USD几何体,不包含可复用的网格资产。
使用方法
数据集通过Hugging Face Datasets库加载,支持按配置(config)和划分(split)灵活访问。用户可指定如'gso-scenes'或'objaverse-scenes'等配置,并选择'train'或'validation'划分。每个场景样本包含两个同步渲染视图的RGB图像与深度数据、物体姿态矩阵、实例掩码及相关元数据。使用时需解压PNG字节为图像数组,并将NPY深度字节解码为浮点数组。变换矩阵需从扁平化数组重塑为4x4或3x4矩阵格式。建议结合FoundationPose框架,利用同步双视图数据进行姿态初始化与优化,或将其与外部USD几何体关联以进行完整的场景重建与评估。
背景与挑战
背景概述
在计算机视觉领域,六自由度物体位姿估计是实现机器人自主操作、增强现实等应用的核心技术之一。近年来,基于学习的方法在该任务上取得了显著进展,但训练数据的匮乏与真实场景标注的高昂成本成为制约其发展的关键瓶颈。为此,FoundationPose研究团队于2024年前后推出了名为ffp(FoundationPose Paired Synthetic Renders)的数据集,旨在为位姿估计提供大规模、高质量的合成训练数据。该数据集由学术界与工业界联合构建,核心研究问题在于如何通过合成渲染生成与真实场景高度一致的配对图像与姿态标注,从而支撑通用位姿估计模型的训练。ffp数据集的出现有效缓解了真实数据获取困难的问题,推动了位姿估计从特定物体向开放世界泛化的进程,对机器人抓取、混合现实等应用领域产生了深远影响。
当前挑战
ffp数据集面临的核心挑战首先来自于领域问题本身:物体位姿估计需要在复杂光照、遮挡、纹理缺失等条件下精准推断物体在三维空间中的旋转与平移参数,这对数据多样性及标注精度提出了极高要求。在数据集构建过程中,挑战同样严峻:如何从GSO与Objaverse等大规模物体库中合成场景时,需确保多视图几何一致性、遮挡关系的物理合理性以及标注信息的完整性;同时,RGB与深度图像的真实感渲染、instance mask的精确生成,以及相机与物体坐标系变换矩阵的标准化存储,均对渲染管线与数据格式设计设置了严苛的技术门槛。此外,由于数据集中包含外部USD几何引用而非嵌入完整网格资产,如何在保持数据轻量化的同时确保用户可复现渲染结果,也构成了实际使用中的一项关键挑战。
常用场景
经典使用场景
在计算机视觉与机器人感知领域,精确的物体位姿估计是实现智能交互与自主操作的核心瓶颈之一。ffp数据集作为FoundationPose框架的配套合成渲染数据集,其经典使用场景在于为基于深度学习的六自由度物体位姿估计方法提供大规模、高质量且带有同步双目视图的训练与验证样本。研究者可借助该数据集中每帧场景所包含的双视角图像、逐物体位姿标注、实例掩码、边界框、可见性与遮挡信息,训练端到端的姿态回归网络或基于渲染比对的位姿优化模型,从而在无真实标注的现实环境中实现鲁棒的物体跟踪与定位。
解决学术问题
长期以来,学界面临的一个关键难题在于缺乏兼具规模与标注精度的物体位姿数据集,尤其是针对遮挡严重、光照变化剧烈或纹理稀疏场景,现有数据往往难以支撑模型泛化至复杂真实环境。ffp数据集通过合成渲染手段生成了海量带有精确位姿及语义遮罩的场景数据,有效弥补了真实数据采集成本高昂与标注噪声严重的缺陷。其系统性提供的双目一致性约束与瞬时遮挡关系,为深入研究跨视角位姿协同预测、遮挡推理以及基于几何先验的位姿精细化算法奠定了可靠的数据基础,推动了领域内从受控实验向开放世界迁移的范式演进。
实际应用
在工业自动化、增强现实与自主导航等实际应用中,可靠的目标位姿解算是实现机器人精准抓取、虚拟物体叠加显示以及无人机绕障飞行等功能的前提。ffp数据集所生成的合成渲染场景可直接用于训练部署在真实设备上的位姿估计模型,例如面向仓储物流的分拣机器人通过预训练模型迅速适应新工件,或在移动端AR应用中实现稳定的虚拟对象锚定。此外,数据集内含的标准相机坐标系与物体坐标系变换矩阵,便于工程人员直接集成至现有的视觉管道中,加速从仿真验证到真机部署的迭代周期。
数据集最近研究
最新研究方向
在6D姿态估计与机器人操纵领域,ffp数据集凭借其合成渲染与真实场景对齐的特性,正推动着基础模型FoundationPose的跨域泛化研究。该数据集提供双视角同步观测、每目标姿态掩码以及遮挡与可见性标注,为研究者探索从虚拟到现实的零样本迁移提供了关键基准。结合大规模GSO与Objaverse资产,ffp催生了若干前沿工作,如利用生成式渲染增强位姿先验、结合扩散模型的鲁棒定位,以及与NeRF融合的动态场景重建。其深远意义在于,它弥补了合成数据与物理世界间的语义鸿沟,加速了通用机器人抓取与操作系统的实用化落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务