遇见数据集

Puffin-16M

收藏
arXiv2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Puffin-16M是一个大规模多模态三维世界状态数据集,由南洋理工大学S-Lab等机构联合构建。该数据集包含1500万视觉-语言-相机三元组和100万条复杂运动轨迹,总计1600万样本,涵盖场景外观、几何深度、重力场等原生世界状态。数据通过采集真实场景并标注绝对相机参数、深度图及物理场创建,确保物理一致性与多样性。该数据集旨在支持统一多模态模型的三维世界感知、生成与重建任务,为空间智能与物理AI研究提供规模化训练基础。

Puffin-16M is a large-scale multimodal 3D world state dataset jointly constructed by S-Lab of Nanyang Technological University and other institutions. This dataset contains 15 million vision-language-camera triples and 1 million complex motion trajectories, totaling 16 million samples, covering native world states such as scene appearance, geometric depth, and gravitational field. It is created by collecting real scenes and annotating absolute camera parameters, depth maps and physical fields, ensuring physical consistency and diversity. This dataset aims to support 3D world perception, generation and reconstruction tasks of unified multimodal models, providing a large-scale training foundation for spatial intelligence and physical AI research.

创建时间:
2026-09-04
原始信息汇总

Puffin-16M 数据集详情总结

数据集概览

Puffin-16M 是一个面向空间多模态智能与物理 AI 的相机中心数据集,包含 1650 万个样本,提供精确的相机到世界的标注,支持空间智能和物理 AI 的研究与应用。数据集由两个互补的子集构成:大规模单视角相机监督数据与密集运动轨迹数据。

核心特性:

  • 16.5M 总样本数
  • 精确的相机参数(roll、pitch、FoV 等)
  • 多模态:视觉-语言-相机三元组
  • 统一的数据格式

子集构成

A / 单视角数据:Puffin-Cam-15M(15,338,221 样本)

从多样化的室内外全景图中渲染得到视觉-语言-相机三元组。

相机参数范围:

  • Roll(滚动角):-45° 至 +45°
  • Pitch(俯仰角):-45° 至 +45°
  • V.FOV(垂直视场角):20° 至 105°

B / 轨迹数据:Puffin-Traj-1M(1,136,696 样本)

包含连续帧序列,具备密集的逐帧内参、绝对与相对外参标注,每条轨迹均为 90 帧 × 1° 的相机运动序列。


相机高度分类法

数据集包含五种视角层级:

  1. 水下(Underwater)
  2. 低位置(Low-position)
  3. 视线高度(Eye-level)
  4. 高位置(High-position)
  5. 空中(Aerial)

数据画廊

Puffin-Cam-15M 图像-标题对

包含 36 个精选样本,覆盖 7 种画面宽高比(1:1、3:3、3:2、4:3、16:9、9:16 等),每个样本配有关联的描述文本与相机参数,例如 roll、pitch、FoV 和径向畸变值。

Puffin-Traj-1M 相机轨迹

包含 27 个序列,分布于三个运动轴(X 轴 Pitch、Y 轴 Yaw、Z 轴 Roll),每个轴的旋转过程均保持光心固定。相机的坐标定义为:X 向右、Y 向下、Z 向前。


模型能力:Puffin-World

基于 Puffin-16M 训练的 Puffin-World 模型,将统一的理解与生成能力整合到单一多模态框架中,并延伸至 3D 世界建模任务:

  1. 相机理解(Camera Understanding):从图像中估计 roll、pitch 和垂直视场角,将几何线索与摄影语言关联。
  2. 可控生成(Controllable Generation):通过显式相机控制进行图像生成。
  3. 世界探索(World Exploration):超越初始视角,探索更广阔的空间。

模型子版本:

  • Puffin-World-Base:综合能力
  • Puffin-World-Pro:强生成能力
  • Puffin-World-Caption:专家模型

基准评测表现

Puffin-World 在四个公开权威基准(Stanford2D3D、MegaDepth、TartanAir、LaMAR)上的表现优于以往方法,在所有中位误差指标和大部分 AUC 指标上均取得领先,获得物理感知 Top-1 排名(Roll、Pitch、FoV 估计)。


相机标注数据集扩展

使用 Puffin-World 为 28 个广泛使用的图像/视频数据集进行物理相机参数标注,累计产生:

类别 数量
相机标注样本总数 44.5M+
单图像相机标签 39.0M
绝对相机帧 5.47M
公开数据集版本 28 个

标注类型:

  • CAMERA(单图像数据集):每张独立图像标注可见相机状态(roll、pitch、FoV)。
  • ABSOLUTE-CAMERA(视频/多时间步数据集):每帧在共享世界坐标系中标注绝对相机参数。

部分代表性标注数据集:

  • SA-1B-Camera(897,572 张)
  • CC12M-Camera(10.97M 张)
  • Open-Images-Camera(8,338,780 张)
  • ImageNet-1K-Camera(1.33M 张)
  • ScanNet-Absolute-Camera(2.32M 帧)
  • DL3DV-Absolute-Camera(2.16M 帧)
  • 以及更多(共 28 个)——此列表将持续更新扩展。

获取与资源

  • 完整数据集大小:约 11.6 TB
  • 数据获取方式:通过 Hugging Face 下载(数据集地址:hf download KangLiao/Puffin-16M --repo-type dataset
  • 发布内容包含:分片压缩包、索引、标题文本和稠密相机标注
  • 配套资源:Hugging Face 数据集页面、GitHub 实现代码、arXiv 论文(Puffin-World, 2026)、Puffin-World 模型权重

许可协议:NTU S-Lab License 1.0,由新加坡南洋理工大学 S-Lab 开发。

搜集汇总
数据集介绍
Puffin-16M 数据集图片
构建方式
Puffin-16M数据集的构建源于对现有数据局限性的深刻洞察,旨在为多模态三维世界模型提供大规模、高精度的训练资源。其构建流程匠心独运,分为两大核心子集:Puffin-Cam-15M与Puffin-Traj-1M。Puffin-Cam-15M通过扩展全景图像源至90万张,并利用虚拟针孔相机模型,以多样化的内外参数(如滚转角、俯仰角与视场角均在宽阔范围内均匀采样)渲染出约1500万张不同分辨率与宽高比的透视图像。这些图像不仅具备精确的相机标注,还经由先进的多模态大语言模型(如Qwen3-VL系列)生成富含场景语义与空间推理的详细描述。Puffin-Traj-1M则专注于轨迹数据,通过引入偏航角参数,系统性地采样生成一百万条包含长程运动、极限旋转乃至360°全景探索的相机轨迹,每条轨迹中的帧间运动模式清晰且物理一致。整个数据集构建过程严谨,确保了视觉内容、语义描述与物理参数的精确对齐。
特点
Puffin-16M数据集以其非凡的规模与独特的属性在众多数据集中脱颖而出。其首要特点在于规模宏大,囊括了1500万组视觉-语言-相机三元组与100万条轨迹,为训练大规模统一多模态模型提供了坚实的基石。更具开创性的是,该数据集引入了统一的“全相机”(Omni-Camera)表征,将基于重力的绝对相机方位(如上向量、纬度角)与基于射线的相对几何信息(如射线原点与方向)融合为九通道的密集表征,实现了对相机物理状态的全方位刻画。此外,Puffin-16M覆盖了从室内到室外、从合成到真实、从静态场景到自动驾驶街景的多样环境,并支持多种宽高比,突破了传统数据集在旋转多样性上的限制,极大地丰富了相机运动的分布。这种对绝对物理锚点与复杂运动的强调,为解决现有三维数据集因旋转受限而导致的世界模型理解不足问题提供了关键资源。
使用方法
Puffin-16M数据集专为训练和评估统一多模态模型而设计,尤其适用于Puffin-World模型的逐步训练框架。在训练初期,研究人员可利用Puffin-Cam-15M子集进行单视图的视觉-语言-相机对齐与生成任务的微调;随后,在更高级的训练阶段,结合Puffin-Traj-1M及其他公开三维数据集(如ScanNet、DL3DV),模型得以学习跨视图的连续生成与重建能力。该数据集的使用方法高度灵活,既支持文本到图像的相机可控生成,也支持从参考视图进行的三维世界生成、高自由度动作条件下的图像到三维场景合成,以及伴随几何重建的联合生成任务。依托于统一的表示与标注,研究者亦能在此基础上开发诸如模仿或自校准世界探索等闭环应用,从而推动物理AI与空间智能领域的研究边界。
背景与挑战
背景概述
随着多模态大模型与空间智能的飞速发展,构建能够统一感知、生成与重建三维世界的模型已成为物理人工智能领域的核心目标。然而,现有模型往往将世界割裂为二维语义或仅关注外观层面,缺乏对物理法则、几何结构等多维状态的协同建模。为突破这一瓶颈,南洋理工大学、密歇根大学等多家机构的研究人员于2026年共同构建了Puffin-16M数据集,旨在为联合建模外观、几何与物理状态提供大规模、高精度的监督信号。该数据集包含1500万视觉-语言-相机三元组以及100万条具备多样挑战性运动的轨迹,不仅支撑了统一多模态模型Puffin-World的训练,还推动了相机物理理解、自由视角空间模拟等任务的发展,对空间智能与具身智能研究具有深远影响。
当前挑战
Puffin-16M的构建面临多重挑战。领域层面,现有三维数据集普遍受限于相机旋转多样性不足(如roll、pitch通常仅在±5°至±10°范围内),难以支撑模型在极端姿态、长轨迹等复杂运动下的鲁棒学习,且缺乏以物理世界为锚的绝对相机标注,导致模型难以建立稳定的重力参考系。构建层面,数据集需从不同来源的360°全景图中生成海量透视图,涉及几何校正、多分辨率处理、语义及链式推理标注等复杂流程,同时要确保相机参数精确且运动模式多样化。此外,为公共数据集补充物理与几何标注时,还需处理深度缺失、传感器噪声等问题,过程繁复且计算开销巨大。
常用场景
经典使用场景
Puffin-16M作为大规模统一多模态数据集,其经典使用场景聚焦于三维世界感知、生成与重建的一体化研究。凭借1500万视觉-语言-相机三元组与100万条多样化运动轨迹的丰富标注,该数据集为训练统一的生成式世界模型提供了坚实基础,使模型能够同时处理单视角与跨视角的相机控制、自由视点空间模拟以及跨帧的物理一致性与几何一致性生成,从而支撑从静态场景理解到动态世界探索的全链路任务。
衍生相关工作
Puffin-16M已经催生了一系列衍生性工作,涵盖物理感知、相机可控生成及三维世界建模等方向。基于该数据集训练的Puffin-World系列模型展示了跨任务协同的范式,后续可引申至自标定世界探索、模仿性轨迹生成以及多模态三维理解与重建的联合优化。此外,数据集对28个公共数据集的绝对相机注释,为大规模视觉语料库的物理属性标注树立了新基准,衍生了诸如跨数据集物理感知预训练、相机分布偏移分析以及鲁棒性评估等研究方向,进一步巩固了其在空间智能研究版图中的基石地位。
数据集最近研究
最新研究方向
Puffin-16M数据集的构建与发布,标志着三维世界建模领域迈入原生世界状态统一表征的新阶段。该数据集以1500万视觉-语言-相机三元组及100万条高难度运动轨迹为核心,突破传统数据集在旋转多样性、绝对相机位姿锚定及多分辨率适配上的局限,为物理感知驱动的通用多模态模型提供了规模化训练基石。其研究前沿聚焦于将重力场、几何深度与外观表征融为一体的三维原生状态建模,推动生成式世界模型从二维外观预测向具备物理一致性的空间智能演进。通过联合建模物理、几何与外观状态,该数据集赋能了从自由视点空间模拟到长程轨迹自校准探索的闭环应用,为具身智能、虚拟现实及物理AI开辟了数据驱动的新范式,在推动空间智能体与真实世界交互方面具有里程碑意义。
相关研究论文
  • 1
    Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States南洋理工大学·S-Lab; 密歇根大学; 北京交通大学; ACE机器人 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务