遇见数据集

Puffin-16M

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

Puffin-16M是一个大规模、以相机为中心的统一多模态数据集,旨在解决空间多模态智能领域中涵盖视觉、语言和相机模态的数据集与基准稀缺的问题。该数据集是Puffin-4M的显著扩展,共包含约1650万个样本,由两个互补部分构成:Puffin-Cam-15M包含15,338,221个单视图图像-标题-相机三元组,每个样本包括一张从全景图渲染的透视图像、结合场景描述和相机参数的标题,以及相机高度类别标签;Puffin-Traj-1M包含1,136,696个相机轨迹,每个轨迹是90帧序列,附带逐帧相机注释,如欧拉角度、内参矩阵和位姿矩阵,对应单轴相机运动。数据集支持多种模态转换任务,数据以分片压缩文件形式组织,总大小约11.6 TB,由南洋理工大学S-Lab团队开发,适用于相机中心的理解与生成任务研究。

Puffin-16M is a large-scale, camera-centric unified multimodal dataset designed to address the scarcity of datasets and benchmarks in spatial multimodal intelligence that encompass visual, language, and camera modalities. It is a significant extension of Puffin-4M, comprising approximately 16.5 million samples, and consists of two complementary parts: Puffin-Cam-15M includes 15,338,221 single-view image-caption-camera triples, each containing a perspective image rendered from panoramic scenes, a caption combining scene descriptions with precise camera parameters, and a camera height category label; Puffin-Traj-1M includes 1,136,696 camera trajectories, each being a continuous 90-frame sequence with dense per-frame camera annotations such as Euler angles, intrinsic matrices, and camera-to-world pose matrices, corresponding to single-axis camera motions. The dataset supports various modality conversion tasks, is organized in sharded compressed files, has a total size of about 11.6 TB, was developed by the S-Lab team at Nanyang Technological University, and is suitable for research and applications in camera-centric understanding and generation tasks.

创建时间:
2026-07-07
原始信息汇总

数据集概述

Puffin-16M 是一个大规模、以相机为中心的数据集,包含约 1650万 个样本,由两部分组成,旨在支持空间多模态智能领域的相机感知理解与生成任务。

  • 开发者: Kang Liao, Size Wu, Zhonghua Wu, Linyi Jin, Chao Wang, Yikai Wang, Fei Wang, Wei Li, Chen Change Loy
  • 所属机构: 新加坡南洋理工大学 S-Lab
  • 首次发布: arXiv 预印本,2025 年
  • 数据集类型: 以相机为中心的感知与生成
  • 模态: 图像 → 文本+相机参数;文本+相机参数 → 图像;图像+相机参数 → 图像;图像+相机参数 → 文本

数据集构成

1. Puffin-Cam-15M

  • 样本数量: 15,338,221 个单视图图像-描述-相机参数三元组。
  • 数据内容: 每张透视图像(从各种室内外场景的全景图中渲染而成)配有一段描述,包含场景描述、精确的相机参数(横滚角、俯仰角、视场角和径向畸变)及一个相机高度类别。
  • 图像格式: <hash>.jpg(10,000 张图像为一个压缩包分片,命名如 000000.zip)。
  • 描述文件格式: JSON 文件,命名与图像哈希对应(<hash>.json),包含 captioncamera_height 字段。

2. Puffin-Traj-1M

  • 样本数量: 1,136,696 条相机轨迹。
  • 数据内容: 每条轨迹为 90 帧的序列,包含每帧的密集相机注释(欧拉角、内参和相机姿态),支持相机控制的场景探索及轨迹感知的生成与理解。
  • 数据格式: 每个场景为一个文件夹(以随机哈希命名),内含 90 帧图像和 cameras.json 文件。

相机参数与范围

Puffin-Cam-15M(单视图)

参数 范围/分布 说明
横滚角 (Roll) [−45°, +45°] 均匀分布
俯仰角 (Pitch) [−45°, +45°] 均匀分布
垂直视场角 (Vertical FoV) [20°, 105°] 均匀分布
径向畸变 k₁ 0 针孔相机模型,无畸变
  • 描述中相机参数以弧度给出。
  • 相机高度分类: | camera_height | 视角描述 | |---|---| | Underwater shot | 水下(低于水面,如深海) | | Low-position shot | 低位(低处或海平面附近,仰视) | | Eye-level shot | 人眼水平(最常见) | | High-position shot | 高位(俯视) | | Aerial shot | 空中/鸟瞰/太空视角 |

Puffin-Traj-1M(轨迹)

参数 范围/选项 说明
运动类型 pitch / roll / yaw 每段轨迹仅单轴变化
子模式 mono_pos, mono_neg, bi_pos_neg, bi_neg_pos 单调(上/下,顺/逆时针)或双向
横滚角初始值 [−45°, +45°] 除非是运动轴,否则保持不变
俯仰角初始值 [−45°, +45°] 同上
偏航角初始值 [−180°, +180°] 作为运动轴时扫描该范围
垂直视场角 [60°, 100°] 每条轨迹内恒定,均匀分布
帧数/步长 90 帧,每帧 1° 每段覆盖约 90° 运动

目录结构

DATA_PATH/ ├─ Puffin-Cam-15M/ │ ├─ image_folder/ │ │ ├─ 000000.zip │ │ └─ ... │ ├─ cap_folder/ │ │ ├─ 000000.zip │ │ └─ ... │ ├─ summary.json ├─ Puffin-Traj-1M/ │ ├─ data/ │ │ ├─ 000000.zip │ │ └─ ... │ ├─ summary.json └─ README.md

数据集下载

  • 完整数据集下载命令: bash hf download KangLiao/Puffin-16M --repo-type dataset

  • 总大小: 约 11.6 TB(Puffin-Cam-15M 约 2.4 TB,Puffin-Traj-1M 约 9.2 TB)。

  • 按部分下载示例: bash hf download KangLiao/Puffin-16M --repo-type dataset --include "Puffin-Cam-15M/*"

  • 像素级相机地图: 由于总尺寸过大未包含,但可使用提供的相机参数和 GitHub 仓库 中的 scripts/camera/cam_dataset.py 生成。

许可

本项目采用 NTU S-Lab 许可证 1.0

搜集汇总
数据集介绍
Puffin-16M 数据集图片
构建方式
Puffin-16M是一个大规模以相机为中心的数据集,其构建源自对全景图像的多视角渲染与多模态标注的深度融合。子集Puffin-Cam-15M包含约1530万张单视图图像,每张图像通过从多样化的室内外全景场景中采样相机参数(滚转角、俯仰角、视场角和径向畸变)渲染而成,并辅以场景描述、精确相机参数及相机高度类别的文字标注。Puffin-Traj-1M则聚焦于相机轨迹,包含约110万条90帧序列,每条轨迹沿单一相机运动轴(俯仰、滚转或偏航)连续变化,并逐帧记录欧拉角、内参矩阵及相机位姿,从而构建了从静态视角到动态探索的完整数据生态。
特点
该数据集的核心特点在于其以相机参数为核心的多模态对齐与层次化标注体系。Puffin-Cam-15M首次将连续数值型相机参数(以弧度表示)与离散的相机高度类别(如低机位、平视、高空航拍等)相结合,实现了从物理空间到语义空间的桥梁。Puffin-Traj-1M则提供了时域上连续的运动轨迹,覆盖单轴单调与双向运动模式,为动态场景理解与生成提供了结构化训练数据。此外,数据集的规模达到约1650万样本,且采用分片压缩存储格式,确保了海量数据的高效管理与可扩展性,可支撑从文本引导的图像生成到相机感知的三维理解等多种任务。
使用方法
此数据集可通过Hugging Face Datasets库直接下载,命令为`hf download KangLiao/Puffin-16M --repo-type dataset`,用户亦可选择性下载特定子集。Puffin-Cam-15M的数据组织为成对的图像(JPEG格式)与JSON格式标注文件,两者通过随机哈希值关联,并附带索引文件`summary.json`便于快速定位。Puffin-Traj-1M中每个轨迹场景以文件夹存储,内含90帧图像及包含逐帧相机元信息的`cameras.json`文件。研究人员可将其用于多模态模型的训练与评估,例如图像到文本的相机参数预测、文本+相机参数驱动的图像生成,以及基于轨迹的连续视图合成。若需生成像素级的相机映射图,可利用官方GitHub仓库中的脚本根据提供的参数进行计算。
背景与挑战
背景概述
在空间多模态智能领域,融合视觉、语言与相机参数的数据集与研究基准长期匮乏,限制了模型对三维世界几何与语义的联合理解。为突破这一瓶颈,南洋理工大学S-Lab的Kang Liao等研究人员于2025年发布了Puffin-16M数据集。该数据集将前期Puffin-4M扩展至约1650万样本,涵盖单视图图像-描述-相机三元组及相机轨迹序列,旨在通过大规模相机中心化数据,推动模型在文本到图像、图像到三维及轨迹感知生成等任务中的统一表征能力。Puffin-16M的出现填补了现有数据集在精细化相机参数(如滚转、俯仰、视场角)与拍摄高度类别标注方面的空白,为空间智能研究提供了关键的标准化资源。
当前挑战
Puffin-16M旨在应对两大核心挑战。其一,领域问题挑战:传统模型难以将相机内参与姿态等几何信息融入视觉-语言学习,导致对空间关系、视角变化及三维结构的理解与生成能力薄弱,尤其在需要精确视角控制的场景(如自主导航、增强现实)中表现欠佳。其二,构建过程挑战:数据集规模庞大(约11.6TB),需从多样化室内外全景图中高效渲染透视图并精准标注相机参数,同时确保Puffin-Cam-15M中约1538万样本的轨迹与描述一致性;此外,相机参数采样范围(如滚转与俯仰±45°、视场角20°-105°)需兼顾覆盖度与物理合理性,且拍摄高度分类的连续性(从水下到高空)进一步增加了标注的复杂度与歧义性控制难度。
常用场景
经典使用场景
Puffin-16M作为大规模相机中心数据集,最典型的应用场景是基于相机参数的多模态理解与生成任务。该数据集包含约1650万样本,分为Puffin-Cam-15M(单视图图像-描述-相机三元组)和Puffin-Traj-1M(90帧相机轨迹序列)两部分,为统一多模态模型提供了丰富的相机视角信息。研究者可利用该数据集训练模型,使其能根据文本描述和相机参数(如翻滚角、俯仰角、视场角)生成符合特定拍摄视角的图像,或从图像中推断相机参数与场景描述,实现图像-文本-相机三模态间的灵活转换。这一场景尤其适用于需要精确控制相机位姿的视觉任务,如合成数据生成、视角感知的图像编辑等。
衍生相关工作
Puffin-16M的发布催生了多项创新研究工作。该数据集本身是Puffin-4M的规模扩展版本,其论文提出了统一多模态模型Puffin,实现了相机中心的理解与生成。在开源社区,研究者基于该数据集开发了相机参数预测、视角可控图像生成等下游模型;其轨迹部分为动态场景理解提供了基准,推动了多帧相机运动建模的研究。相关衍生工作还包括将相机先验融入扩散模型以提升生成图像的空间一致性,以及利用该数据集的相机高度标注改进场景几何推理。这些工作不仅验证了数据集的有效性,也展示了其在推动三维视觉、多模态学习等领域发展中的核心地位。
数据集最近研究
最新研究方向
Puffin-16M的出现标志着空间多模态智能领域迈入了一个以相机为中心的新纪元。该数据集通过提供超过1600万样本,涵盖单视图图像-文本-相机参数三元组和90帧连续相机轨迹,为统一多模态模型的相机理解与生成能力提供了空前规模的数据支撑。其前沿研究方向聚焦于如何利用精确的相机内外参(如欧拉角、视场角、径向畸变)和高度分类(如低角度、航拍等)实现从文本到图像、图像到三维以及轨迹感知的生成与推理,这一技术路线与当下空间智能、机器人感知和虚拟现实等热点事件紧密关联,有望破解现有模型在视角建模和三维空间理解上的瓶颈,推动具身智能和自主导航系统的实质性突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务