遇见数据集

COCO-Camera

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

COCO-Camera数据集是COCO数据集(detection-datasets/coco,包含训练集和验证集,约122K张图像,分布在42个分片中)的扩展,为每张图像提供了单目相机参数标注。这些参数由Puffin-World模型预测生成,旨在支持相机中心的理解与生成任务。数据集以.tar文件形式组织,每个分片对应一个.tar文件,内含以COCO 12位图像ID命名的.json文件。每个JSON文件包含五个字段:roll(相机横滚角,单位弧度)、pitch(相机俯仰角,单位弧度)、vfov(垂直视场角,单位弧度)、k1(径向畸变系数,无单位)和parse_ok(指示模型输出是否在有效范围内解析,布尔值)。整个数据集的相机参数分布统计显示:roll集中在0°(表明照片多为水平拍摄),pitch中位数约为-4°(表明COCO场景常向下拍摄物体或人物),垂直视场角中位数约为32°,主要集中在20-45°范围内并带有广角长尾分布。该数据集适用于文本到3D、图像到3D、图像文本到图像、任意到任意等多模态任务,可用于3D视觉、空间AI、物理AI、世界模型等领域的相机参数分析与生成研究。

The COCO-Camera dataset is an extension of the COCO dataset (detection-datasets/coco, which includes training and validation sets with approximately 122K images distributed across 42 chunks). It provides monocular camera parameter annotations for every image. These parameters are predicted and generated by the Puffin-World model, intended to support camera-centric understanding and generation tasks. The dataset is structured in .tar file format, where each chunk corresponds to a .tar file containing JSON files named using the 12-digit COCO image IDs. Each JSON file contains five fields: roll (camera roll angle, unit: radian), pitch (camera pitch angle, unit: radian), vfov (vertical field of view, unit: radian), k1 (radial distortion coefficient, unitless), and parse_ok (a boolean value indicating whether the model's output was parsed within valid ranges). Statistical analysis of the camera parameter distribution across the full dataset reveals that: roll is concentrated around 0°, indicating that most photos are captured horizontally; the median pitch is approximately -4°, meaning COCO scenes are often shot downward towards objects or human subjects; the median vertical field of view is roughly 32°, mainly falling within the 20-45° range with a long-tailed distribution towards wide-angle captures. This dataset is applicable to multimodal tasks including text-to-3D, image-to-3D, image-text-to-image, and arbitrary-to-arbitrary, and can be utilized for camera parameter analysis and generation research in fields such as 3D vision, spatial AI, physical AI, and world models.

创建时间:
2026-07-06
原始信息汇总

数据集名称

COCO-Camera

数据集任务类型

  • text-to-3d
  • image-to-3d
  • image-text-to-image
  • any-to-any

数据集标签

  • Camera
  • 3D Vision
  • Spatial AI
  • Physical AI
  • World Model
  • Camera Parameter
  • COCO
  • Generation

数据集描述

COCO-Camera 为 COCO 数据集(detection-datasets/coco,包含训练集和验证集,约 122K 张图像,分布在 42 个分片中)提供 每张图像的相机参数注释。这些注释由 Puffin-World 模型生成。更多带注释的数据集可访问 Puffin-16M 网站。

数据格式

  • 每个源分片对应一个 .tar 文件(例如 coco_train_00000.tarcoco_train_00039.tarcoco_val_00000.tarcoco_val_00001.tar)。
  • 每个 .tar 文件内包含按 COCO 12 位图像 ID 命名的 .json 文件(例如 000000000139.json)。
  • 每个 JSON 文件包含预测的单目相机参数:
字段 含义 单位
roll 相机翻滚角 弧度
pitch 相机俯仰角 弧度
vfov 垂直视场角 弧度
k1 径向畸变系数
parse_ok 模型输出是否在有效范围内解析成功 bool

示例 JSON: json {"roll": -0.0104, "pitch": 0.0268, "vfov": 0.9044, "k1": 0.0000, "parse_ok": true}

相机参数分布

  • 在全部数据(训练集+验证集,约 122K)上,统计了预测的翻滚角 / 俯仰角 / 垂直视场角的分布(仅包含 parse_ok=True 的样本,按每 10° 区间统计比例)。
数据划分 翻滚角 (roll) 均值 / 中位数 / 标准差 俯仰角 (pitch) 均值 / 中位数 / 标准差 视场角 (FoV) 均值 / 中位数 / 标准差
all (122K) 0.0° / 0.0° / 6.2° −7.3° / −4.0° / 15.0° 34.9° / 32.5° / 11.7°
  • 翻滚角 集中在 0°(照片拍摄水平)。
  • 俯仰角 明显为负(中位数约 −4°)—— COCO 场景通常以俯视角度拍摄物体/人物。
  • 视场角 集中在 20–45°(中位数约 32°),并具有长尾的广角部分。

下载方式

使用以下命令可下载整个数据集: bash hf download KangLiao/COCO-Camera --repo-type dataset

相关资源

  • 完整注释流水线:用于为任意数据集注释相机参数、分析分布并可视化相机地图,代码已开源在 GitHub 仓库
  • 其他相关数据集:如需参数分布更均匀多样的数据集,可参考 Puffin-4MPuffin-16M

引用信息

bibtex @article{liao2025puffin, title={Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation}, author={Liao, Kang and Wu, Size and Wu, Zhonghua and Jin, Linyi and Wang, Chao and Wang, Yikai and Wang, Fei and Li, Wei and Loy, Chen Change}, journal={arXiv preprint arXiv:2510.08673}, year={2025} }

搜集汇总
数据集介绍
COCO-Camera 数据集图片
构建方式
COCO-Camera数据集基于经典的COCO数据集(包含约12.2万张图像,横跨42个分片)构建而成,通过Puffin-World模型为每张图像预测并标注了单目相机参数。数据以.tar归档文件形式组织,每个源分片对应一个文件,内部包含以COCO图像12位ID命名的JSON文件,分别存储了翻滚角、俯仰角、垂直视场角及径向畸变系数等参数,并附有解析有效性的布尔标识。该流程不仅实现了参数预测,还提供了可复现的完整标注管线。
特点
该数据集的核心特点在于为大规模真实场景图像提供了精确的相机参数标注,涵盖了翻滚角、俯仰角、视场角及径向畸变等关键物理量。统计分析显示,翻滚角高度集中于0°,表明多数图像拍摄时保持水平;俯仰角呈明显负偏(中位数约-4°),反映了COCO场景常带有向下视角拍摄人物或物体的倾向;视场角则主要分布在20°至45°之间,中位数约32°,同时包含长尾的广角分布。这些分布特性赋予了数据集丰富的空间感知价值。
使用方法
用户可通过HuggingFace提供的命令行工具直接下载完整数据集,并利用配套的Puffin开源管线进行自定义数据集的相机参数标注、分布分析与可视化映射。对于希望获得更均匀参数分布的用户,可进一步参考Puffin-4M与Puffin-16M等扩展数据集。在使用时,建议优先检查parse_ok字段以确保参数有效性,并依据实际任务需求筛选所需的相机参数子集进行下游建模与评估。
背景与挑战
背景概述
COCO-Camera数据集诞生于三维视觉与物理人工智能交叉融合的背景下,由Kang Liao等研究者于2025年发布,依托Puffin-World模型为COCO数据集(约12.2万张图像)提供了逐图像的单目相机参数标注。该数据集的核心研究问题在于弥合二维图像内容与三维空间几何之间的鸿沟,通过精确标注相机的滚动角、俯仰角、垂直视场角和径向畸变系数,为世界模型、空间智能体的感知与生成提供关键几何先验。COCO-Camera的推出不仅丰富了现有计算机视觉数据集在几何维度上的不足,更推动了从图像理解到三维推理的范式跃迁,对具身智能、自动驾驶和场景重建等领域产生了深远影响。
当前挑战
COCO-Camera所面对的领域挑战在于,传统视觉任务如目标检测和分割长期忽视图像拍摄过程中的相机几何参数,导致模型对视角变化、畸变和透视效果缺乏鲁棒性,难以泛化到真实世界的复杂拍摄条件。构建该数据集时,挑战主要体现在两方面:一是从单张图像中准确且一致地预测相机参数,需解决深度模糊与多解性问题;二是对COCO这类大规模、多来源的异构图像集进行自动化标注,需设计可靠的解析验证机制(如parse_ok字段),并处理倾斜、畸变等边缘样本,确保数据质量与分布统计的有效性。
常用场景
经典使用场景
COCO-Camera数据集为计算机视觉领域提供了一种全新的图像元数据标注范式,它聚焦于为经典的COCO数据集中的每一幅图像赋予精确的相机参数,包括旋转角、俯仰角、垂直视场角及径向畸变系数。这一创新使得研究者能够在三维视觉与空间智能任务中,将二维图像与摄像机几何信息紧密结合,为场景理解、物体定位和视角估计等基准问题提供了标准化的数据基础。数据集的引入,使得从图像中恢复相机姿态与内参这一长期挑战获得了可靠的大规模监督来源,推动了单目几何推理与物理AI的边界拓展。
衍生相关工作
COCO-Camera的发布催生了一系列高影响力研究工作,其中最为核心的是其标注模型Puffin-World及其后续拓展Puffin-4M与Puffin-16M数据集。这些工作构建了统一的图像-相机联合理解与生成框架,首次在大型多模态模型中引入相机先验,实现了从文本、图像到三维控制信号的跨模态对齐。此外,基于COCO-Camera的几何统计数据,学术界涌现了关于自然图像相机分布建模、视角不变神经网络架构设计以及面向物理AI的世界模型等方向的新探索。该数据集及其配套的标注管线已被视为连接二维视觉与三维空间智能的桥梁,持续激发着空间理解与生成领域的创新浪潮。
数据集最近研究
最新研究方向
COCO-Camera数据集通过为经典COCO图像标注每张照片的相机内参(如滚转角、俯仰角、垂直视场角和径向畸变系数),开辟了从二维视觉向三维空间智能跃迁的前沿路径。该数据集的研究方向紧密围绕空间AI与物理AI的交叉领域,尤其聚焦于构建统一的多模态世界模型,使机器不仅能够识别图像中的物体,更能理解拍摄时的几何姿态与透视关系。近期热点事件如扩散模型驱动的3D生成和空间感知大模型的兴起,使得该数据集成为连接图像理解与三维场景重建的关键桥梁,它为研究光照、相机位置与场景几何之间的隐含关联提供了大规模监督信号,推动了从零样本相机参数估计到可控制的多视角内容生成等方向的发展,对增强现实、机器人导航和自动驾驶中的空间推理具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务