遇见数据集

Thinking-In-Boxes

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

Thinking-In-Boxes 是一个用于几何图像编辑的图像到图像生成模型的训练数据集。该数据集包含1-2个物体场景的地面放置图像,每个场景从两个视角渲染,并提供了相应的场景表示(物体以3D彩色盒子形式置于阴影地板上),以消除物体和相机变换的歧义。数据集由三个独立子集组成:100K-Syn(10万合成双物体场景,用于第一阶段微调)、10K-Objectron(1万真实世界Objectron派生场景,用于第二阶段微调)和10K-Syn(1万合成双物体场景,用于第二阶段微调),总样本量约12万。每个样本包含4个PNG文件:bbox_0.png(源配置场景表示)、bbox_1.png(目标配置场景表示)、rgb_0.png(源配置RGB渲染)和rgb_1.png(目标配置RGB渲染)。其中100K-Syn和10K-Syn子集的分辨率为512×512,10K-Objectron子集的分辨率为1440×1920。数据集采用WebDataset格式存储为.tar分片,可通过HuggingFace Datasets库按子集或数据目录加载,并支持合并多个子集用于训练。

Thinking-In-Boxes is a training dataset for image-to-image generation models for geometric image editing. The dataset contains ground-plane images of scenes with 1-2 objects, each rendered from two viewpoints, along with corresponding scene representations (objects as 3D colored boxes on a shadowed floor) to disambiguate object and camera transformations. It consists of three independent subsets: 100K-Syn (100,000 synthetic two-object scenes for first-stage fine-tuning), 10K-Objectron (10,000 real-world Objectron-derived scenes for second-stage fine-tuning), and 10K-Syn (10,000 synthetic two-object scenes for second-stage fine-tuning), totaling approximately 120,000 samples. Each sample includes four PNG files: bbox_0.png (source configuration scene representation), bbox_1.png (target configuration scene representation), rgb_0.png (source configuration RGB render), and rgb_1.png (target configuration RGB render). The 100K-Syn and 10K-Syn subsets have a resolution of 512×512, while the 10K-Objectron subset has a resolution of 1440×1920. The dataset is stored in WebDataset format as .tar shards, can be loaded via the HuggingFace Datasets library by subset or data directory, and supports merging multiple subsets for training.

创建时间:
2026-08-21
原始信息汇总

Thinking-In-Boxes 数据集概述

基本信息

  • 数据集名称:Thinking-In-Boxes
  • 许可证:CC-BY-4.0
  • 任务类型:图像到图像(image-to-image)
  • 标签:生成建模、图像编辑、几何编辑、3D视觉
  • 语言:英语
  • 数据规模:100K<n<1M

数据集简介

Thinking-In-Boxes 是一个用于几何图像编辑的生成模型训练数据集,源自论文《Thinking In Boxes: 3D Editing in Real Images Made Easy》。该数据集包含1-2个物体场景的图像,每个场景从两个视角渲染,并配有一种场景表示方法——将物体表示为放置在阴影地面上的3D彩色框(3D Coloured Boxes),从而消除物体和相机变换的歧义。

数据集结构

数据集包含三个独立的子集,均以WebDataset .tar 分片形式存储:

子集名称 文件夹路径 大约规模 描述
100K-Syn data/100K-Syn/ 100,000个场景 用于阶段1微调的合成2物体场景
10K-Objectron data/10K-Objectron/ 10,000个场景 用于阶段2微调的真实世界Objectron派生场景
10K-Syn data/10K-Syn/ 10,000个场景 用于阶段2微调的合成2物体场景

每个场景(样本)包含4个文件:

  • bbox_0.pngbbox_1.png:源配置和目标配置的场景表示
  • rgb_0.pngrgb_1.png:源配置和目标配置的RGB渲染图

分辨率说明

  • 100K-Syn 和 10K-Syn 子集的 PNG 文件分辨率为 512x512
  • 10K-Objectron 子集的分辨率为 1440x1920

使用方式

每个子集可通过 data_dir 参数独立加载(所有子集共享相同的 train 分割标签,通过 data_dir 区分而非 split):

python from datasets import load_dataset

方法1:使用 data_dir

ds_100K_Syn = load_dataset("pradhaansbhat/Thinking-In-Boxes", data_dir="data/100K-Syn", split="train") ds_10K_Objectron = load_dataset("pradhaansbhat/Thinking-In-Boxes", data_dir="data/10K-Objectron", split="train")

方法2:使用命名配置

ds_100K_Syn = load_dataset("pradhaansbhat/Thinking-In-Boxes", "100K-Syn", split="train") ds_10K_Objectron = load_dataset("pradhaansbhat/Thinking-In-Boxes", "10K-Objectron", split="train")

合并子集进行训练

python from datasets import concatenate_datasets

merged = concatenate_datasets([ds_10K_Objectron, ds_10K_Syn])

注意事项__key__ 值(如 scene_000000)在每个子集内唯一,但合并后跨子集不保证唯一。这不会影响训练,但若依赖 __key__ 进行去重或跨合并数据的查找,需要留意。

引用信息

bibtex @misc{bhat2026thinkingboxes3dediting, title = {Thinking in Boxes: 3D Editing in Real Images Made Easy}, author = {Pradhaan S Bhat and Naveen Chandra R and Rishubh Parihar and Vaibhav Vavilala and R. Venkatesh Babu and D. A. Forsyth and Anand Bhattad}, year = {2026}, eprint = {2606.20556}, archivePrefix = {arXiv}, primaryClass = {cs.CV}, url = {https://arxiv.org/abs/2606.20556} }

搜集汇总
数据集介绍
Thinking-In-Boxes 数据集图片
构建方式
Thinking-In-Boxes数据集是为三维几何图像编辑任务精心构建的大规模训练资源,其构建过程融合了合成数据与真实世界数据的优势。具体而言,该数据集包含三个独立子集:100K-Syn由十万个合成双物体场景构成,用于第一阶段微调;10K-Objectron源自真实世界的Objectron数据集,包含一万个场景,用于第二阶段微调;10K-Syn则提供一万个合成场景,同样服务于第二阶段。每个场景样本均包含四幅图像:源配置和目标配置的边界框表示图以及对应的RGB渲染图。所有子集均以WebDataset的.tar分片格式存储,确保高效的数据加载与处理。
特点
该数据集的核心特点在于其独特的三维物体表示方法——将场景中的物体抽象为放置在阴影地面上的彩色三维盒子,这种表示方式有效消解了物体与相机变换之间的歧义,为几何编辑提供了清晰且明确的几何约束。此外,数据集的三个子集在分辨率上有所差异:合成子集图像尺寸为512×512,而Objectron子集则采用1440×1920的高分辨率,以适应不同来源的视觉细节。样本中同时提供边界框表示与RGB渲染,支持模型学习从几何结构到视觉外观的映射,从而在真实图像上实现鲁棒的几何编辑能力。
使用方法
使用Thinking-In-Boxes数据集时,可通过HuggingFace datasets库灵活加载。用户既可以通过指定data_dir参数独立加载任一子集,也可以利用预设的命名配置(如'100K-Syn')快速获取数据。所有子集共享'train'分割标签,实际区别由data_dir决定,这简化了加载逻辑。对于训练任务,用户可借助concatenate_datasets函数合并多个子集,例如将10K-Objectron与10K-Syn结合,以扩充训练数据的多样性。值得注意的是,合并后样本的__key__字段可能不再唯一,但这不影响常规训练过程,仅需在依赖键值进行去重或查找时加以留意。
背景与挑战
背景概述
Thinking-In-Boxes数据集由Pradhaan S Bhat等研究者在2026年构建,旨在推动真实图像中的三维几何编辑任务。该数据集以生成模型为核心,通过将场景中的物体表示为彩色三维盒子,并结合双视角渲染,提供了明确的物体与相机变换信息。数据集包含约12万个场景,涵盖合成数据与真实世界数据,为从二维图像中恢复三维结构并实现精准编辑提供了规模化训练资源。其提出的场景表示方法简化了几何编辑的复杂性,对三维视觉、图像编辑及生成建模领域具有重要影响力。
当前挑战
该数据集所面临的挑战首先在于所解决的领域问题:三维几何编辑需要对图像中的物体位置、姿态进行精确控制,而现有生成模型往往难以在保持场景一致性的前提下实现这种编辑。真实图像中的三维信息缺失和光照、纹理的复杂性进一步加剧了难度。其次,在构建过程中,需要生成包含双视角渲染及对应场景表示的大规模数据,同时确保合成数据与真实数据之间的分布一致性。此外,数据集的规模与多样性平衡、标注精度以及不同子集间的兼容性也是构建时需克服的挑战。
常用场景
经典使用场景
Thinking-In-Boxes数据集为几何图像编辑领域提供了独特的训练资源,其核心应用在于训练生成模型实现真实图像中的三维物体和相机位姿的精确操控。数据集包含从单一视角到另一视角的场景渲染,每对图像辅以三维彩色方框表示的抽象场景表征,这种设计使得模型能够学习到隐含的三维几何结构,从而支持诸如物体旋转、平移、缩放及相机视角改变等精细编辑操作。尤为重要的是,该数据集覆盖了合成场景与现实世界数据(源自Objectron),为跨域泛化提供了坚实基础,是研究从二维图像中推理三维信息并执行可解释编辑的理想基准。
解决学术问题
该数据集解决了计算机视觉中长期存在的难题——如何从单一RGB图像中进行可控的三维几何编辑,而无需显式重建完整的3D模型。传统方法依赖于深度估计或多视图几何,常难以在真实图像上实现精确、一致的空间变换。Thinking-In-Boxes通过引入了一个简洁而强大的中间表示——三维彩色方框,打破了这一瓶颈,使得模型能够解耦物体与摄像机的变换,简化了学习过程。其构建规模(超过10万个场景)支持了两阶段微调策略,有效缓解了合成数据与真实数据之间的域差异,推动了图像编辑向更普适、更稳健的方向发展,为生成模型的几何控制能力提供了新的研究范式和评估基线。
衍生相关工作
围绕Thinking-In-Boxes的核心思想,衍生出一系列后续研究。其三维彩色方框表征启发了几何感知的扩散模型改进,如将隐式3D先验集成进Stable Diffusion以强化空间控制。后续工作探索了在无标注真实数据上的自监督微调,利用一致性损失提升跨域表现。该数据集成为了新基准,用于评估编辑保真度与身份保持,推动了生成模型评价指标的发展。此外,它催化了多视图生成与神经辐射场(NeRF)的结合,研究如何通过单一编辑操作同步更新多视角渲染。还有工作将其扩展至视频领域,实现时空一致的动态编辑,并利用其结构化场景对进行解耦表示学习,为三维场景理解打开了新窗口。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务