Thinking-In-Boxes
收藏资源简介:
Thinking-In-Boxes 是一个用于几何图像编辑的图像到图像生成模型的训练数据集。该数据集包含1-2个物体场景的地面放置图像,每个场景从两个视角渲染,并提供了相应的场景表示(物体以3D彩色盒子形式置于阴影地板上),以消除物体和相机变换的歧义。数据集由三个独立子集组成:100K-Syn(10万合成双物体场景,用于第一阶段微调)、10K-Objectron(1万真实世界Objectron派生场景,用于第二阶段微调)和10K-Syn(1万合成双物体场景,用于第二阶段微调),总样本量约12万。每个样本包含4个PNG文件:bbox_0.png(源配置场景表示)、bbox_1.png(目标配置场景表示)、rgb_0.png(源配置RGB渲染)和rgb_1.png(目标配置RGB渲染)。其中100K-Syn和10K-Syn子集的分辨率为512×512,10K-Objectron子集的分辨率为1440×1920。数据集采用WebDataset格式存储为.tar分片,可通过HuggingFace Datasets库按子集或数据目录加载,并支持合并多个子集用于训练。
Thinking-In-Boxes is a training dataset for image-to-image generation models for geometric image editing. The dataset contains ground-plane images of scenes with 1-2 objects, each rendered from two viewpoints, along with corresponding scene representations (objects as 3D colored boxes on a shadowed floor) to disambiguate object and camera transformations. It consists of three independent subsets: 100K-Syn (100,000 synthetic two-object scenes for first-stage fine-tuning), 10K-Objectron (10,000 real-world Objectron-derived scenes for second-stage fine-tuning), and 10K-Syn (10,000 synthetic two-object scenes for second-stage fine-tuning), totaling approximately 120,000 samples. Each sample includes four PNG files: bbox_0.png (source configuration scene representation), bbox_1.png (target configuration scene representation), rgb_0.png (source configuration RGB render), and rgb_1.png (target configuration RGB render). The 100K-Syn and 10K-Syn subsets have a resolution of 512×512, while the 10K-Objectron subset has a resolution of 1440×1920. The dataset is stored in WebDataset format as .tar shards, can be loaded via the HuggingFace Datasets library by subset or data directory, and supports merging multiple subsets for training.
Thinking-In-Boxes 数据集概述
基本信息
- 数据集名称:Thinking-In-Boxes
- 许可证:CC-BY-4.0
- 任务类型:图像到图像(image-to-image)
- 标签:生成建模、图像编辑、几何编辑、3D视觉
- 语言:英语
- 数据规模:100K<n<1M
数据集简介
Thinking-In-Boxes 是一个用于几何图像编辑的生成模型训练数据集,源自论文《Thinking In Boxes: 3D Editing in Real Images Made Easy》。该数据集包含1-2个物体场景的图像,每个场景从两个视角渲染,并配有一种场景表示方法——将物体表示为放置在阴影地面上的3D彩色框(3D Coloured Boxes),从而消除物体和相机变换的歧义。
数据集结构
数据集包含三个独立的子集,均以WebDataset .tar 分片形式存储:
| 子集名称 | 文件夹路径 | 大约规模 | 描述 |
|---|---|---|---|
| 100K-Syn | data/100K-Syn/ |
100,000个场景 | 用于阶段1微调的合成2物体场景 |
| 10K-Objectron | data/10K-Objectron/ |
10,000个场景 | 用于阶段2微调的真实世界Objectron派生场景 |
| 10K-Syn | data/10K-Syn/ |
10,000个场景 | 用于阶段2微调的合成2物体场景 |
每个场景(样本)包含4个文件:
bbox_0.png、bbox_1.png:源配置和目标配置的场景表示rgb_0.png、rgb_1.png:源配置和目标配置的RGB渲染图
分辨率说明:
- 100K-Syn 和 10K-Syn 子集的 PNG 文件分辨率为 512x512
- 10K-Objectron 子集的分辨率为 1440x1920
使用方式
每个子集可通过 data_dir 参数独立加载(所有子集共享相同的 train 分割标签,通过 data_dir 区分而非 split):
python from datasets import load_dataset
方法1:使用 data_dir
ds_100K_Syn = load_dataset("pradhaansbhat/Thinking-In-Boxes", data_dir="data/100K-Syn", split="train") ds_10K_Objectron = load_dataset("pradhaansbhat/Thinking-In-Boxes", data_dir="data/10K-Objectron", split="train")
方法2:使用命名配置
ds_100K_Syn = load_dataset("pradhaansbhat/Thinking-In-Boxes", "100K-Syn", split="train") ds_10K_Objectron = load_dataset("pradhaansbhat/Thinking-In-Boxes", "10K-Objectron", split="train")
合并子集进行训练
python from datasets import concatenate_datasets
merged = concatenate_datasets([ds_10K_Objectron, ds_10K_Syn])
注意事项:__key__ 值(如 scene_000000)在每个子集内唯一,但合并后跨子集不保证唯一。这不会影响训练,但若依赖 __key__ 进行去重或跨合并数据的查找,需要留意。
引用信息
bibtex @misc{bhat2026thinkingboxes3dediting, title = {Thinking in Boxes: 3D Editing in Real Images Made Easy}, author = {Pradhaan S Bhat and Naveen Chandra R and Rishubh Parihar and Vaibhav Vavilala and R. Venkatesh Babu and D. A. Forsyth and Anand Bhattad}, year = {2026}, eprint = {2606.20556}, archivePrefix = {arXiv}, primaryClass = {cs.CV}, url = {https://arxiv.org/abs/2606.20556} }





