遇见数据集

ABO-Edit

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

ABO-Edit是一个专门为训练和评估视觉对象一致性生成模型而构建的数据集,旨在解决将“生活方式”图像(产品在复杂真实场景中的使用图像)转换为工作室级表示的任务。具体而言,目标是将同一产品以白色背景呈现,并带有逼真的阴影,且旋转和倾斜至精确指定的角度。数据集包含约1万至10万个样本,每个样本由三元组构成:源图像(x_src,生活方式图像)、详细的编辑提示(p_src→trg,包含细粒度旋转角度)以及对应的真实目标图像(x_trg,从3D资产渲染而成)。该数据集基于Amazon Berkeley Objects (ABO)数据集,通过从ABO的3D资产渲染工作室质量的目标图像,并将其与生活方式源图像以及由视觉语言模型(VLM)生成的编辑提示配对而成。数据集采用CC BY 4.0许可证发布,适用于图像编辑、基于指令的图像编辑、图像生成等任务。

ABO-Edit is a dataset specifically constructed for training and evaluating visual object-consistent generation models, aiming to address the task of converting lifestyle images (product usage images in complex real-world scenes) into studio-level representations. Specifically, the goal is to render the same product on a white background with realistic shadows, rotated and tilted to precisely specified angles. The dataset contains approximately 10,000 to 100,000 samples, each consisting of a triplet: a source image (x_src, lifestyle image), a detailed editing prompt (p_src→trg, including fine-grained rotation angles), and the corresponding ground-truth target image (x_trg, rendered from 3D assets). This dataset is based on the Amazon Berkeley Objects (ABO) dataset, created by rendering studio-quality target images from ABOs 3D assets and pairing them with lifestyle source images along with editing prompts generated by a vision-language model (VLM). The dataset is released under the CC BY 4.0 license and is suitable for tasks such as image editing, instruction-based image editing, and image generation.

提供机构:
Amazon Web Services
创建时间:
2026-08-28
原始信息汇总

ABO-Edit 数据集概述

基本信息

  • 许可证:CC BY 4.0
  • 语言:英语
  • 任务类别:图像-文本到图像生成(Image-text-to-image)
  • 标注类型:图像编辑、基于指令的编辑、图像生成
  • 数据规模:10,000 < 样本数 < 100,000

数据集简介

ABO-Edit是一个经过精心策划的数据集,用于训练和评估生成模型在视觉对象一致性方面的表现。该数据集解决了一个具有挑战性的任务:将“生活方式”图像(展示产品在复杂真实场景中的使用情况)转换为工作室质量的表示——即同一产品被隔离在白色背景上,带有真实阴影,并旋转和倾斜至精确指定的角度

数据样例结构

每个样本包含三元组 ⟨源图像、编辑提示、目标图像⟩:

  1. 源图像(x_src):一张来源的生活方式图像
  2. 编辑提示(p_src→trg):包含细粒度旋转角度的详细编辑提示
  3. 目标图像(x_trg):从3D资产渲染出的对应真实目标图像

数据来源与许可

  • 原始数据归属:图像和3D资产版权归Amazon.com所有。
  • 数据构建:该数据集基于ABO(Amazon Berkeley Objects)构建,通过从ABO的3D资产渲染工作室质量的目标图像,并将其与生活方式来源图像及VLM生成的编辑提示进行配对而成。
  • 许可声明:ABO-Edit源自Amazon Berkeley Objects (ABO),遵循相同的CC BY 4.0许可协议,不施加额外限制。

引用方式

使用该数据集时,需同时引用本工作(DiTailed论文)和原始ABO数据集,具体引用信息见数据集详情页的BibTeX条目。

搜集汇总
数据集介绍
ABO-Edit 数据集图片
构建方式
ABO-Edit数据集的构建依托于Amazon Berkeley Objects(ABO)资源,通过从ABO的3D资产中渲染出符合特定角度与光照条件的studio-quality目标图像,并将这些图像与对应的lifestyle源图像配对,同时利用视觉语言模型(VLM)生成详细的编辑提示,从而构建出三元组样本。每个样本包含源图像、提示词和目标图像,确保了数据在视觉对象一致性上的高质量与多样性。
使用方法
ABO-Edit适用于训练和评估基于指令的图像编辑模型,尤其强调在文本到图像到图像的流程中保持视觉对象的一致性。研究者可直接加载数据集,利用三元组结构进行监督学习,或将其作为基准测试,评估模型在生成studio-quality图像时的表现。数据集与HuggingFace集成,便于通过datasets库快速访问,同时需遵循CC BY 4.0许可,并在引用时注明原始ABO数据集与本工作。
背景与挑战
背景概述
ABO-Edit数据集于2026年由Francesco Taioli等研究者基于Amazon Berkeley Objects构建,旨在攻克文本-图像到图像生成中视觉对象一致性的核心难题。该数据集围绕从复杂生活场景图像到工作室级标准图像的转换任务,通过精细的旋转角度编辑指令,推动生成模型在保持产品身份的同时实现精准姿态变换。其独特之处在于利用3D资产渲染高保真目标图像,为流匹配模型提供了高质量训练与评估基准,对电子商务视觉内容生成领域具有深远影响。
当前挑战
ABO-Edit所面临的挑战多维且深刻。领域层面,视觉对象一致性是生成模型长期未解的难题,尤其在复杂背景下的产品图像转换中,模型需兼顾语义保真与几何精确性,极易出现对象变形或细节丢失。构建过程中,团队需处理ABO数据集中3D资产与生活场景图像的配对难题,包括视角差异、光照变化及遮挡问题,同时需借助VLM生成高质量编辑指令,确保旋转角度描述的精准性,这对数据标注质量与规模扩展构成显著考验。
常用场景
经典使用场景
ABO-Edit数据集的核心应用在于训练与评估基于指令的图像编辑模型,尤其在视觉对象一致性方面。该数据集精心构建了从生活方式图像到工作室级图像的转换任务,每份样本包含源图像、细粒度编辑提示(含精确旋转角度)以及由3D资产渲染的基准目标图像。这一设计使研究者能够系统性地训练模型理解并执行涉及对象姿态、背景及光照变化的复杂图像编辑指令。经典使用场景包括条件图像生成、基于指令的图像编辑以及图像到图像的转换任务,其中模型需在保持对象身份和细节一致性的前提下,依据文本描述生成符合要求的图像。
解决学术问题
ABO-Edit针对当前图像编辑模型在对象一致性上的关键挑战提供了规范化的解决途径。其一,它构建了高质量的三元组(源图像、指令、目标图像),为量化评估模型在旋转、背景替换等操作中的保真度提供了基准。其二,该数据集填补了同时涵盖细粒度姿态控制和真实场景到合成场景转换的公共数据空白,推动了文本到图像编辑领域的研究进步。通过提供大规模且具三维一致性的数据,它促进了模型从二维编辑向三维理解的能力迁移,对视觉生成模型的鲁棒性研究产生了深远影响。
实际应用
在实际应用中,ABO-Edit直接服务于电商产品展示的自动化流程,例如将产品生活方式图自动转化为白底商业图,大幅降低人工成本并提升效率。该技术还可用于虚拟试衣间、家具定制预览等场景,实现基于用户描述的实时图像编辑。由于数据集来源于真实商品,其生成的模型在广告设计、数字内容创作等商业领域具有直接的应用价值,能够辅助创作者快速生成符合品牌规范的视觉素材,同时保持产品的真实性与一致性。
数据集最近研究
最新研究方向
ABO-Edit数据集聚焦于文本-图像到图像生成中的视觉对象一致性这一前沿挑战,通过将复杂生活场景中的商品图像转化为具有精确旋转角度和真实阴影的棚拍风格图像,为指令式图像编辑模型提供了高质素的训练与评估基准。该数据集基于Amazon Berkeley Objects构建,结合3D资产渲染与VLM生成的编辑提示,推动了生成模型在对象身份保持与几何操控方面的研究,尤其为流匹配模型等新兴生成范式提供了关键验证资源,对电商视觉内容自动化生产与增强现实应用具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务