遇见数据集

FractalAIResearch/ProductConsistency-Benchmark

收藏
Hugging Face2026-06-30 更新2026-07-22 收录
官方服务:

资源简介:

ProductConsistency Benchmark 是一个高质量的数据集,用于基于指令的、以产品为中心的英文图像编辑。每个记录是一个评估元组:包括一个输入产品图像和一个单一的编辑指令,描述广告风格的场景变化。数据集包含870个样本,由174个合成产品图像(覆盖8个产品类别)组成,每个图像有5个不同的编辑指令。图像强调清晰可读的包装文本和一致的品牌标识;指令编写时注重在现实营销风格编辑下保持身份一致性。基准图像在类别和渲染文本长度范围内均匀覆盖,使用与更广泛的ProductConsistency发布相同的合成产品生成和基于OCR的文本验证流程。对于每个选定的产品图像,语言模型生成五个针对该图像的独特编辑指令。为确保数据集质量,最终的人工验证步骤确认每个基准图像中的产品文本与预期真实情况匹配,然后再配对和发布指令。

The ProductConsistency Benchmark is a high-quality dataset for instruction-based, product-centric image editing in English. Every record is one evaluation tuple: an input product image plus a single edit instruction describing an advertisement-style scene change. The dataset contains 870 samples formed from 174 synthetic product images (8 product categories) with 5 distinct edit instructions per image. Images emphasize legible on-pack text and consistent branding; instructions are written to stress identity preservation under realistic marketing-style edits. Benchmark images are drawn with uniform coverage over categories and over the range of rendered text lengths, using the same synthetic product generation and OCR-based text verification pipeline as the broader ProductConsistency release. For each selected product image, a language model generates five edit instructions that are unique to that image. To ensure dataset quality, a final human verification step confirms that on-product text in each benchmark image matches the intended ground truth before instructions are paired and released.

提供机构:
FractalAIResearch
搜集汇总
数据集介绍
FractalAIResearch/ProductConsistency-Benchmark 数据集图片
构建方式
ProductConsistency-Benchmark 是一个专为指令驱动、以产品为核心导向的图像编辑任务构建的高质量评估数据集。该数据集包含870个样本,源自174张合成生成的产品图像,覆盖8个产品类别,每张图像配以5条独特的编辑指令。图像生成过程依赖于一套统一的合成产品管线,并结合基于OCR的文本验证技术,以确保图像上印刷文本的准确性和一致性。随后,由语言模型为每张产品图像生成专属的编辑指令,最后经过人工核验,确认图像中的产品文本与预设目标完全匹配,方可将图像与指令配对并正式发布。这一严谨的构建流程保障了数据集的可靠性与编辑任务的挑战性。
特点
该数据集的核心特点在于其高度聚焦于产品身份保持这一前沿课题。所有图像均强调包装文本的清晰可读性与品牌视觉的一致性,编辑指令则设计为典型的广告场景变换,旨在测试模型在现实营销风格修图下维持产品核心元素不变的能力。数据集在类别分布与文本长度覆盖上实现了均匀采样,评估指标涵盖字符错误率(CER)、分割CLIP-I、分割DINO-I、产品一致性、美学评分、文本保真度及综合得分,为全面衡量模型在商业场景中的编辑表现提供了标准化的测试基准。
使用方法
使用者可通过Hugging Face Datasets库便捷加载该数据集。具体地,调用 `load_dataset("FractalAIResearch/ProductConsistencyBenchmark")` 即可获取整个数据集。数据集中的每个样本包含 `image` 和 `edit_instruction` 两个字段,分别对应输入的产品图像和一条以英文表述的编辑指令。模型需要基于该指令对图像进行编辑,同时最大程度地保留产品包装上的文本信息与整体品牌形象。研究者可直接利用此基准对现有的指令式图像编辑模型进行评估,或将其作为微调与强化学习训练中的验证集使用。
背景与挑战
背景概述
ProductConsistency-Benchmark 数据集由 Fractal AI Research 的研究人员 Mukund Khanna、Raj Singh Yadav 及 Kunal Singh 于2026年创建,旨在系统评估基于指令的产品中心图像编辑任务。在电子商务与广告领域,图像编辑模型需在遵循复杂场景变换指令的同时,严格保持产品身份的一致性,包括可读文本、品牌标识与整体视觉调性。该基准包含174张合成产品图像(涵盖8个品类)及对应的870条编辑指令,强调对包装文本的清晰度与品牌连贯性的考验。发布后,该数据集及其配套技术报告(arXiv:2606.19103)迅速成为衡量图像编辑模型产品一致性保持能力的重要标杆,推动了如Flux.1-Kontext-dev等模型的针对性优化,展现了其在可控图像生成与商业视觉内容生产领域的实践价值。
当前挑战
该数据集聚焦的核心挑战在于实现产品身份在编辑过程中的强鲁棒保持,具体表现为:1) 领域问题方面,现有图像编辑模型常因场景变换而畸变产品包装上的细小文字、商标或图案,导致品牌元素丢失或错误,严重制约了在电商广告、商品详情图等真实场景中的可用性;2) 构建过程中的挑战包括需精准生成174张具备清晰可读文本与统一品牌特征的合成产品图像,并设计5条能有效测试身份保持能力的独特编辑指令,最终通过人工验证环节确保每张图像的文本无误,整个过程在数据质量与规模之间取得了精巧平衡。
常用场景
经典使用场景
ProductConsistency-Benchmark作为一项面向指令驱动、以产品为核心的图像编辑评测基准,其设计初衷在于系统性地衡量生成模型对产品商标、包装文字及品牌视觉一致性的保持能力。该基准涵盖来自8个产品类别的174张合成图片,每张图片配有5条独立的广告风格编辑指令,总计870个评测样例。每条记录构成一个完整的评估元组:输入产品图像与一条描述场景变换的编辑指令。研究者和工程师可借助此基准检验模型在风格迁移、背景替换或场景重构等编辑任务中,能否维持产品核心视觉信息不丢失,从而为产品视觉生成领域提供标准化的评估框架。
解决学术问题
在图像编辑研究中,一个长期悬而未决的难点在于:如何在执行多样化的场景编辑指令时,保持产品原有的品牌标识、包装文字和整体风格不变。现有数据集往往缺乏对产品身份保持的专门关注,导致模型在广告设计、电商图像处理等实际任务中表现不稳定。ProductConsistency-Benchmark通过引入OCR验证文本一致性与人工标注的严格质量审核,有效填补了这一空白。该基准不仅系统量化模型在文字保真度(CER)、产品一致性、美学质量和语义对齐等维度的表现,还推动学界对指令编辑任务中产品身份完整性的深层机理开展探索,为生成式模型在实际部署中的可靠性提供了重要的评判依据。
衍生相关工作
围绕ProductConsistency-Benchmark,学术界和工业界已涌现出多项极具启发性的后续研究工作。例如,Kalaido-qwenedit-lora与Kalaido-qwen-2512-lora等模型基于该基准进行了高效微调,探索了轻量级低秩适应技术在保持产品一致性上的表现。更为突出的是,Flux.1-Kontext-dev与Qwen-Image-Edit-2511在使用该基准进行有监督微调与循环奖励学习后,在文字识别准确率和产品身份保持能力上均取得显著提升。这些进展不仅验证了该基准在模型性能评估中的核心地位,也引导研究者持续推动指令编辑策略从通用图像编辑向垂直领域精细化调控演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务