遇见数据集

CPI-Bench

收藏
github2026-08-16 更新2026-08-18 收录
官方服务:

资源简介:

CPI-Bench是一个全面的基准测试套件,旨在评估图像生成/编辑模型是否真正能够处理多样化、真实世界和知识密集型的任务。它由三个互补的子集组成:通用图像编辑基准(CPI-General-Benchmark)、日常生活场景图像编辑基准(CPI-Practical-Benchmark)和需要领域知识和多步推理的图像编辑基准(CPI-Intelligent-Benchmark)。

CPI-Bench is a comprehensive benchmark suite designed to evaluate whether image generation and editing models can genuinely handle diverse, real-world, and knowledge-intensive tasks. It comprises three complementary subsets: the General Image Editing Benchmark (CPI-General-Benchmark), the Daily Life Scene Image Editing Benchmark (CPI-Practical-Benchmark), and the Image Editing Benchmark requiring domain knowledge and multi-step reasoning (CPI-Intelligent-Benchmark).

创建时间:
2026-08-13
原始信息汇总

CPI-Bench 数据集详情

概述

CPI-Bench 是一个综合性基准测试套件,用于评估图像生成/编辑模型在处理多样化、真实世界和知识密集型任务方面的能力。该数据集由三个互补的子集组成,每个样本提供编辑/生成指令(对于图像编辑任务,还包含一个或多个参考图像),模型需据此生成输出图像,随后由 VLM 作为评判者(如 Gemini)从多个质量维度进行评分。

数据集构成

三个子集

子集名称 描述 数据文件
CPI-General-Benchmark 通用图像编辑任务,涵盖广泛的任务类型 CPI_general_benchmark/CPI_general_benchmark-*.parquet
CPI-Practical-Benchmark 基于日常真实生活场景的图像编辑任务 CPI_practical_benchmark/CPI_practical_benchmark-*.parquet
CPI-Intelligent-Benchmark 需要领域知识和多步骤推理的图像编辑任务,包含参考输入图像 CPI_intelligent_benchmark-*.parquet

主要特性

  • 三个互补子集:覆盖通用编辑、生活场景编辑和知识密集型推理的图生图(i2i)场景
  • 多图像输入支持source 字段可包含一张或多张参考图像,支持复杂的多图像编辑场景
  • 双语指令:每个子集均提供中英文指令,支持跨语言评估
  • 推理感知标注:推理子集额外提供 rationale 字段,作为评分时的参考推理轨迹(指导材料,而非硬性标注)
  • VLM 驱动自动评估:每个子集附带即用型、多维度 VLM 评判工具包

数据字段说明

CPI-General-Benchmark / CPI-Practical-Benchmark 字段

字段 描述
id 唯一样本 ID
task 任务类别,用于选择对应的评分提示模板
a_to_b_instructions 中文编辑指令
a_to_b_instructions_eng 英文编辑指令
target_resolution 目标输出分辨率
source List[PIL.Image] — 一个或多个参考输入图像

CPI-Intelligent-Benchmark 字段

字段 描述
id 唯一样本 ID
expert_domain 领域类别,格式为 "<domain>-<subtask>"
a_to_b_instructions 中文编辑指令
a_to_b_instructions_eng 英文编辑指令
rationale 参考推理轨迹(评分指导材料,可为空)
target_resolution 目标输出分辨率
source List[PIL.Image] — 一个或多个参考输入图像

使用方法

可通过 Hugging Face 加载数据集:

python from datasets import load_dataset

加载特定子集

dataset = load_dataset("TaobaoTmall-AlgorithmProducts/CPI-benchmark", "general", split="train")

其他配置: "practical", "intelligent"

评估工具包

数据集提供自动评估工具包,基于 VLM-as-Judge 实现:

评分维度

CPI-General-Benchmark / CPI-Practical-Benchmark:每种 task 类型对应特定的评分提示模板,评判 VLM 输出各维度分数,最终得分为所有维度的算术平均值。

CPI-Intelligent-Benchmark — 3 个维度,每项 1.0-5.0 分:

维度 权重 评估内容
知识推理 45% 事实/领域知识正确性,结合 rationale 作为参考指导
视觉质量 30% 生成结果的整体视觉/美学质量
输入一致性 25% 结果与参考输入图像之间的一致性

最终得分为三个维度的加权和。若知识推理得分 ≤ 2,最终得分额外乘以 0.6 作为事实/知识错误的惩罚。

评估方式

  • 通用/实用:每个样本一次 VLM 调用,发送 [参考图像..., 结果, 评分提示],解析各维度分数
  • 智能:采用分步调用策略,每个维度单独进行 VLM 调用,使评判者聚焦单一维度,评分更可靠

核心功能

  • 断点续跑:评估中断后重跑可跳过已评分样本
  • 多密钥轮换:支持多个 API 密钥分配请求,避免速率限制
  • 并发评分:通过 --workers 参数控制并行度
  • 自定义 VLM 端点:支持任意 OpenAI 兼容 API

许可证

CPI-Bench 采用 CC BY-NC-ND 4.0 许可证:

  • ✅ 仅限学术研究使用
  • ❌ 禁止商业用途
搜集汇总
数据集介绍
CPI-Bench 数据集图片
构建方式
CPI-Bench数据集由三个互补的子集构成,旨在全面评估图像生成与编辑模型在多样化、真实世界及知识密集型任务中的能力。CPI-General-Benchmark覆盖通用图像编辑任务,多样性丰富;CPI-Practical-Benchmark聚焦日常生活场景的编辑需求;CPI-Intelligent-Benchmark则涉及领域知识与多步推理,并提供参考输入图像。每个样本包含编辑指令(中英双语)及一个或多个参考图像,部分样本附有推理轨迹作为评分参考。数据以parquet格式存储,可通过Hugging Face Hub直接加载。
特点
该数据集的特色在于其多维度设计:三个子集相互补充,涵盖从基础编辑到复杂推理的完整谱系;支持多图像输入,满足复杂编辑场景需求;中英双语指令实现跨语言评估;智能子集提供推理注释,作为评分参考而非硬性标准;配套的VLM-as-Judge自动评估工具,可实现多维度质量评分,包括知识推理、视觉质量和输入一致性,且支持断点续评、多密钥轮换和并发加速。
使用方法
使用CPI-Bench时,研究者需先通过Hugging Face加载数据集,或下载parquet文件。随后,使用export_samples.py导出样本,生成参考图像和模板文件;针对每个样本,运行模型生成结果图像,并填入JSONL文件。接着,根据子集选择相应的评估脚本(eval_general_practical.py或eval_intelligent.py),配置API密钥和提示词模板,执行自动化评估。最终输出包含逐样本评分和汇总统计的报告,便于横向对比模型性能。
背景与挑战
背景概述
随着图像生成与编辑技术的迅猛发展,通用模型在处理多样化、真实世界及知识密集型任务时的能力评估成为亟待解决的问题。为此,阿里巴巴淘宝天猫算法产品团队于近年推出了CPI-Bench基准测试集,其研究核心在于系统性地衡量图像编辑与生成模型在复杂指令下的综合表现。该基准由三大互补子集构成:通用编辑、生活场景编辑及知识密集型推理编辑,覆盖广泛的任务类型,并创新性地引入了多图像输入支持、中英双语指令及推理轨迹标注,旨在推动模型向更高层次的理解与生成能力迈进。CPI-Bench的发布为图像生成领域提供了标准化的评估框架,对模型研发与性能对比具有重要参考价值,亦为跨语言、跨场景的图像编辑研究树立了新的标杆。
当前挑战
CPI-Bench在设计构建及实际应用中面临多重挑战。首要挑战在于其致力于解决的领域难题:现有模型难以同时驾驭通用编辑的灵活性、生活场景的实用性及知识密集型任务所需的深度推理,尤其后者要求模型具备跨领域知识与多步逻辑整合,诸多模型常于事实准确性或视觉一致性上折戟。构建过程中的难点则体现在数据集的精细标注与评估机制的可靠性上:需为每个样本设计贴合实际且富含语义的编辑指令,同时确保中英双语指令的等价性与理解无偏;多图像输入的支持要求标注体系能清晰映射复杂指令与多参考图间的关系;而VLM-as-Judge评估策略需平衡自动评分的高效与人类审美及知识判断的准确性,尤其在知识推理维度上,如何制定合理的加权规则以避免分数失真,亦是持续探索的挑战。
常用场景
经典使用场景
CPI-Bench作为图像生成与编辑领域的综合性基准测试套件,其核心应用场景在于系统性地评估模型在处理多样化、真实世界及知识密集型任务上的能力。该基准由三个互补的子集构成:通用编辑基准覆盖广泛的图像编辑任务类型,实用基准聚焦于日常生活场景中的编辑需求,而智能基准则要求模型具备领域知识与多步推理能力,并支持多参考图像输入。每个样本均提供中英双语指令及参考图像,适配跨语言评估需求。研究者可利用该基准对模型进行多维度评分,包括知识推理、视觉质量及输入一致性等,从而全面衡量模型的综合性能。
实际应用
在实际应用层面,CPI-Bench为图像编辑技术的落地提供了可靠的性能验证工具。无论是电商平台的商品图像优化、社交媒体的内容创作,还是专业设计中的图片精修,该基准都能模拟真实场景中的编辑指令,帮助开发者评估模型的实际可用性。多图像输入支持使其适用于合成图像、风格迁移等复杂任务,而中英双语指令则满足了全球化应用的需求。此外,其自动评估工具包简化了模型测试流程,使得企业能够快速筛选出适合特定业务场景的模型,从而加速技术从实验室到产品的转化过程。
衍生相关工作
CPI-Bench的发布催生了多项衍生研究工作。基于其子集划分与评分维度,研究者可进一步探索任务特定的模型微调方法,例如针对智能子集优化知识推理能力,或针对实用子集提升场景适应性。该基准的VLM-as-Judge评估框架亦启发了一系列关于自动评估机制的研究,包括如何设计更有效的评分提示模板及多维度加权策略。此外,其提供的参考推理轨迹数据,为因果推理在图像编辑中的应用研究提供了宝贵资源,推动了这一交叉领域的发展。这些衍生工作不仅丰富了图像编辑的研究方向,也促进了评估方法论本身的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务