CPI-Bench
收藏资源简介:
CPI-Bench是一个全面的基准测试套件,旨在评估图像生成/编辑模型是否真正能够处理多样化、真实世界和知识密集型的任务。它由三个互补的子集组成:通用图像编辑基准(CPI-General-Benchmark)、日常生活场景图像编辑基准(CPI-Practical-Benchmark)和需要领域知识和多步推理的图像编辑基准(CPI-Intelligent-Benchmark)。
CPI-Bench is a comprehensive benchmark suite designed to evaluate whether image generation and editing models can genuinely handle diverse, real-world, and knowledge-intensive tasks. It comprises three complementary subsets: the General Image Editing Benchmark (CPI-General-Benchmark), the Daily Life Scene Image Editing Benchmark (CPI-Practical-Benchmark), and the Image Editing Benchmark requiring domain knowledge and multi-step reasoning (CPI-Intelligent-Benchmark).
CPI-Bench 数据集详情
概述
CPI-Bench 是一个综合性基准测试套件,用于评估图像生成/编辑模型在处理多样化、真实世界和知识密集型任务方面的能力。该数据集由三个互补的子集组成,每个样本提供编辑/生成指令(对于图像编辑任务,还包含一个或多个参考图像),模型需据此生成输出图像,随后由 VLM 作为评判者(如 Gemini)从多个质量维度进行评分。
数据集构成
三个子集
| 子集名称 | 描述 | 数据文件 |
|---|---|---|
| CPI-General-Benchmark | 通用图像编辑任务,涵盖广泛的任务类型 | CPI_general_benchmark/CPI_general_benchmark-*.parquet |
| CPI-Practical-Benchmark | 基于日常真实生活场景的图像编辑任务 | CPI_practical_benchmark/CPI_practical_benchmark-*.parquet |
| CPI-Intelligent-Benchmark | 需要领域知识和多步骤推理的图像编辑任务,包含参考输入图像 | CPI_intelligent_benchmark-*.parquet |
主要特性
- 三个互补子集:覆盖通用编辑、生活场景编辑和知识密集型推理的图生图(i2i)场景
- 多图像输入支持:
source字段可包含一张或多张参考图像,支持复杂的多图像编辑场景 - 双语指令:每个子集均提供中英文指令,支持跨语言评估
- 推理感知标注:推理子集额外提供
rationale字段,作为评分时的参考推理轨迹(指导材料,而非硬性标注) - VLM 驱动自动评估:每个子集附带即用型、多维度 VLM 评判工具包
数据字段说明
CPI-General-Benchmark / CPI-Practical-Benchmark 字段
| 字段 | 描述 |
|---|---|
id |
唯一样本 ID |
task |
任务类别,用于选择对应的评分提示模板 |
a_to_b_instructions |
中文编辑指令 |
a_to_b_instructions_eng |
英文编辑指令 |
target_resolution |
目标输出分辨率 |
source |
List[PIL.Image] — 一个或多个参考输入图像 |
CPI-Intelligent-Benchmark 字段
| 字段 | 描述 |
|---|---|
id |
唯一样本 ID |
expert_domain |
领域类别,格式为 "<domain>-<subtask>" |
a_to_b_instructions |
中文编辑指令 |
a_to_b_instructions_eng |
英文编辑指令 |
rationale |
参考推理轨迹(评分指导材料,可为空) |
target_resolution |
目标输出分辨率 |
source |
List[PIL.Image] — 一个或多个参考输入图像 |
使用方法
可通过 Hugging Face 加载数据集:
python from datasets import load_dataset
加载特定子集
dataset = load_dataset("TaobaoTmall-AlgorithmProducts/CPI-benchmark", "general", split="train")
其他配置: "practical", "intelligent"
评估工具包
数据集提供自动评估工具包,基于 VLM-as-Judge 实现:
评分维度
CPI-General-Benchmark / CPI-Practical-Benchmark:每种 task 类型对应特定的评分提示模板,评判 VLM 输出各维度分数,最终得分为所有维度的算术平均值。
CPI-Intelligent-Benchmark — 3 个维度,每项 1.0-5.0 分:
| 维度 | 权重 | 评估内容 |
|---|---|---|
| 知识推理 | 45% | 事实/领域知识正确性,结合 rationale 作为参考指导 |
| 视觉质量 | 30% | 生成结果的整体视觉/美学质量 |
| 输入一致性 | 25% | 结果与参考输入图像之间的一致性 |
最终得分为三个维度的加权和。若知识推理得分 ≤ 2,最终得分额外乘以 0.6 作为事实/知识错误的惩罚。
评估方式
- 通用/实用:每个样本一次 VLM 调用,发送
[参考图像..., 结果, 评分提示],解析各维度分数 - 智能:采用分步调用策略,每个维度单独进行 VLM 调用,使评判者聚焦单一维度,评分更可靠
核心功能
- 断点续跑:评估中断后重跑可跳过已评分样本
- 多密钥轮换:支持多个 API 密钥分配请求,避免速率限制
- 并发评分:通过
--workers参数控制并行度 - 自定义 VLM 端点:支持任意 OpenAI 兼容 API
许可证
CPI-Bench 采用 CC BY-NC-ND 4.0 许可证:
- ✅ 仅限学术研究使用
- ❌ 禁止商业用途





