UniKE
收藏资源简介:
UniKE是首个用于统一多模态模型中跨模态知识编辑的基准数据集,包含2,971个编辑主题,涵盖属性和关系编辑,通过基于VQA的视觉验证来评估知识编辑效果。
UniKE is the first benchmark dataset dedicated to cross-modal knowledge editing in unified multimodal models. It comprises 2,971 editing topics covering both attribute editing and relation editing, and uses VQA-based visual validation to evaluate the effectiveness of knowledge editing.
数据集概述:UniKE
UniKE 是首个面向统一多模态模型(UMMs)的跨模态知识编辑基准测试,旨在评估文本知识编辑能否泛化到视觉生成任务。该数据集包含 2,971 个编辑主题,涵盖属性编辑(Attribute)和关系编辑(Relation)两类。
-
核心发现:文本侧编辑有效性(Eff.)可达约 92%,而直接图像生成下的最佳 VQA 准确率仅为 18.5%。为此,论文提出推理增强参数编辑(Reasoning-Augmented Parameter Editing),在生成前显式激活编辑后的知识,显著提升所有模型-方法组合的 VQA 准确率。
-
数据来源与获取:数据集文件
UniKE.json可从 HuggingFace 数据集页面 下载,需放置于本地data/目录下。还需下载缓存的零空间投影器和协方差统计文件。 -
数据规模与格式:数据集为 JSON 格式,包含属性与关系编辑案例,用于文本编辑验证和 VQA 视觉验证。所有脚本默认读取
data/UniKE.json。
主要实验结果
评估指标:Eff.(文本编辑有效性)、Reason.(推理增强后的 VQA 准确率)、VQA(直接图像生成下的 VQA 准确率)。实验在 Ovis-U1、BLIP3o-4B、OmniGen2 三种模型上,应用 MEMIT、PMET、AlphaEdit 方法进行测试。
- 直接图像生成(Direct):
- 最佳 VQA 准确率来自 BLIP3o-4B + PMET(Overall VQA: 18.51%)。
- 属性编辑 VQA 准确率普遍低于关系编辑。
- 推理增强(Reasoning-Augmented):
- 所有方法在推理增强后 VQA 准确率显著提升。
- Ovis-U1 + PMET 达到最佳 Overall VQA(28.32%),Eff. 为 72.18%,Reason. 为 53.57%。
- 关系编辑的 VQA 提升幅度通常大于属性编辑。
数据集存储结构
UniKE/ ├── data/ # 数据集存放目录(需手动下载 UniKE.json) ├── AlphaEdit/ # AlphaEdit 算法实现 ├── memit/ # MEMIT 算法实现 ├── pmet/ # PMET 算法实现 ├── rome/ # 共享工具(repr_tools, layer_stats) ├── BLIP3o/ # BLIP3o 模型代码 ├── OmniGen2/ # OmniGen2 模型代码 ├── dsets/ # 数据加载模块 ├── experiments/ # 评估框架 ├── scripts/ # 流水线脚本(推理、图像生成、VQA 评判) ├── interpretability/ # 可解释性分析实验 ├── hparams/ # 各模型的超参数配置 ├── util/ # 共享工具函数 ├── run_all.sh # 完整流水线脚本 ├── run_edit.sh # 仅知识编辑 ├── run_reasoning.sh # 仅推理生成(vLLM) ├── run_images.sh # 仅图像生成 └── run_judge.sh # 仅 VQA 评判(OpenRouter API)
快速使用
- 安装环境:
- 硬件要求:至少 48 GB VRAM 的 GPU。
- 使用
install.sh创建unike和vllm两个 conda 环境(Python 3.10 + torch 2.4)。 - 需手动安装匹配的
flash_attn预编译 wheel。
- 下载数据:
- 数据集:
huggingface-cli download gxx27/UniKE UniKE.json --repo-type dataset --local-dir data - 缓存文件:从指定 URL 下载并解压到对应目录。
- 数据集:
- 运行流水线:
- 完整执行:
bash run_all.sh(需要设置OPENROUTER_API_KEY)。 - 分阶段执行:分别调用
run_edit.sh、run_reasoning.sh、run_images.sh、run_judge.sh。
- 完整执行:
- 可解释性分析:运行
interpretability/run_all.sh --num_cases 100。
引用
bibtex @misc{gao2026texteditsgeneralizevisual, title={Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs}, author={Xin Gao and Cheng Yang and Chufan Shi and Taylor Berg-Kirkpatrick}, year={2026}, eprint={2606.00477}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2606.00477}, }




