遇见数据集

UniKE

收藏
github2026-06-04 更新2026-06-11 收录
数据链接:
官方服务:

资源简介:

UniKE是首个用于统一多模态模型中跨模态知识编辑的基准数据集,包含2,971个编辑主题,涵盖属性和关系编辑,通过基于VQA的视觉验证来评估知识编辑效果。

UniKE is the first benchmark dataset dedicated to cross-modal knowledge editing in unified multimodal models. It comprises 2,971 editing topics covering both attribute editing and relation editing, and uses VQA-based visual validation to evaluate the effectiveness of knowledge editing.

创建时间:
2026-06-03
原始信息汇总

数据集概述:UniKE

UniKE 是首个面向统一多模态模型(UMMs)的跨模态知识编辑基准测试,旨在评估文本知识编辑能否泛化到视觉生成任务。该数据集包含 2,971 个编辑主题,涵盖属性编辑(Attribute)和关系编辑(Relation)两类。

  • 核心发现:文本侧编辑有效性(Eff.)可达约 92%,而直接图像生成下的最佳 VQA 准确率仅为 18.5%。为此,论文提出推理增强参数编辑(Reasoning-Augmented Parameter Editing),在生成前显式激活编辑后的知识,显著提升所有模型-方法组合的 VQA 准确率。

  • 数据来源与获取:数据集文件 UniKE.json 可从 HuggingFace 数据集页面 下载,需放置于本地 data/ 目录下。还需下载缓存的零空间投影器和协方差统计文件。

  • 数据规模与格式:数据集为 JSON 格式,包含属性与关系编辑案例,用于文本编辑验证和 VQA 视觉验证。所有脚本默认读取 data/UniKE.json

主要实验结果

评估指标:Eff.(文本编辑有效性)、Reason.(推理增强后的 VQA 准确率)、VQA(直接图像生成下的 VQA 准确率)。实验在 Ovis-U1、BLIP3o-4B、OmniGen2 三种模型上,应用 MEMIT、PMET、AlphaEdit 方法进行测试。

  • 直接图像生成(Direct)
    • 最佳 VQA 准确率来自 BLIP3o-4B + PMET(Overall VQA: 18.51%)。
    • 属性编辑 VQA 准确率普遍低于关系编辑。
  • 推理增强(Reasoning-Augmented)
    • 所有方法在推理增强后 VQA 准确率显著提升。
    • Ovis-U1 + PMET 达到最佳 Overall VQA(28.32%),Eff. 为 72.18%,Reason. 为 53.57%。
    • 关系编辑的 VQA 提升幅度通常大于属性编辑。

数据集存储结构

UniKE/ ├── data/ # 数据集存放目录(需手动下载 UniKE.json) ├── AlphaEdit/ # AlphaEdit 算法实现 ├── memit/ # MEMIT 算法实现 ├── pmet/ # PMET 算法实现 ├── rome/ # 共享工具(repr_tools, layer_stats) ├── BLIP3o/ # BLIP3o 模型代码 ├── OmniGen2/ # OmniGen2 模型代码 ├── dsets/ # 数据加载模块 ├── experiments/ # 评估框架 ├── scripts/ # 流水线脚本(推理、图像生成、VQA 评判) ├── interpretability/ # 可解释性分析实验 ├── hparams/ # 各模型的超参数配置 ├── util/ # 共享工具函数 ├── run_all.sh # 完整流水线脚本 ├── run_edit.sh # 仅知识编辑 ├── run_reasoning.sh # 仅推理生成(vLLM) ├── run_images.sh # 仅图像生成 └── run_judge.sh # 仅 VQA 评判(OpenRouter API)

快速使用

  1. 安装环境
    • 硬件要求:至少 48 GB VRAM 的 GPU。
    • 使用 install.sh 创建 unikevllm 两个 conda 环境(Python 3.10 + torch 2.4)。
    • 需手动安装匹配的 flash_attn 预编译 wheel。
  2. 下载数据
    • 数据集:huggingface-cli download gxx27/UniKE UniKE.json --repo-type dataset --local-dir data
    • 缓存文件:从指定 URL 下载并解压到对应目录。
  3. 运行流水线
    • 完整执行:bash run_all.sh(需要设置 OPENROUTER_API_KEY)。
    • 分阶段执行:分别调用 run_edit.shrun_reasoning.shrun_images.shrun_judge.sh
  4. 可解释性分析:运行 interpretability/run_all.sh --num_cases 100

引用

bibtex @misc{gao2026texteditsgeneralizevisual, title={Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs}, author={Xin Gao and Cheng Yang and Chufan Shi and Taylor Berg-Kirkpatrick}, year={2026}, eprint={2606.00477}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2606.00477}, }

搜集汇总
数据集介绍
UniKE 数据集图片
构建方式
UniKE数据集是专为统一多模态模型跨模态知识编辑设计的首个基准测试。其构建过程以编辑主体为核心,涵盖2,971个编辑案例,这些案例被系统地划分为属性编辑与关系编辑两大类型,每个案例包含文本侧编辑对象及其期望修改后的视觉输出标准。为确保评估的全面性,研究者利用基于视觉问答的视觉验证机制,对模型生成的图像进行自动化语义核验,从而量化知识编辑在视觉侧的泛化能力。整个构建流程从多模态大模型中提取广泛的知识实体,通过人工与自动结合的方式标注编辑目标与视觉验证答案,最终形成一个结构化的基准数据集。
使用方法
使用UniKE数据集需遵循标准化流程。首先从HuggingFace下载UniKE.json文件并置于本地data目录;同时需获取预计算的零空间投影器与协方差统计缓存文件。硬件上要求至少48 GB显存的GPU以支撑模型编辑与图像生成任务。数据集配套完整代码库,提供一键式完整流水线脚本,也可分阶段运行知识编辑、推理增强生成、图像生成及VQA评判等子流程。评判阶段依赖OpenRouter API进行VQA评估,用户需配置API密钥。此外,数据集还支持机械论可解释性分析实验,便于深入探索编辑机制。
背景与挑战
背景概述
UniKE是由加州大学圣地亚哥分校的研究团队于2026年提出的首个面向统一多模态模型(UMMs)的跨模态知识编辑基准。该研究聚焦于文本知识编辑能否有效迁移至视觉生成这一核心问题,通过构建包含2,971个编辑主题(涵盖属性和关系两类编辑)的数据集,系统评估了多模态模型在视觉问答(VQA)任务中的知识更新能力。这一开创性工作揭示了模态间存在显著的性能差距——文本侧编辑效能可达约92%,而直接图像生成场景下的最佳VQA准确率仅为18.5%,为理解多模态模型的知识表征与泛化机制提供了重要参考。
当前挑战
UniKE面临的核心挑战在于弥合文本编辑与视觉生成之间的模态鸿沟。领域层面,现有知识编辑方法主要针对纯语言模型设计,难以直接适配多模态场景中图像与文本的异构表征对齐;模型在完成文本侧编辑后,其视觉生成能力几乎不受益,暴露出多模态知识分布的割裂性。构建过程中,研究人员需处理跨模态数据的高质量标注难题,确保2,971个编辑主题在属性和关系维度上的语义一致性,同时设计合理的视觉验证流程以消除图像生成中的随机性干扰。此外,统一多模态模型架构差异(如共享骨干网络与独立编码器)导致编辑算法难以通用,需要为不同模型定制修改策略,极大增加了基准构建的复杂度。
常用场景
经典使用场景
在统一多模态模型(UMMs)的研发与评估领域,UniKE作为首个跨模态知识编辑标准基准,被广泛应用于验证文本编辑是否能够迁移至视觉生成任务。研究者利用其包含2971个编辑主体、涵盖属性和关系两类编辑类型的数据集,通过基于VQA的视觉验证流程,系统性地评测不同知识编辑方法(如MEMIT、PMET、AlphaEdit)在模型文本侧和图像生成侧的编辑效果。该数据集成为衡量多模态模型知识泛化能力的核心测试平台,尤其适用于揭示文本编辑与视觉表现之间存在的模态鸿沟。
解决学术问题
UniKE有效解决了多模态领域中知识编辑的跨模态泛化评估缺失这一关键学术问题。在以往研究中,知识编辑方法主要聚焦于纯语言模型或单模态场景,而多模态模型接受的文本编辑是否能同步反映于生成的图像内容,一直缺乏系统量化的验证手段。UniKE通过引入VQA视觉验证指标,揭示了高达92%的文本侧编辑效率与仅18.5%的最佳图像生成VQA准确率之间的显著差距,这一发现为学界清晰描绘了模态不对齐的困境,并推动了对跨模态知识编辑理论与方法的深入探索。
实际应用
在实际应用中,UniKE为企业与开发者提供了评估和优化多模态模型可编辑性的可靠工具。当需要对模型中的特定知识进行更新或修正(例如修改对象的外观属性或实体间关系)时,文本编辑通常是最简便的操作方式。UniKE能够直观检验这些文本层面的修改是否能够正确反映于后续生成的图像中,从而确保视觉输出与文本修正保持一致。这在内容创作、智能设计、虚拟助手等依赖图像生成的产品中具有重要价值,有助于提升模型输出的准确性与可控性。
数据集最近研究
最新研究方向
UniKE基准数据集聚焦于统一多模态模型中的跨模态知识编辑前沿方向,揭示了文本编辑在视觉生成任务中的模态鸿沟现象。研究发现文本侧编辑效能可达92%,但直接应用于图像生成时视觉问答准确率仅18.5%,凸显了跨模态知识迁移的严峻挑战。针对这一瓶颈,研究提出了推理增强参数编辑策略,通过显式激活编辑知识显著提升了多模态模型的视觉生成表现,为构建更可靠的多模态人工智能系统开辟了新路径。该工作与当前大模型知识编辑的热点紧密相关,对推动多模态基础模型的实用化发展具有重要科学价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务