遇见数据集

Uni-Edit-148k

收藏
arXiv2026-05-21 更新2026-05-22 收录
数据链接:
官方服务:

资源简介:

Uni-Edit-148k是由香港中文大学多媒体实验室等机构构建的智能图像编辑数据集,旨在通过单一任务统一提升多模态模型的理解、生成与编辑能力。该数据集包含14.8万条高质量样本,每条数据由复杂的推理密集型编辑指令与对应编辑后的图像组成,其指令源自LLaVA-OneVision-1.5的视觉问答数据,并利用Nano-Pro生成目标图像,再经GPT-4o严格筛选确保逻辑一致性与视觉美感。该数据集主要应用于多模态模型的统一调优,通过将视觉理解任务转化为嵌入式逻辑的编辑指令,有效解决了传统多任务训练中理解与生成能力冲突的难题,为模型实现全面协同增强提供了创新解决方案。

Uni-Edit-148k is an intelligent image editing dataset developed by the Multimedia Laboratory of The Chinese University of Hong Kong and other institutions, aiming to uniformly enhance the understanding, generation, and editing capabilities of multimodal models via a single task. This dataset contains 148,000 high-quality samples, each consisting of complex reasoning-intensive editing instructions and their corresponding edited images. The editing instructions are derived from the visual question answering data of LLaVA-OneVision-1.5, and target images are generated using Nano-Pro, followed by strict screening via GPT-4o to ensure logical consistency and visual aesthetics. This dataset is primarily applied to the unified fine-tuning of multimodal models. By transforming visual understanding tasks into editing instructions with embedded logic, it effectively resolves the conflict between understanding and generation capabilities in traditional multi-task training, providing an innovative solution for comprehensive collaborative enhancement of models.

创建时间:
2026-05-21
搜集汇总
数据集介绍
Uni-Edit-148k 数据集图片
构建方式
在统一多模态模型(UMM)领域,现有方法依赖混合多任务训练,但任务间的内在冲突常导致性能权衡而非协同提升。Uni-Edit-148k的构建源自一种全新视角:将图像编辑重塑为一项通用智能编辑任务,以单一数据集同时增强理解、生成与编辑能力。其构建流程首先从LLaVA-OV1.5中采集多样化VQA数据,并利用GPT-4o将其分类为形状、颜色、计数、定位、OCR、描述与数学等七个领域。随后,针对每个类别,设计特定提示模板,将原始问题嵌入具有嵌套逻辑的编辑指令中,迫使模型在编辑前先解决推理问题。最终,借助Nano-Pro模型生成目标图像,并经由GPT-4o依据指令遵循度、视觉美学与逻辑一致性进行严格过滤,从而汇聚成包含14.8万条高质量样本的数据集。
特点
Uni-Edit-148k的核心特质在于其指令的智能性与知识覆盖的广度。与传统编辑数据依赖简单操作不同,该数据集将理解任务转化为具有推理密度的编辑指令,要求模型在执行编辑前先解析隐含问题,实现了理解与生成任务在训练中的自然平衡。其指令涵盖数学推理、空间定位、世界知识等多维认知领域,使得模型在单一任务训练中即可接触广泛知识,有效规避了灾难性遗忘。此外,数据构建管道具备高度可扩展性,能够无缝适配任意理解数据集,为持续注入新知识提供了通道。这一设计使得Uni-Edit-148k成为首个能够同时提升UMM三项核心能力的通用训练数据,打破了以往处理、编辑与理解数据各自为政的局限。
使用方法
使用Uni-Edit-148k时,研究者可以将其直接应用于统一多模态模型的后训练阶段。训练流程分为两个阶段:第一阶段,遵循BAGEL的编辑配置,但将VAE特征丢弃率设为1,迫使模型依赖ViT特征以强化理解能力;第二阶段,利用8万条理解样本仅微调语言建模头,以消除因理解骨干更新带来的域间隙。该数据集兼容自回归与扩散两种架构,在BAGEL与Janus-Pro等模型上均验证了其有效性。进阶用户可依据任务需求,从完整的14.8万版本中精选出针对特定模型优化的40k子集,或参考消融研究调整各类数据的采样比例,从而在理解、生成与编辑三项能力间实现最优均衡。
背景与挑战
背景概述
在统一多模态模型(UMM)的研究版图中,如何使单一模型同时具备视觉理解、图像生成与编辑能力,始终是通往通用人工智能的关键隘口。2025年,来自香港中文大学MMLab、天津大学与中国科学技术大学的研究团队,以打破传统多任务混合训练中固有的性能权衡困境为初衷,提出了名为Uni-Edit的智能图像编辑范式。该数据集由郑典、张曼媛等核心成员主导创建,核心研究问题聚焦于:能否以一种通用任务,在单数据集、单训练阶段内同步提升模型在理解、生成与编辑三个维度上的表现。Uni-Edit-148k的出现,为UMM领域提供了一种数据设计的新思路,其自动化、可扩展的数据合成管线尤为引人注目,显著拓展了编辑数据在统一模型微调中的理论边界与应用潜力。
当前挑战
该数据集所应对的核心领域挑战在于,理解与生成任务对网络深层信息的粒度需求截然相反,传统混合多任务训练依赖复杂的多阶段流程与精细的数据配比,却仅能达成性能的折中而非真正的相互增强。此外,现有编辑数据集普遍依赖过于简化的指令,严重低估了模型的语义理解潜能。在数据构建过程中,研究团队面临两大难题:其一,视觉理解任务形式多样(如多项选择、填空、描述等),需将每类问答精准转化为蕴含推理逻辑的编辑指令;其二,为确保单一编辑训练能同步提升三项能力,生成的指令必须兼具广泛世界知识与复杂嵌套逻辑,这对数据合成与质量筛选提出了极高要求,最终借助GPT-4o与Nano-Pro的协同过滤与生成才得以实现。
常用场景
经典使用场景
在统一多模态模型的微调领域,Uni-Edit-148k最为经典的使用场景是作为单一通用任务数据集,替代传统复杂的多任务混合训练策略。研究者将视觉问答数据转化为蕴含推理链的智能编辑指令,配合高质量编辑图像,使模型在单一训练阶段中同时提升视觉理解、图像生成与编辑三项能力。该数据集覆盖形状、颜色、计数、空间定位、数学推理、OCR、图像描述及世界知识等广泛领域,为评估模型在复杂跨模态任务中的综合表现提供了理想的测试平台。
解决学术问题
该数据集有效解决了统一多模态模型中理解与生成任务间的根本性冲突问题。传统多任务混合训练因任务对抗需要复杂的数据配比与多阶段调优,往往仅能达到性能权衡而非真正的相互增益。Uni-Edit-148k通过将理解问题嵌入编辑指令,迫使模型在解决潜在问题后方可执行编辑操作,从而在单一任务框架内实现了理解、生成与编辑能力的协同提升。这一突破为后训练阶段无需修改架构即可全面提升模型性能提供了新范式,显著降低了统一模型训练的复杂度与资源消耗。
衍生相关工作
基于Uni-Edit-148k所提出的智能编辑范式,已衍生出一系列重要工作。在数据构建方面,其自动化合成流水线(包括GPT-4o分类、Nano-Pro编辑生成与质量过滤)为后续高复杂度编辑数据集的设计树立了技术标杆。在模型训练方面,BAGEL框架上的两阶段微调策略(含VAE特征丢弃与理解头对齐)被后续研究广泛借鉴。此外,该工作对不同编辑类型(属性、位置、数学、知识等)对理解与生成能力的差异化影响所进行的系统消融实验,为统一模型的数据配比优化提供了重要的理论指导与实验依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务