遇见数据集

VINS-120K

收藏
Hugging Face2026-06-04 更新2026-06-05 收录
官方服务:

资源简介:

VINS-120K是一个用于指令引导的超高分辨率图像编辑的大规模数据集,包含120K个精心筛选的编辑三元组,每个样本由源图像、编辑后目标图像和英文编辑指令组成。所有图像分辨率不低于4K,覆盖13种编辑类型,包括局部编辑、全局编辑、相机移动和个性化生成。数据来源于真实世界的超高分辨率视频和高质量开源编辑数据,经过多阶段过滤以确保视觉质量、指令对齐和美学保真度。数据集结构上,每个标注条目包含编辑类型、源图像相对路径、编辑后图像相对路径和英文指令。训练数据分为nano-consistent、ultravideo和x2edit三个部分,对应三个JSON标注文件。此外,数据集提供了名为VINS-4KEval的评测基准,包含509个精心挑选的4K/UHR测试样本,用于评估指令引导的超高分辨率图像编辑模型的性能,重点关注指令遵循、结构保持和细节质量。数据集采用Apache License 2.0许可发布。

VINS-120K is a large-scale dataset for instruction-guided ultra-high-resolution image editing, containing 120K carefully curated editing triplets, each consisting of a source image, an edited target image, and an English editing instruction. All images are in ultra-high resolution, with a resolution of at least 4K. The dataset covers 13 editing types, including local editing, global editing, camera movement, and personalized generation. Data is sourced from real-world ultra-high-resolution videos and high-quality open-source editing data, and undergoes multi-stage filtering to ensure visual quality, instruction alignment, and aesthetic fidelity. In terms of structure, each annotation entry includes the editing type, relative path of the source image, relative path of the edited image, and the English instruction. The training data is divided into three parts: nano-consistent, ultravideo, and x2edit, corresponding to three JSON annotation files. Additionally, the dataset provides an evaluation benchmark called VINS-4KEval, which includes 509 carefully selected 4K/UHR test samples for assessing the performance of instruction-guided ultra-high-resolution image editing models, with a focus on instruction following, structure preservation, and detail quality. The dataset is released under the Apache License 2.0.

创建时间:
2026-05-28
原始信息汇总

数据集概述

VINS-120K 是一个面向指令式超高清图像编辑的大规模数据集,旨在支持基于文本指令的、分辨率不低于 4K 的高质量图像编辑任务。

  • 规模:包含 120,000 个精心构建的编辑三元组,每个样本由源图像、编辑后的目标图像和英文编辑指令组成。
  • 分辨率:所有图像均为超高清图像,分辨率不低于 4K
  • 编辑类型:覆盖 13 种编辑类型,涵盖局部编辑、全局编辑、相机运动以及个性化生成。
  • 数据来源:基于真实世界的超高清视频和高质量开源编辑数据构建,并通过多阶段筛选以确保视觉质量、指令对齐和美学保真度。

数据集结构

每个注释条目遵循以下格式:

  • edit_type:编辑类别
  • input:源图像的相对路径
  • output:编辑后图像的相对路径
  • instruction:英文编辑指令

训练数据分为三个部分:

  • nano-consistent/
  • ultravideo/
  • x2edit/

对应的注释文件为:

  • nano-consistent.json
  • ultravideo.json
  • x2edit.json

数据文件

仓库包含图像归档文件和 JSON 注释文件,目录结构如下:

. ├── nano-consistent/ │ ├── Image.tar.split.000 │ ├── Image.tar.split.001 │ ├── ... │ └── Image.tar.split.012 ├── ultravideo/ │ ├── clips_short_.tar │ └── ... ├── x2edit/ │ ├── 0.tar.split. │ ├── 1.tar.split.* │ ├── ... │ └── 7.tar.split.* ├── nano-consistent.json ├── ultravideo.json ├── x2edit.json ├── benchmark.tar └── assets/ └── vins120k_overview.jpg

基准测试:VINS-4KEval

数据集还提供了名为 VINS-4KEval 的基准测试集,包含 509 个精心挑选的 4K/UHR 测试样本,覆盖与 VINS-120K 相同的 13 种编辑类型,用于评估模型在超高清图像编辑方面的指令跟随、结构保持和细节质量。

许可证

该数据集采用 Apache License 2.0 许可发布。

引用

bibtex @inproceedings{chen2026vins, title={VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset}, author={Chen, Zhizhou and Guan, Shanyan and Gao, Zhanxin and Ci, En and Ge, Yanhao and Li, Wei and Zhang, Zhenyu and Yang, Jian and Tai, Ying}, booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition}, pages={15302--15312}, year={2026} }

搜集汇总
数据集介绍
VINS-120K 数据集图片
构建方式
VINS-120K数据集专为基于指令的超高分辨率图像编辑任务而构建,其数据来源涵盖真实世界超高清视频与高质量开源编辑数据。研究团队通过多阶段筛选流程,对源图像、编辑后目标图像及英文编辑指令三元组进行严格质量控制,最终精心整理了120,000个样本。构建过程中,数据集整合了来自nano-consistent、ultravideo和x2edit三个子集的数据,每个样本均以JSON格式标注编辑类型、图像路径与指令描述,确保了数据在视觉质量、指令对齐与美学保真度上的卓越表现。
特点
该数据集的核心特点在于其图像分辨率均不低于4K,覆盖了局部编辑、全局编辑、相机运动及个性化生成四大类别共13种编辑类型。每个样本由源图像、编辑目标图像与英文指令构成完整三元组,支持指令型图像编辑模型的训练与评估。此外,VINS-120K还包含VINS-4KEval基准测试集,含有509个精心挑选的4K样本,专门用于评估模型在指令遵循、结构保持及细节质量方面的性能,为超高清图像编辑领域提供了权威的评测标准。
使用方法
使用者可通过Hugging Face或ModelScope平台获取数据集,数据以分片tar压缩包与JSON注释文件形式组织。提取训练数据时,需先将nano-consistent、ultravideo及x2edit子集的tar分片合并并解压缩至指定目录:运行`cat`命令合并分片后使用`tar -xf`解压,ultravideo子集则无需合并直接循环解压各独立tar包。基准测试集benchmark.tar可直接解压使用。注释文件如nano-consistent.json等可直接加载,用于配对图像与指令进行模型训练或推理。
背景与挑战
背景概述
高分辨率图像编辑是计算机视觉与图形学交叉领域的重要研究方向,其核心目标是在保持图像结构完整性的同时实现精细的局部或全局修改。近年来,随着扩散模型等生成式方法的飞速发展,基于指令的图像编辑技术取得了显著突破,然而现有研究大多局限于低分辨率图像,难以满足极端高清晰度场景下的应用需求。在此背景下,由南京大学PCALab与vivo研究团队于2026年联合发布的VINS-120K数据集应运而生。该数据集包含120K精心构建的编辑三元组,每份样本均由4K及以上超高清源图像、编辑后目标图像及英文编辑指令构成,覆盖局部编辑、全局修改、相机运动与个性化生成等13种编辑类型。VINS-120K的提出填补了超高分辨率指令驱动图像编辑领域的规模化数据空白,为相关模型的训练与评估提供了坚实基准,在CVPR 2026上发表后迅速成为该方向的重要参考资源。
当前挑战
VINS-120K数据集的构建与研究所面临的挑战主要体现在两个层面。在领域问题层面,现有基于指令的图像编辑模型在超高清场景下往往面临细节保真度与指令一致性难以兼得的困境——图像分辨率提升至4K及以上时,纹理细节的精确保持与全局语义的准确操控相互制约,导致模型易出现伪影、模糊或编辑错位等问题。在数据集构建层面,团队需克服来自不同来源的原始视频与图像数据在分辨率、光照、视角等方面的巨大差异,通过多阶段过滤与人工校验确保样本的视觉质量、指令对齐度及美学保真度;此外,13种编辑类别的均衡覆盖与三元组中‘源-目标-指令’的严格对应关系也要求精细的数据筛选与标注流程,这对大规模数据管道的设计提出了严苛挑战。
常用场景
经典使用场景
在超高分辨率图像编辑领域,VINS-120K 数据集作为基于指令编辑的标准训练资源,广泛用于驱动模型学习如何依据自然语言描述对 4K 及以上分辨率的图像进行精细操作。研究者常利用该数据集中的 12 万组编辑三元组(源图、目标图与指令),训练模型掌握局部编辑、全局编辑、相机运动及个性化生成等 13 类编辑类型,从而提升模型在保持原始图像结构的同时执行精准编辑的能力。
实际应用
在产业界,VINS-120K 数据集直接赋能专业图像处理软件与内容创作平台,支持用户通过自然语言指令实现高分辨率图像的局部修复、风格迁移、物体替换及视角调整等操作。例如,在影视后期制作中,编辑人员可借助基于该数据集训练的模型快速调整 4K 视频帧中的元素;在电商广告与虚拟现实场景中,设计师能高效生成符合特定描述的视觉素材,大幅提升创作效率与输出质量。
衍生相关工作
基于 VINS-120K 数据集,学术界衍生出多项标志性工作,包括 VINS-4KEval 基准测试的建立,该基准提供了 509 组 4K 测试样本,系统评估编辑模型在指令跟随、结构保持与细节质量上的表现。此外,研究者进一步探索了基于该数据集的扩散模型改进方案,如引入注意机制增强全局编辑稳定性,并开发了用于个性化生成的高效微调策略,这些工作共同推动了超高分辨率图像编辑从实验室走向实用化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务