遇见数据集

co-instruct-plus

收藏
Hugging Face2026-08-31 更新2026-09-01 收录
官方服务:

资源简介:

Co-Instruct-Plus 是一个面向 Qwen3-VL 模型的两阶段训练数据集,包含图像到文本和视觉问答任务。数据集分为两个阶段:第一阶段(SFT)包含 912,826 个样本,涵盖九组 JSON 注释文件(包括 coinstruct_562k_t2c.json);第二阶段(评分)基于 KonIQ-10K 数据集进行在线配对训练,使用约 7,046 张训练图像。此外,数据集还提供了多个图像质量评估(IQA)基准测试集的评估元数据,包括 LIVE、CSIQ、KADID-10K、BID、CLIVE、KonIQ-10K、TID2013、AGIQA-3K、PIPAL 和 SPAQ(SPAQ 图像需单独下载)。数据以 JSON 注释文件和打包的 tar 图片归档形式发布,提取后目录结构符合训练脚本要求。注释文本仅用于研究目的,底层图像版权归各自原始数据集所有。

Co-Instruct-Plus is a two-stage training dataset for the Qwen3-VL model, containing image-to-text and visual question answering tasks. The dataset is divided into two stages: the first stage (SFT) includes 912,826 samples covering nine sets of JSON annotation files (including coinstruct_562k_t2c.json); the second stage (scoring) is based on the KonIQ-10K dataset for online paired training, using approximately 7,046 training images. Additionally, the dataset provides evaluation metadata for multiple image quality assessment (IQA) benchmark datasets, including LIVE, CSIQ, KADID-10K, BID, CLIVE, KonIQ-10K, TID2013, AGIQA-3K, PIPAL, and SPAQ (SPAQ images need to be downloaded separately). The data is released as JSON annotation files and packaged tar image archives, with the directory structure after extraction meeting the requirements of training scripts. The annotation text is for research purposes only, and the underlying images are copyrighted by their respective original datasets.

创建时间:
2026-08-24
原始信息汇总

Co-Instruct-Plus 数据集概述

基本信息

  • 许可证: 其他(自定义许可)
  • 任务类型: 图像到文本、视觉问答
  • 语言: 英语
  • 数据规模: 100K < n < 1M
  • 模型关联: 用于训练 Co-Instruct-Plus(基于 Qwen3-VL 的两阶段训练模型)
  • 权重文件: 位于 yluo060/Co-instruct__(不在此数据集中)

数据内容与结构

数据打包

  • 数据集包含 JSON 注释文件和元数据,图像以未压缩的 .tar 归档存放
  • 运行 hf download yluo016/co-instruct-plus --repo-type dataset --local-dir co-instruct-plus 下载后需解压三个图像归档

目录结构

  • annotations/: 阶段一 JSON 注释
  • data/: 阶段一图像
  • koniq10k/512x384/: 阶段二 KonIQ 图像
  • koniq10k/metas/train_koniq_7k.json: 阶段二训练元数据
  • KONIQ/metas/: mos.json、split.json、test_koniq_2k.json
  • 测试基准目录: LIVE、CSIQ、KADID10K、BID、CLIVE、TID2013、AGIQA3K、PIPAL、SPAQ

阶段一(SFT)

  • 九个 JSON 文件列表,共 912,826 个样本
  • 包含 coinstruct_562k_t2c.json

阶段二(评分)

  • 仅为 KonIQ 在线配对数据,使用 koniq10k/metas/train_koniq_7k.json(约 7,046 张训练图像)
  • 不含 pairs_180k.json

测试基准

  • 提供 LIVE、CSIQ、KADID-10K、BID、CLIVE、KonIQ、TID2013、AGIQA-3K、PIPAL、SPAQ 的评估元数据
  • 注意: SPAQ 图像未包含在内,需自行下载官方 SPAQ 图像并设置 SPAQ_IMAGES_DIR
  • KonIQ 测试 JSON 使用 KONIQ/images/... 路径,需将 KONIQ_IMAGES_DIR 指向 koniq10k/512x384

许可说明

  • 仓库中的注释文本仅供研究使用
  • 底层图像版权归各自来源所有(KonIQ-10K、KADIS/KADID、LIVE、CSIQ、BID、CLIVE/LIVE-Challenge、TID2013、PIPAL、SPAQ、AGIQA-3K 等)
  • 重新分发或商业使用前需获得各来源的授权
搜集汇总
数据集介绍
co-instruct-plus 数据集图片
构建方式
Co-Instruct-Plus数据集专为多模态视觉语言模型(如Qwen3-VL)的指令微调与图像质量评估任务而设计,其构建过程遵循两阶段训练协议。第一阶段采用监督微调(SFT)范式,整合了九个JSON列表,共计912,826条样本,涵盖多样化的视觉语言对齐任务。第二阶段则聚焦于KonIQ-10K基准,利用约7,046张训练图像进行在线配对策略,生成用于质量评分训练的样本对。数据集内的图像以未压缩的tar归档形式存储,并配有详尽的元数据与分割文件,确保训练与评估流程的便捷复现。
特点
该数据集融合大规模指令数据与专业图像质量评估(IQA)基准,兼具广度与精度。其特色在于两阶段设计:第一阶段提供近百万条SFT样本,支持模型在多样化任务上的微调;第二阶段专门针对KonIQ-10K进行评分训练,兼顾真实世界失真类型。评估部分覆盖十个主流IQA基准(LIVE、CSIQ、KADID-10K等),并配备标准化的评估脚本与元数据,便于跨数据集性能对比。此外,数据组织结构化,支持灵活的环境变量配置,促进了研究的可重复性。
使用方法
使用该数据集需先通过HuggingFace CLI下载仓库,并解压归档文件以恢复图像与元数据布局。随后,依据训练脚本设置环境变量(如IMAGE_FOLDER、ANNOTATIONS_DIR、ROOT_DATA),使路径指向解压后的目录。对于第一阶段,利用annotations下的JSON文件进行模型微调;第二阶段则使用koniq10k/metas/train_koniq_7k.json构建训练对。评估时,运行eval_iqa.sh脚本,但需注意SPAQ图像需单独下载并设置SPAQ_IMAGES_DIR,同时确保KonIQ测试路径正确映射至512x384尺寸的图像目录。
背景与挑战
背景概述
Co-Instruct-Plus数据集由研究机构于近期创建,旨在推动图像质量评估(IQA)与多模态视觉语言模型的发展。该数据集以Qwen3-VL为基座,采用两阶段训练策略,整合了超过91万条指令样本,并覆盖了包括KonIQ-10K、LIVE、CSIQ在内的多个主流IQA基准,为视觉问答与图像质量评分提供了统一的数据支撑。其核心研究问题在于如何通过大规模多模态指令微调提升模型对图像质量的感知与理解能力,进而增强模型的泛化性与实用性。该数据集的发布为视觉语言模型在图像质量评估领域的应用提供了新范式,对相关研究具有重要推动作用。
当前挑战
Co-Instruct-Plus数据集在构建与应用中面临多重挑战。首先,在数据整合层面,需统一来自不同来源、格式各异的图像质量标注,并处理数据集间的分布差异,以确保模型训练的稳定性和泛化能力。其次,训练过程中需设计有效的两阶段微调策略,平衡大规模指令数据与评分数据的学习效率,避免灾难性遗忘。此外,图像版权与许可问题亦是一大难题,数据集中包含的多个基准图像版权不一,需在保持研究可用性的同时规避法律风险。最后,面对SPAQ等外部数据集图像缺失的局限,需提供灵活的数据加载接口,确保评测流程的完整性。这些挑战共同构成了该数据集持续优化与扩展的关键方向。
常用场景
经典使用场景
Co-Instruct-Plus数据集是面向图像到文本及视觉问答任务精心构建的大规模指令微调资源,其核心价值在于为多模态大语言模型提供高质量的两阶段训练语料。研究者利用其丰富的标注样本,可开展视觉指令跟随模型的监督微调,或针对图像质量评估任务进行偏好对齐,从而提升模型在复杂视觉场景下的理解与生成能力。该数据集尤其适用于需要精细感知图像内容并生成自然语言描述的场景,是验证和优化视觉语言模型性能的基准性资源。
衍生相关工作
该数据集的发布推动了多项后续研究,衍生工作包括基于其两阶段训练协议发展出的新型偏好优化算法,用于增强视觉语言模型对人类审美偏好的遵循能力。此外,研究者借鉴其KonIQ-10K在线配对策略,开发了更高效的样本构造方法,从而减少人工标注成本。数据集所整合的多元IQA基准亦催生了模型泛化性对比研究,促进了跨数据集训练与零样本评估范式的探索,为多模态大模型评价体系标准化做出了贡献。
数据集最近研究
最新研究方向
Co-Instruct-Plus数据集的发布标志着图像质量评估(IQA)领域向多模态大语言模型(MLLM)深度整合的前沿迈进。其两阶段训练协议——先以逾九十万样本的指令微调奠定视觉-语言基础,再依托KonIQ-10K的在线配对策略精化评分能力——精准回应当前研究界对细粒度、可解释性质量评价的迫切需求。该数据集覆盖LIVE、CSIQ、TID2013等十余个经典基准,并纳入AGIQA-3K、PIPAL等生成图像质量挑战集,为评估模型在真实与合成失真场景下的泛化性能提供统一场域。通过与Qwen3-VL的协同优化,Co-Instruct-Plus不仅强化了视觉问答中的质量感知,更推动了从单一MOS预测向多维度、语言化质量描述的范式转换,其影响力辐射至多媒体内容审核、图像增强及生成式模型的质量控制等热点应用,为构建具备人类感知一致性的下一代视觉智能系统奠定了关键数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务