遇见数据集
官方服务:

资源简介:

该数据集是 'self-evolve' 项目的一部分,旨在通过自我改进的视觉语言模型生成训练数据。数据集包含两个主要部分:1) 未标记的源图像集,共 13,507 张图像,来自公开数据集(ChartQA、AI2D、GQA、InfoVQA 风格信息图)的训练集,分为四个领域(图表、图表、自然照片、信息图),以 tar 包形式提供;2) 多个训练数据池(JSONL 格式),每个池包含由模型生成的问答对,用于强化学习训练。每个训练样本包含图像路径、问题文本、答案(程序计算的 JSON 对象,包含答案、类型、可接受答案、跳数、问题族、领域等字段),以及元数据(如 hops、family、domain、scaffold)。数据池规模各异,例如 rl16 池有 33,087 个训练样本和 728 个验证样本,rl20 池有 35,434 个训练样本和 635 个验证样本,还有其他变体(如选择题格式、推理格式等)。数据适用于视觉问答(VQA)、图表理解、多步推理等任务,特别适合采用强化学习(如 GRPO)进行模型微调。注意:答案由程序自动生成,未经人工验证,可能存在错误;图像路径为绝对路径,使用时需调整。

This dataset is part of the self-evolve project, which aims to generate training data through self-improving vision-language models. The dataset consists of two main parts: 1) An unlabeled source image set of 13,507 images from the training sets of public datasets (ChartQA, AI2D, GQA, InfoVQA-style infographics), divided into four domains (charts, diagrams, natural photos, infographics), provided as tar archives; 2) Multiple training data pools (JSONL format), each containing question-answer pairs generated by the model for reinforcement learning training. Each training sample includes image path, question text, answer (a programmatically computed JSON object with fields such as answer, type, acceptable answers, hops, question family, domain, etc.), and metadata (e.g., hops, family, domain, scaffold). The data pools vary in size; for example, the rl16 pool has 33,087 training samples and 728 validation samples, the rl20 pool has 35,434 training samples and 635 validation samples, and there are other variants (e.g., multiple-choice format, reasoning format, etc.). The data is suitable for tasks such as visual question answering (VQA), chart understanding, multi-step reasoning, and is particularly suitable for model fine-tuning with reinforcement learning (e.g., GRPO). Note: Answers are automatically generated by programs and have not been manually verified, so there may be errors; image paths are absolute paths and need to be adjusted when used.

创建时间:
2026-08-21
原始信息汇总

数据集概述:self-evolve

这是一个用于视觉问答(VQA)强化学习(RL) 研究的数据集,核心目标是探索一个2B参数规模的视觉语言模型(Qwen3-VL-2B-Instruct)能否通过自我提问和自我回答的方式,在没有人工问题或答案参与的情况下,自主提升视觉语言基准测试表现

核心结构与内容

数据集包含以下核心组件(总大小约252 GB,其中可复现训练所需的关键数据已打包):

目录 内容 说明
adapters/ LoRA r64适配器 每个实验臂对应一个,每个约267 MB,用于无需训练即可复现报告分数
pools/ RL训练数据(JSONL格式) 每个实验臂对应一个目录,包含训练集和验证集
images_tar/ 13,507张无标注源图像 4个tar包,按领域划分:4,000图表、4,000示意图、4,000自然照片、1,507信息图
pipeline/ 构建数据、定义奖励、训练和评估的脚本 包含数据构建、奖励定义、GRPO训练启动器和lmms-eval评估脚本
generator/ 问题生成器和测试集排除列表 用于重新生成问题,包含程序模板族和held-out ID列表

训练数据池

数据池 训练集 验证集 用途
rl16 33,087 728 验证数据臂(c5_datafix)
rl18 37,422 764 混合臂(c6)
rl20 35,434 635 难度混合臂(c7)
rl_e3 5,879 120 课程学习臂(e3_proposer)
rl_mcq 4,337 95 多项选择格式臂(e7)
rl_band 5,701 120 边界过滤控制臂(e6)
rl_think 33,087 728 推理格式变体(rl16的子集)

每个训练样本包含图像路径、问题、程序计算出的答案、跳数、问题族和领域信息。

主要实验结果

使用未经修改的lmms-eval和官方指标测量所有分数,以Qwen3-VL-2B为骨干:

  • 最佳平均分:课程学习臂(e3)平均分为60.21,比基线的57.94高出**+2.27**
  • 验证数据臂(c5)平均分60.14,比基线高+2.20
  • 单基准最大提升:ScienceQA提升至86.76(+7.34),MMMU提升至45.44(+6.52)
  • 多个基准达到最好成绩:GQA(59.72)、OK-VQA(42.86)、ChartQAPro(15.50)、MMBench-En(78.44)、MMMU-Pro(29.48)、SEEDBench(72.84)、EmbSpatial(71.43)

关键研究发现

  1. 自身问题拟合不迁移:训练在自身数据池上提升+8至+32点,但在基准上仅提升约+0.9,迁移比约0.03;而从2B升级到4B的迁移比约0.95
  2. 非记忆效应:在未见图像上,训练池内增益的+5.32/9.00仍然保持,说明模型学习的是问题分布
  3. 性能平台期源于双向扰动:最佳臂在基准上增益392项但破坏341项(9.3%双向扰动),所有臂的增益/破坏比在0.81–0.97之间
  4. 更难的问题无助于基准提升:仅保留基础模型25–75%正确率的问题,将池内学习提升4倍(+32),但产生最差的基准结果
  5. 4B模型的优势主要在于感知:86.5%的优势来自不同内容,按技能划分:OCR +10.25、多步算术+7.67、排序+6.13、计数+5.70、空间+4.82,而世界知识为−0.36

注意事项与限制

  • 除特别说明外均为单随机种子实验,测量到的种子噪音标准差为0.25–0.62,因此低于约1分的差异不具意义
  • 数据池中的答案由程序从模型自身的图像解析中计算,虽经事实核查但未经人工验证,部分答案可能有误
  • 原始数据集(AI2D、GQA、信息图集)特意未包含在内(约252 GB),因为13,507张采样图像池已足以复现训练运行
搜集汇总
数据集介绍
random 数据集图片
构建方式
该数据集源自一项关于视觉语言模型自进化的研究项目,其核心构建方式别具匠心。项目团队从公共数据集的训练集中精心挑选了13,507张无标签图像,涵盖图表、图示、自然照片和信息图表四大领域,彻底摒弃了人工标注的问答对。他们利用一个基础视觉语言模型(Qwen3-VL-2B-Instruct)作为‘解析器’,将图像内容转化为结构化描述,再通过程序化模板生成问题和对应的计算答案,从而构建出完全由模型自我生成的训练语料。整个构建流程涉及多轮验证,包括事实核查和文本门控筛选,以确保数据质量,并最终形成用于强化学习的训练池,如rl16、rl20等,每个池都对应不同的实验设计。
特点
该数据集最显著的特点在于其‘无人工参与’的自进化特性,所有问题与答案均由模型自身生成,彻底消除了对人工标注的依赖。数据集规模适中,训练样本约3万至4万条,并附带了详细的元数据,如问题难度、类型和来源领域,便于精细分析。此外,数据集结构严谨,不仅提供了训练/验证划分,还包含了用于排除基准测试集图像的清单,确保了评估的纯净性。其多臂设计尤为独特,涵盖了验证数据、课程学习、协同进化等多种训练策略的产物,为对比研究提供了丰富素材。不过,其答案由程序从模型解析结果中计算得出,虽经核查但未经人工验证,存在一定误差风险。
使用方法
使用该数据集主要有两种方式。其一,研究人员可以直接利用附带的LoRA适配器(如c5_datafix_s2)进行推理,通过合并适配器到基础模型并加载,即可在约30分钟内复现论文中的基准测试分数,而无需进行任何训练。其二,用户可依据文档指引,从零开始重新训练模型:首先解压图像数据,然后运行pipeline中的训练脚本(如train_coev.sh),并指定对应的数据池,即可复现强化学习过程。对于进阶用户,generator目录下的代码支持完全重新生成新问题,这为探索不同的数据分布提供了灵活性。文档还详细说明了如何将模型部署到vLLM并进行评估,确保了从训练到评估的全流程可复现性。
背景与挑战
背景概述
该数据集诞生于2025年,由研究团队针对视觉语言模型(VLM)自我进化能力展开的探索性项目。其核心研究问题在于,能否让一个参数量为2B的Qwen3-VL模型,在完全无人工标注问题与答案的条件下,通过自我提问与解答未标注图像,实现性能的自主提升。团队设计了一套涵盖数据生成、强化学习训练与评估的完整闭环流程,并公开了适配器、数据池、图像及代码等全部构件。该工作为视觉问答领域的低资源自我改进提供了全新范式,其公开的基准测试结果在多个任务上超越了基线模型,对推动高效、自主的VLM发展具有重要参考价值。
当前挑战
该领域面临的核心挑战在于,如何突破模型自我生成数据的天花板,即模型在自身分布内学习效果显著,但向真实基准迁移的能力却极为有限,两者提升幅度比例约为0.03,远低于模型规模升级带来的0.95,揭示了自我进化机制的本质瓶颈。构建过程中,团队遭遇了多重技术难题:一是答案的可靠性,所有答案由程序从模型解析结果中计算得出,虽经事实核查但未人工验证,存在误差风险;二是训练稳定性,GRPO算法在PEFT下需多GPU协同,且单种子训练的噪声波动(标准差0.25–0.62)影响了结论的精确性;三是评估严谨性,为确保公平,必须统一评估框架并剔除基准测试集中的图像,严防数据泄露,这些均对实验设计与工程实现提出了严苛要求。
常用场景
经典使用场景
该数据集的核心应用场景在于探索视觉语言模型的自进化机制,即在不依赖人类标注问题与答案的闭环中,通过模型自我生成问题并进行强化学习,从而提升其视觉问答能力。研究者可利用其提供的13,507张无标注图像(涵盖图表、图示、自然照片及信息图)与程序化生成的问题模板,在约三十分钟内复现基准分数,或完整运行强化学习训练流程。此场景为验证'模型能否通过自我教学实现能力提升'这一前沿命题提供了标准化的实验平台,尤其适用于对比不同训练策略(如课程学习、双智能体协作)对模型性能的边际影响。
实际应用
在实际应用中,该数据集及其附带工具链可作为视觉语言模型开发者的高效优化引擎。通过复用其预构建的LoRA适配器与验证过的训练数据池,开发者能够在无需额外人工标注的情况下,针对特定视觉问答基准(如GQA、ChartQA)对2B级模型进行低成本微调,平均性能提升约2.2点。其程序化问题生成器支持跨领域(图表、图示、自然场景)的灵活扩展,可应用于自动化数据增强、模型鲁棒性测试以及低资源环境下多模态模型的快速迭代,尤其在部署前需快速适应新数据分布的工业场景中极具价值。
衍生相关工作
该数据集催生了一系列探索模型自进化与多智能体协作的后续研究。其分离的'解析器-求解器'架构与双智能体自博弈设计,启发了对视觉感知与推理解耦的深入探讨;课程学习臂(e3)中基于bandit调度的问题族选择机制,为自适应训练策略提供了新范式。此外,关于'难度筛选问题无益'的负面结论,反哺了对强化学习中奖励信号设计与困难样本挖掘的再思考。其验证的数据验证流程(c5臂)亦成为后续工作确保自动生成数据可靠性的参考基准,推动形成'生成-验证-训练'闭环的标准范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务