random
收藏资源简介:
该数据集是 'self-evolve' 项目的一部分,旨在通过自我改进的视觉语言模型生成训练数据。数据集包含两个主要部分:1) 未标记的源图像集,共 13,507 张图像,来自公开数据集(ChartQA、AI2D、GQA、InfoVQA 风格信息图)的训练集,分为四个领域(图表、图表、自然照片、信息图),以 tar 包形式提供;2) 多个训练数据池(JSONL 格式),每个池包含由模型生成的问答对,用于强化学习训练。每个训练样本包含图像路径、问题文本、答案(程序计算的 JSON 对象,包含答案、类型、可接受答案、跳数、问题族、领域等字段),以及元数据(如 hops、family、domain、scaffold)。数据池规模各异,例如 rl16 池有 33,087 个训练样本和 728 个验证样本,rl20 池有 35,434 个训练样本和 635 个验证样本,还有其他变体(如选择题格式、推理格式等)。数据适用于视觉问答(VQA)、图表理解、多步推理等任务,特别适合采用强化学习(如 GRPO)进行模型微调。注意:答案由程序自动生成,未经人工验证,可能存在错误;图像路径为绝对路径,使用时需调整。
This dataset is part of the self-evolve project, which aims to generate training data through self-improving vision-language models. The dataset consists of two main parts: 1) An unlabeled source image set of 13,507 images from the training sets of public datasets (ChartQA, AI2D, GQA, InfoVQA-style infographics), divided into four domains (charts, diagrams, natural photos, infographics), provided as tar archives; 2) Multiple training data pools (JSONL format), each containing question-answer pairs generated by the model for reinforcement learning training. Each training sample includes image path, question text, answer (a programmatically computed JSON object with fields such as answer, type, acceptable answers, hops, question family, domain, etc.), and metadata (e.g., hops, family, domain, scaffold). The data pools vary in size; for example, the rl16 pool has 33,087 training samples and 728 validation samples, the rl20 pool has 35,434 training samples and 635 validation samples, and there are other variants (e.g., multiple-choice format, reasoning format, etc.). The data is suitable for tasks such as visual question answering (VQA), chart understanding, multi-step reasoning, and is particularly suitable for model fine-tuning with reinforcement learning (e.g., GRPO). Note: Answers are automatically generated by programs and have not been manually verified, so there may be errors; image paths are absolute paths and need to be adjusted when used.
数据集概述:self-evolve
这是一个用于视觉问答(VQA) 和强化学习(RL) 研究的数据集,核心目标是探索一个2B参数规模的视觉语言模型(Qwen3-VL-2B-Instruct)能否通过自我提问和自我回答的方式,在没有人工问题或答案参与的情况下,自主提升视觉语言基准测试表现。
核心结构与内容
数据集包含以下核心组件(总大小约252 GB,其中可复现训练所需的关键数据已打包):
| 目录 | 内容 | 说明 |
|---|---|---|
adapters/ |
LoRA r64适配器 | 每个实验臂对应一个,每个约267 MB,用于无需训练即可复现报告分数 |
pools/ |
RL训练数据(JSONL格式) | 每个实验臂对应一个目录,包含训练集和验证集 |
images_tar/ |
13,507张无标注源图像 | 4个tar包,按领域划分:4,000图表、4,000示意图、4,000自然照片、1,507信息图 |
pipeline/ |
构建数据、定义奖励、训练和评估的脚本 | 包含数据构建、奖励定义、GRPO训练启动器和lmms-eval评估脚本 |
generator/ |
问题生成器和测试集排除列表 | 用于重新生成问题,包含程序模板族和held-out ID列表 |
训练数据池
| 数据池 | 训练集 | 验证集 | 用途 |
|---|---|---|---|
rl16 |
33,087 | 728 | 验证数据臂(c5_datafix) |
rl18 |
37,422 | 764 | 混合臂(c6) |
rl20 |
35,434 | 635 | 难度混合臂(c7) |
rl_e3 |
5,879 | 120 | 课程学习臂(e3_proposer) |
rl_mcq |
4,337 | 95 | 多项选择格式臂(e7) |
rl_band |
5,701 | 120 | 边界过滤控制臂(e6) |
rl_think |
33,087 | 728 | 推理格式变体(rl16的子集) |
每个训练样本包含图像路径、问题、程序计算出的答案、跳数、问题族和领域信息。
主要实验结果
使用未经修改的lmms-eval和官方指标测量所有分数,以Qwen3-VL-2B为骨干:
- 最佳平均分:课程学习臂(e3)平均分为60.21,比基线的57.94高出**+2.27**
- 验证数据臂(c5)平均分60.14,比基线高+2.20
- 单基准最大提升:ScienceQA提升至86.76(+7.34),MMMU提升至45.44(+6.52)
- 多个基准达到最好成绩:GQA(59.72)、OK-VQA(42.86)、ChartQAPro(15.50)、MMBench-En(78.44)、MMMU-Pro(29.48)、SEEDBench(72.84)、EmbSpatial(71.43)
关键研究发现
- 自身问题拟合不迁移:训练在自身数据池上提升+8至+32点,但在基准上仅提升约+0.9,迁移比约0.03;而从2B升级到4B的迁移比约0.95
- 非记忆效应:在未见图像上,训练池内增益的+5.32/9.00仍然保持,说明模型学习的是问题分布
- 性能平台期源于双向扰动:最佳臂在基准上增益392项但破坏341项(9.3%双向扰动),所有臂的增益/破坏比在0.81–0.97之间
- 更难的问题无助于基准提升:仅保留基础模型25–75%正确率的问题,将池内学习提升4倍(+32),但产生最差的基准结果
- 4B模型的优势主要在于感知:86.5%的优势来自不同内容,按技能划分:OCR +10.25、多步算术+7.67、排序+6.13、计数+5.70、空间+4.82,而世界知识为−0.36
注意事项与限制
- 除特别说明外均为单随机种子实验,测量到的种子噪音标准差为0.25–0.62,因此低于约1分的差异不具意义
- 数据池中的答案由程序从模型自身的图像解析中计算,虽经事实核查但未经人工验证,部分答案可能有误
- 原始数据集(AI2D、GQA、信息图集)特意未包含在内(约252 GB),因为13,507张采样图像池已足以复现训练运行





