Innovator-VL-Instruct-46M
收藏资源简介:
Innovator-VL-Instruct-46M 是一个多模态视觉指令数据集,旨在通过全参数视觉指令监督微调(SFT)增强模型在广泛视觉任务中的能力。该数据集设计目标包括:1)基础视觉指令跟随,使模型能够有效利用预训练知识解决多样化视觉语言理解任务;2)为强化学习阶段提供冷启动,赋予模型初步的链式思考和多步推理能力;3)增强科学领域理解能力,训练模型解决需要领域知识、结构化推理和精确答案的问题。数据集包含三类训练数据:通用多模态指令数据(占比27.5%)、链式思考与多步推理数据、以及科学理解数据(占比9.6%)。其他主要类别包括文本任务(15.8%)、图表与表格(12.1%)、特定领域任务(9.1%)、OCR(7.8%)、图像描述(7.6%)、STEM与代码(6.6%)、基础/计数(2.0%)和文档理解(1.9%)。数据集适用于多模态视觉语言理解、指令跟随、科学推理等任务,采用MIT许可,语言为英语。
Innovator-VL-Instruct-46M is a multimodal visual instruction dataset designed to enhance model capabilities across a wide range of visual tasks via full-parameter visual instruction supervised fine-tuning (SFT). Its design goals are as follows: 1. Basic visual instruction following, enabling the model to effectively leverage pre-trained knowledge to solve diverse visual-language understanding tasks; 2. Providing cold start support for the reinforcement learning phase, endowing the model with preliminary chain-of-thought and multi-step reasoning abilities; 3. Enhancing scientific domain comprehension, training the model to solve problems requiring domain-specific knowledge, structured reasoning, and precise answers. The dataset comprises three main categories of training data: general multimodal instruction data (accounting for 27.5%), chain-of-thought and multi-step reasoning data, and scientific comprehension data (accounting for 9.6%). Other major categories include text tasks (15.8%), charts and tables (12.1%), domain-specific tasks (9.1%), OCR (7.8%), image captioning (7.6%), STEM and code (6.6%), basic/counting tasks (2.0%), and document understanding (1.9%). This dataset is applicable to tasks such as multimodal visual-language understanding, instruction following, and scientific reasoning, and is licensed under the MIT License with English as its working language.
Innovator-VL-Instruct-46M 数据集概述
数据集简介
本数据集旨在通过全参数视觉指令监督微调,增强模型处理广泛视觉任务的能力,以生成准确、基于事实且与指令对齐的响应。此监督微调阶段是多模态预训练与后续强化学习之间的关键桥梁,为后续策略优化提供通用能力覆盖和稳定的初始化。
数据集设计目标
- 基础视觉指令遵循:赋予模型在多模态场景下强大的指令遵循能力,使其能有效利用预训练知识解决多样化的视觉-语言理解任务。
- 强化学习的冷启动:为模型即将到来的强化学习阶段做准备,使其具备初步的思维链和多步推理能力,以提升推理连贯性和分步问题解决能力。
- 科学理解增强:通过训练模型解决需要领域知识、结构化推理和精确答案的问题,重点加强其在科学领域的能力。
训练数据构成
为达成上述目标,数据集精心策划了以下三类训练数据:
- 通用多模态指令数据:用于广泛的视觉理解和指令遵从。
- 思维链与多步推理数据:用于构建结构化推理行为。
- 科学理解数据:用于提升面向科学的多模态任务性能。
数据集内容分析
数据集(Innovator-VL-Instruct-46M)涵盖了多样化的多模态指令类型,重点侧重于通用视觉理解和以文本为中心的任务。各类别比例如下:
- 通用:27.5%
- 文本:15.8%
- 图表与表格:12.1%
- 科学:9.6%
- 特定领域:9.1%
- 光学字符识别:7.8%
- 图像描述:7.6%
- STEM与代码:6.6%
- 定位/计数:2.0%
- 文档:1.9%
基本信息
- 许可证:MIT
- 任务类别:图像-文本到文本
- 主要语言:英语
- 标签:多模态、视觉-语言、视觉指令微调、监督微调、指令遵循、思维链、多步推理、科学推理、科学




