Innovator-VL-RL-172K
收藏资源简介:
Innovator-VL-RL-172K是一个精心策划的多模态强化学习(RL)训练数据集,包含约172K实例。该数据集旨在支持视觉语言推理和复杂决策制定,特别是在RL/RLHF式优化中,目标是提高模型一致选择高质量响应的能力,而不仅仅是扩展知识覆盖范围。数据集特别强调对政策改进最有信息的样本,尤其是那些需要多步推理、鲁棒指令遵循和多模态输入(如图像条件任务)下可靠最终答案选择的样本。实际上,数据分布有意偏向于具有挑战性的推理场景,如STEM问题解决、代码相关任务和一般多模态推理,以便训练信号集中在模型通常表现出潜在正确性和可靠正确性之间差距的领域。总体而言,Innovator-VL-RL-172K旨在作为一个实用的RL训练语料库,用于提高多模态大型语言模型中的Pass@1性能、响应可靠性和推理稳定性,使其适用于更强视觉语言代理和以推理为中心的模型的研发。
Innovator-VL-RL-172K 数据集概述
数据集基本信息
- 名称:Innovator-VL-RL-172K
- 许可协议:apache-2.0
- 任务类别:图像-文本到文本
- 语言:英语
- 标签:多模态、视觉语言模型、数据集集合、大语言模型、强化学习
数据集简介
Innovator-VL-RL-172K 是一个精心策划的多模态强化学习训练数据集,包含约 172K 个实例。该数据集旨在支持视觉语言推理和复杂决策,用于强化学习/RLHF 风格的优化,其目标是提升模型持续选择高质量响应的能力,而非仅仅扩展知识覆盖范围。
数据集强调对策略改进最具信息量的样本,特别是那些需要多步推理、鲁棒指令遵循以及在多模态输入下进行可靠最终答案选择的任务。数据分布有意偏向具有挑战性的推理场景,例如 STEM 问题解决、代码相关任务和通用多模态推理,以便训练信号集中在模型通常表现出潜在正确性与可靠正确性之间存在差距的领域。
总体而言,Innovator-VL-RL-172K 旨在作为一个实用的强化学习训练语料库,用于提升多模态大语言模型的 Pass@1 性能、响应可靠性和推理稳定性,适用于开发更强大的视觉语言代理和以推理为中心的模型。
数据分析
数据集严重偏向复杂的推理任务:
- STEM 与代码:56.4%
- 通用多模态任务:34.9%
- 科学:5.0%
- 空间推理:2.4%
- 基础理解:0.9%
- 计数:0.2%
- OCR 与图表理解:0.2%
可视化
- 数据分布饼图:https://huggingface.co/datasets/InnovatorLab/Innovator-VL-RL-172K/raw/main/assets/pie.png




