MoDoMoDo
收藏资源简介:
MoDoMoDo 是一个多模态数据混合框架,用于多模态大型语言模型(MLLM)的强化学习。该框架旨在优化多数据集混合策略,以提高模型在多模态任务上的泛化和推理能力。MoDoMoDo 包含五个图像-文本数据集,每个数据集具有不同的可验证奖励,用于训练和评估 MLLM 的推理能力。实验结果表明,与均匀数据混合相比,MoDoMoDo 的最佳混合可以提高模型在分布外基准上的准确率。
MoDoMoDo is a multimodal data mixing framework tailored for reinforcement learning of Multimodal Large Language Models (MLLMs). This framework aims to optimize multi-dataset mixing strategies to enhance the model's generalization and reasoning capabilities across multimodal tasks. MoDoMoDo includes five image-text datasets, each with distinct verifiable rewards, which are utilized for training and evaluating the reasoning abilities of MLLMs. Experimental results show that the optimal mixing scheme of MoDoMoDo can improve the model's accuracy on out-of-distribution benchmarks compared to uniform data mixing.
MoDoMoDo 数据集概述
基本信息
- 全称: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning
- 研究领域: 多模态大语言模型(MLLM)的强化学习
- 主要贡献者:
- Yiqing Liang (布朗大学)
- Jielin Qiu (Salesforce Research)
- Wenhao Ding (NVIDIA Research)
- 其他来自MIT、CMU、普林斯顿等机构的研究者
研究背景与目标
- 核心问题: 如何混合多样化的数据集以提升多模态能力的泛化性
- 挑战:
- 多数据集训练可能导致目标冲突
- 现有方法通常仅针对单一任务领域微调
数据集特点
- 数据构成: 包含可验证的视觉-语言问题
- 创新点:
- 开发了支持多领域在线强化学习的框架
- 提出了基于预测的数据混合策略
关键方法
- 种子混合 (Seed Mixture)
- 采用均匀分布建立基线
- 启发式混合 (Heuristic Mixture)
- 根据基线分数调整权重
- 基于模型的混合 (Model-based Mixture)
- 使用参数化函数拟合观察结果
实验结果
- 性能提升:
- 最佳混合策略使OOD基准准确率平均提升5.24%(相比均匀混合)
- 相比预微调基线总提升20.74%
- 重要发现:
- 数据量增加不一定带来性能提升
- 二次代理模型能有效捕捉混合性能的曲率特征
引用信息
bibtex @misc{liang2025modomodomultidomaindatamixtures, title={MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning}, author={Yiqing Liang and Jielin Qiu and Wenhao Ding and Zuxin Liu and James Tompkin and Mengdi Xu and Mengzhou Xia and Zhengzhong Tu and Laixi Shi and Jiacheng Zhu}, year={2025}, eprint={2505.24871}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2505.24871} }
资源链接
- 论文: arXiv:2505.24871

- 1MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning布朗大学, Salesforce AI Research, 英伟达研究, 卡内基梅隆大学, 普林斯顿大学, 德克萨斯A&M大学, 加州理工学院, MIT CSAIL · 2025年



