遇见数据集

OpenGVLab/MMPR

收藏
Hugging Face2025-04-11 更新2024-12-14 收录
官方服务:

资源简介:

MMPR是一个大规模、高质量的多模态推理偏好数据集,包含约300万个样本。该数据集用于微调InternVL2-8B模型,并在多个基准测试中展示了优异的性能,特别是在多模态推理任务中表现出色。数据集包含图像路径、输入查询、选择的响应和拒绝的响应等字段。

MMPR is a large-scale and high-quality multimodal reasoning preference dataset, containing about 3 million samples. This dataset is used to fine-tune the InternVL2-8B model, significantly enhancing its performance in multimodal reasoning tasks through the Mixed Preference Optimization (MPO) method. The dataset features include images, questions, chosen responses, and rejected responses. MMPR dataset has achieved superior performance in multiple benchmarks, particularly excelling in the MathVista and MathVision benchmarks, setting new performance levels.

提供机构:
OpenGVLab
搜集汇总
数据集介绍
构建方式
在视觉语言模型快速演进的背景下,多模态推理能力的增强成为关键挑战。MMPR数据集正是为解决这一问题而构建,其规模宏大,包含约300万条样本,每条样本由图像路径、输入查询、偏好回答与拒绝回答四部分构成。该数据集通过混合偏好优化策略精心筛选与组织,旨在提升模型在复杂推理任务中的表现,同时兼顾感知能力以缓解幻觉现象。构建过程中,数据来源广泛且经过严格质量把控,确保偏好对的有效性与多样性,为后续模型微调奠定了坚实基础。
特点
MMPR数据集的核心特色在于其大规模与高质量的多模态推理偏好结构。它融合了推理与感知双重维度,使得基于此数据集训练的InternVL2-8B-MPO模型在多个权威基准上展现卓越性能。例如,在MathVista上准确率达67.0%,较原模型提升8.7个百分点,在MathVision上以25.7%刷新开源模型纪录。此外,数据集的偏好对设计不仅强化了模型的逻辑推理链条,还通过感知数据显著降低幻觉发生率,在POPE基准上实现1.2个百分点的改进,充分体现了其在多模态领域中的独特价值。
使用方法
使用MMPR数据集时,研究者需遵循官方文档指引,将数据集成至InternVL系列模型的训练流程中。数据集以注释压缩包形式提供,包含训练集分割,各字段如image、question、chosen与rejected可直接用于偏好优化算法的输入。推荐结合混合偏好优化方法对模型进行微调,例如对InternVL2-8B应用MPO策略,以复现其在多模态推理与感知任务上的突破性成果。具体实现细节与代码示例可参考配套的GitHub仓库与技术文档,确保高效部署与实验复现。
背景与挑战
背景概述
多模态大语言模型(MLLMs)在视觉与语言联合推理任务中展现出巨大潜力,然而其推理能力常受限于偏好对齐不足与幻觉现象频发。为攻克这一瓶颈,上海人工智能实验室、商汤科技及清华大学等机构的研究人员于2024年11月联合推出了大规模多模态推理偏好数据集MMPR(Multimodal Reasoning Preference Dataset)。该数据集由Weiyun Wang、Zhe Chen等学者主导构建,包含约300万条高质量样本,核心研究问题聚焦于如何通过混合偏好优化(MPO)策略提升模型在数学推理、复杂视觉问答及感知任务中的综合表现。MMPR的发布直接催生了InternVL2-8B-MPO模型,其在MathVista基准上以67.0%的准确率超越十倍参数量的InternVL2-76B,并在MathVision上以25.7%的准确率刷新开源模型纪录,显著推动了多模态推理领域的边界扩展。
当前挑战
MMPR所解决的领域挑战在于多模态大模型在复杂推理任务中偏好对齐的脆弱性,尤其体现在数学问题求解与精细视觉感知的跨模态逻辑一致性上。例如,传统模型在MathVista等数学推理基准上准确率不足60%,且常因幻觉问题在POPE等感知测试中产生错误响应。构建过程中,团队面临多重挑战:首先,需从海量图文对中筛选并生成具备明确偏好差异的推理样本,确保“选择”(chosen)与“拒绝”(rejected)响应能有效区分正确与错误推理路径;其次,需平衡数学推理、感知抗幻觉与通用问答三类数据比例,避免偏好优化陷入局部过拟合;此外,还需设计可扩展的标注流程以覆盖300万规模样本,同时保证答案的语义精确性与多模态对齐质量,最终通过MPO算法实现偏好信号的高效融合与模型泛化能力提升。
常用场景
经典使用场景
MMPR数据集的核心用途在于对多模态大语言模型进行偏好优化训练,尤其聚焦于提升模型在复杂视觉-语言推理任务中的表现。通过提供包含约300万样本的大规模高质量三元组数据(图像、问题、优选与劣选回答),研究者可借助混合偏好优化(MPO)算法对模型进行微调,显著增强其数学推理、视觉问答和幻觉抑制能力。该数据集的经典使用范式已在InternVL2-8B-MPO模型上得到验证,其在MathVista、MathVision等基准测试中取得了突破性进展,甚至与数十倍参数规模的模型性能相媲美。
实际应用
在实际应用层面,MMPR数据集赋能的模型可广泛部署于需要精细视觉理解与逻辑推理的场景,例如智能教育辅导系统(自动解答数学几何题)、工业质检中的异常检测与描述、以及辅助视障人士的实时环境问答。此外,由于该数据集显著降低了模型的幻觉率,其在医疗影像报告生成、自动驾驶场景理解等高风险领域也展现出巨大潜力,能够提供更可靠、更准确的视觉-语言交互服务。
衍生相关工作
基于MMPR数据集衍生出的经典工作包括InternVL2.0系列模型的混合偏好优化(MPO)算法,以及后续发布的MMPR-v1.1与v1.2版本,这些迭代版本进一步提升了InternVL3等模型的综合性能。该数据集还激发了多模态偏好对齐、推理增强及幻觉抑制等方向的研究热潮,相关论文与开源项目(如InternVL系列)已成为多模态大模型领域的重要基准,推动了开源模型在数学推理、复杂VQA等任务上追赶甚至超越闭源商业模型的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务