遇见数据集

RhaegarTargaryen/BenMRXETB11002

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

Open-MM-RL是一个多模态STEM推理数据集,涵盖物理学、数学、生物学和化学领域。它专为需要模型解释视觉信息并结合逐步分析推理的问题而设计。与现有的多模态推理基准相比,Open-MM-RL通过包含多面板和多图像任务来扩展评估设置,这些任务需要整合更复杂的视觉上下文,因为现实生活中的问题很少局限于单一图像,而是信息通常分散在多个相关图像中,要求科学工作者跨图像推理以找到解决方案。数据集包括三种多模态输入格式:单图像问题(一张图像配一个问题)、多面板问题(复合或基于面板的视觉配一个问题)和多图像问题(多张独立图像配一个问题)。这些格式通过要求模型不仅从文本推理,还要跨视觉布局、多个视图和分布式证据推理,增加了任务复杂性。所有格式的问题都构建为自包含、无歧义、推理密集和可验证的,使得数据集既可作为评估基准,也可作为专注于推理的模型的训练资源。该数据集的一个关键区别特征是它专注于所有三种多模态格式的博士级别STEM问题解决,这使得评估高级主题推理和模型跨日益复杂视觉输入综合信息的能力成为可能。与依赖标题的科学图形基准不同,该数据集中的示例设计为直接从提供的图像和问题中回答。

Open-MM-RL is a multimodal STEM reasoning dataset covering Physics, Mathematics, Biology, and Chemistry. It is designed for problems that require models to interpret visual information and combine it with step-by-step analytical reasoning. Compared with existing multimodal reasoning benchmarks, Open-MM-RL broadens the evaluation setting beyond standard single-image question answering by including multi-panel and multi-image tasks that require integrating information across more complex visual contexts. As rarely in real-life problems is context confined to a single image. Instead, the necessary information is often fragmented across multiple related images, requiring scientists to reason across them to find the solution. The dataset includes three multimodal input formats: Single-image problems (one image paired with one question), Multi-panel problems (a composite or panel-based visual paired with one question), and Multi-image problems (multiple separate images paired with one question). These formats increase task complexity by requiring models to reason not only from text, but also across visual layouts, multiple views, and distributed evidence. Across all formats, problems are constructed to be self-contained, unambiguous, reasoning-intensive, and verifiable making the dataset useful both as an evaluation benchmark and as a training resource for reasoning-focused models. A key distinguishing feature of this dataset is its focus on PhD-level STEM problem solving across all three multimodal formats. This makes it possible to assess both advanced subject-matter reasoning and a models ability to synthesize information across increasingly complex visual inputs. Unlike scientific figure benchmarks that rely significantly on captions, examples in this dataset are designed to be answered directly from the provided image or images together with the question.

提供机构:
RhaegarTargaryen
搜集汇总
数据集介绍
RhaegarTargaryen/BenMRXETB11002 数据集图片
构建方式
该数据集以多模态STEM推理为核心构建,涵盖了物理学、数学、生物学与化学四大领域。所有任务均由博士学位级别的领域专家经过两轮严格评审,确保问题表述准确、答案确定、推理路径清晰且无歧义。构建过程特别强调原创性和抗简单检索能力,避免因标注噪声导致模型失败。数据集的格式设计灵活,包含单图、多面板图及多图三种视觉输入模式,每道题目均配有唯一的确定性答案,支持自动化的程序化验证。未来计划引入结构化提示机制,以助力在线强化学习中对高难度样本的有效利用。
特点
该数据集最显著的特点在于其高级别难度与高度可验证性的统一。任务设计达到博士级别,要求模型具备多步推导、符号操作与定量分析能力,而不仅仅是表面感知。三种视觉输入格式(单图、多面板、多图)的引入,使得模型需在更复杂的视觉上下文中整合分布信息,显著提升了推理复杂度。所有答案均为确定性的数值、符号表达式或简化代数形式,可通过精确匹配、符号等价检查或数值容差进行自动评价,适合用于客观的强化学习奖励信号。
使用方法
该数据集适用于需要客观正确性检查的场景,如结果监督训练、推理驱动的强化学习、奖励模型构建及多模态推理系统的自动评估。典型使用流程为:输入问题与关联图像,模型输出最终预测答案,通过与标准答案的一致性计算奖励。可设计的奖励方案包括全部正确得分、错误不得分,以及数值接近或符号相关的部分得分。该数据集特别适合进行策略优化、奖励指导微调与迭代自改进流水线,同时在单图、多面板、多图三种设定下分析模型的失败模式。
背景与挑战
背景概述
Open-MM-RL是由Turing Enterprises于2026年创建的多模态STEM推理数据集,旨在评估和提升模型在物理、数学、生物和化学等学科中结合视觉信息与逐步分析推理的能力。该数据集由包括Chinmayee Shukla、Saurabh Patil等在内的多位研究人员共同开发,核心研究问题聚焦于构建一个包含单图、多面板及多图任务的PhD级推理基准,以应对现实科学问题中视觉信息碎片化、需跨图像整合的挑战。其独特之处在于强调答案的确定性与可编程校验,为强化学习、奖励建模及自动评估提供了客观正确性信号,对推动多模态推理系统的前沿研究具有重要意义。
当前挑战
当前领域面临的核心挑战在于,现有基准多局限于单一图像问答,难以反映真实科研中需跨多个关联图像进行推理的复杂性。Open-MM-RL通过引入单图、多面板及多图三种格式,提升了任务难度,要求模型不仅理解文本与单幅视觉,还需整合分布式证据,这对现有模型的视觉布局理解与跨场景推理能力构成严峻考验。数据构建过程中亦遭遇挑战,包括确保问题的自包含性与无歧义性、设计PhD级难度且成功信号不消失的样例,以及通过两轮专家审查维护科学正确性与原创性,以区分推理错误与标注噪声,从而保障基准的可靠性与有效性。
常用场景
经典使用场景
Open-MM-RL 数据集专为评估与训练多模态科学推理模型而设计,其经典使用场景聚焦于物理、数学、生物学和化学等学科的复杂问题求解。该数据集通过提供单图像、多面板和多图像三种视觉输入格式,要求模型在理解视觉信息的基础上,结合严谨的逐步推理过程,生成确定性的最终答案。这一特性使 Open-MM-RL 成为检验前沿模型在高级科学推理任务中表现的核心基准,尤其适用于需要客观验证推理结果的科研场景。
实际应用
在实际应用中,Open-MM-RL 为需要客观正确性判定的系统提供了关键资源。它被广泛用于强化学习中的结果监督训练和奖励建模,通过确定性奖励信号优化模型的推理策略。此外,该数据集支持自动化评分的流水线构建,适用于在线教育平台中的科学问题自动批改、前沿模型推理能力的迭代评估,以及面向可验证 STEM 推理的多模态智能系统开发与调试。
衍生相关工作
基于 Open-MM-RL 数据集的独特设计,研究者已衍生出多项经典工作。其中包括面向多模态推理的强化学习策略优化框架、基于结果监督的奖励模型训练方法,以及针对困难样本的轻量级提示增强技术。这些工作进一步探索了如何将高难度、零成功率的推理任务转化为可学习的训练信号,推动了在符号等价性检查、数值容差验证等可验证评估机制下的科学推理模型自改进研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务