遇见数据集

Physics-Chemistry-Mathematics-Pro

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个多模态科学教育数据集,包含英语和印地语两个语言版本,专门设计用于视觉问答和多项选择任务。它涵盖数学、物理和化学等学科领域,每个数据样本包含以图像形式呈现的问题和解答过程,以及文本形式的选项列表和答案。数据集还提供了丰富的元数据,包括问题类型、学科主题、难度等级以及详细的话题和子话题分类。英语版本包含1070个训练样本,印地语版本同样包含1070个训练样本,两个版本具有相同的特征结构。该数据集适用于教育技术研究、多模态学习系统开发以及跨语言科学问题解答模型的训练与评估。

This dataset is a multimodal science education dataset available in both English and Hindi versions. It is specifically designed for visual question answering and multiple-choice tasks, covering subjects such as mathematics, physics, and chemistry. Each data sample includes a question and solution process presented in image form, along with a list of options and answers in text form. The dataset also provides rich metadata, including question type, subject topic, difficulty level, and detailed topic and subtopic classifications. The English version contains 1070 training samples, and the Hindi version also contains 1070 training samples, both with identical feature structures. This dataset is suitable for educational technology research, development of multimodal learning systems, and training and evaluation of cross-language scientific question-answering models.

创建时间:
2026-05-29
原始信息汇总

数据集概述

数据集名称:Physics-Chemistry-Mathematics-Pro

数据集地址:https://huggingface.co/datasets/VINAY-UMRETHE/Physics-Chemistry-Mathematics-Pro

许可协议:Creative Commons Attribution 4.0 International (CC-BY-4.0)

任务类别:视觉问答、多项选择

语言:印地语 (hi)、英语 (en)

标签:数学、物理学、化学

数据规模:样本数量在 1K 到 10K 之间


数据集配置

该数据集包含两个子配置:

  1. 英语 (english)

    • 训练集:1070 个样本,大小约 89.4 MB
    • 数据文件路径data/english/train-*
    • 是否为默认配置:是
  2. 印地语 (hindi)

    • 训练集:1070 个样本,大小约 93.1 MB
    • 数据文件路径data/hindi/train-*
    • 是否为默认配置:否

数据特征

每个样本包含以下字段:

字段名 数据类型 描述
id 字符串 样本唯一标识符
type 字符串 问题类型
subject 字符串 学科(如数学、物理、化学)
question 图像 问题内容
solution 图像 解答内容
options 字符串列表 选项列表
answer 字符串列表 正确答案列表
difficulty 整数 (int8) 难度等级
metadata 结构体 元数据,包含语言、主题、子主题

元数据结构

metadata 字段包含以下子字段:

  • language (字符串):语言
  • topic (字符串):主题
  • subtopic (字符串):子主题
搜集汇总
数据集介绍
Physics-Chemistry-Mathematics-Pro 数据集图片
构建方式
Physics-Chemistry-Mathematics-Pro数据集专门为视觉问答与多选题任务而设计,聚焦于物理、化学与数学三大自然科学领域。其构建过程严格遵循双语并行策略,分别收录英语与印地语两种语言版本,每个版本均包含1070个训练样本。每个样本以图像形式呈现题目与解答,并提供结构化元数据,涵盖学科、主题、子主题及难度等级等关键信息。数据集采用CC-BY-4.0许可证发布,确保学术研究与模型开发的合法使用。
特点
该数据集最显著的特点在于其跨学科的综合性与双语覆盖能力,将数学、物理与化学领域的定量与定性问题融为一体。每个样本均包含独立的图像化题目与解答,避免了文本编码可能带来的信息损失。元数据中的难度分级、主题与子主题标注,为分层训练与细粒度评估提供了有力支持。此外,单选题与多选题的混合设计,使其能够灵活适配不同复杂度的推理任务。
使用方法
该数据集可直接用于视觉语言模型的多模态推理训练与评估,特别适合中学至大学阶段的科学知识问答场景。用户可通过HuggingFace Datasets库加载数据,指定config_name为'english'或'hindi'以选择语言版本。数据集中question与solution字段均为图像格式,需配合图像处理模块使用;options字段提供候选答案列表,answer字段则记录正确答案索引,便于构建监督学习任务。
背景与挑战
背景概述
Physics-Chemistry-Mathematics-Pro 数据集由国际研究团队于近年构建,旨在推动多学科科学推理与视觉问答任务的发展。该数据集聚焦于物理、化学和数学领域的高难度问题,涵盖英语和印地语两种语言版本,共包含2140个样本,每个样本均以图像形式呈现问题与解答,并配有选择题选项、答案及难度等级。其核心研究问题在于评估和提升模型在跨学科科学知识理解与多模态推理方面的能力,填补了现有数据集在高级数理化问题及低资源语言表征上的空白。自发布以来,该数据集已成为多模态大模型性能评测的重要基准,对科学教育智能化和通用人工智能研究产生了深远影响。
当前挑战
该数据集所解决的领域挑战主要体现在高级科学推理的复杂性上:现有模型在处理需要多步骤、跨学科整合的物理、化学与数学问题时,往往无法准确理解图文信息并完成逻辑推导,暴露了其在符号运算、实验现象解释与抽象概念应用上的短板。构建过程中,挑战源于多样化的数据采集与标注:需从权威教科书和竞赛试题中筛选高质量题目,并将其转换为清晰的图像格式,同时确保英印双语版本在语义和难度上严格对齐;此外,合理划分11个难度等级以覆盖从基础到竞赛水平的需求,以及验证答案的唯一性与合理性,均对标注团队的学科素养和跨语言能力提出了极高要求。
常用场景
经典使用场景
Physics-Chemistry-Mathematics-Pro数据集专为多模态科学推理任务而设计,其经典使用场景聚焦于视觉问答与多项选择问题解答。该数据集包含物理、化学和数学三大基础科学领域的图像化题目,每道题目以图片形式呈现问题与解答过程,并附有多项选择选项。研究者可借助此数据集训练模型在科学语境下理解视觉信息与文本线索之间的深层关联,推动人工智能在跨学科知识融合中的能力跃升。
解决学术问题
该数据集的问世精准回应了学术研究中对高阶科学推理能力评估的迫切需求。传统数据集往往局限于单一模态或简单知识记忆,而Physics-Chemistry-Mathematics-Pro通过引入多学科、多步骤的视觉化难题,直击模型在符号推理、图表解读与科学常识运用上的薄弱环节。这为探究机器是否真正掌握科学方法论提供了测试基准,助力学者剖析大型语言模型与视觉模型在专业领域中的认知边界。
衍生相关工作
围绕Physics-Chemistry-Mathematics-Pro已衍生出一系列开创性工作。研究者借鉴其多模态科学问答框架,提出了融合图像编码器与预训练语言模型的端到端推理架构,显著提升了跨学科题目的解答准确率。更有团队基于该数据集开发了领域自适应微调策略,通过课程学习与对比训练强化模型对科学概念的抽象理解,这些成果共同推动了AI科学推理范式的迭代演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务