遇见数据集

PhySciBench

收藏
github2026-06-21 更新2026-06-26 收录
官方服务:

资源简介:

PhySciBench是一个用于评估物理科学深度研究能力的基准数据集,包含200个专家策划的问题,涵盖物理和化学领域,涉及六个任务类别,如多模态问答、长文本问答、结构化信息提取等,旨在反映真实世界的科学工作流程。

PhySciBench is a benchmark dataset for evaluating in-depth research capabilities in physical sciences. It contains 200 expert-curated questions spanning the fields of physics and chemistry, covering six task categories such as multimodal question answering, long-text question answering, structured information extraction, and more. This dataset aims to reflect real-world scientific workflows.

创建时间:
2026-06-21
原始信息汇总

数据集概览:PhySciBench

PhySciBench 是一个专门用于评估物理科学领域“深度研究”能力的基准测试集。它由 200 个专家精心筛选的问题 组成,内容均衡覆盖 物理化学 两大领域。

任务类别

该基准测试集的问题涵盖 六种任务类别,模拟了真实的科学研究工作流程:

  • 多模态问答 (multimodal-qa):对科学图表进行感知和推理。
  • 长文本问答 (long-context-qa):对整篇文档及补充材料进行信息综合。
  • 结构化信息抽取 (structured-information-extraction):将信息解析为符合 JSON/CSV 格式的结构化数据。
  • 科学推理 (scientific-reasoning):基于科学原理进行多步骤推导。
  • 实验设计 (experimental-design):设计完整的合成或表征实验方案。
  • 代码生成 (code-generation):生成可执行的计算实现代码。

性能表现

当前最先进的系统在该基准测试集上表现挑战很大,最强基线模型 Gemini Deep Research 的准确率仅为 33.5%

数据构成

数据集托管在 HuggingFace 上,地址为:littletreee/PhySciBench

每个数据记录包含以下字段:

字段 描述
id 唯一标识符,例如 physci-001
question 问题文本
answer 标准答案
category 报告标签(long-form-answer / atomic-answer
type 任务类别(上述六种之一)
files 引用的图表或PDF文件名(位于 files/ 目录下)
rubrics 评分细则(用于需要按细则评分的题目)

评估方法

该基准测试提供了一个独立的评分器,用于评估模型预测结果。评分流程结合了精确匹配、基于规则的关键值检查、基于评分细则的 LLM 评判以及沙箱代码执行。

使用许可

搜集汇总
数据集介绍
PhySciBench 数据集图片
构建方式
在物理科学领域,随着多模态信息与复杂实验流程的涌现,传统问答基准已难以衡量人工智能的深度研究能力。为填补这一空白,研究者基于200个经专家严格筛选的物理与化学问题,精心构建了PhySciBench数据集。该数据集在构建时,依据真实科研工作流,将问题划分为多模态问答、长文本问答、结构化信息抽取、科学推理、实验方案设计及代码生成六大任务类型,确保了基准测试的全面性与专业性。
使用方法
使用PhySciBench数据集进行模型评估的过程便捷且灵活。研究者可通过简单的Python脚本下载仅包含元数据的轻量级JSON文件或包含图表、PDF的完整文件。评测时,需将模型对每个问题的预测结果以JSON Lines格式提交,随后利用集成的评分器进行打分。评分流程融合了精确匹配、基于规则的键值核验、由大语言模型驱动的评分准则判断以及沙箱隔离的代码执行等多种机制,能够分类型、分任务地精确输出模型在各维度上的平均准确率与详细分数。
背景与挑战
背景概述
近年来,人工智能在科学发现领域的应用日益广泛,但如何评估和提升大语言模型在物理科学中的深度研究能力仍是一个亟待解决的难题。为此,PhySciBench基准数据集于2026年由来自包括厦门大学在内的多家研究机构联合创建,核心研究团队由Jiang Yigeng等人领导。该数据集精心设计了200道由专家筛选的物理与化学问题,涵盖多模态问答、长上下文理解、结构化信息抽取、科学推理、实验设计及代码生成六大任务类别,全面模拟真实科学研究工作流。PhySciBench的发布填补了物理科学领域系统性深度研究评估框架的空白,为衡量和推动AI智能体在复杂科学场景下的表现提供了标准化平台,对相关领域的研究范式演进具有重要影响力。
当前挑战
PhySciBench所关注的领域问题在于,现有通用AI模型和智能体系统在处理物理科学中需要跨模态感知、长程文献综合、严格科学推理及可执行代码生成等复杂任务时表现欠佳,最强基线模型Gemini Deep Research的准确率仅为33.5%,揭示了巨大提升空间。在数据集构建过程中,挑战主要包括:确保200道问题覆盖物理学与化学核心分支且难度均衡,需依赖领域专家进行严格筛选与迭代;设计六大任务类别以真实反映科研工作流,包括对科学图表的多模态理解、完整文档的上下文整合、结构化数据抽取、基于原理的多步推导、完整实验方案设计以及可运行代码编写;同时,为每个问题配备细粒度评分标准,并开发独立的评估管道以支持多种评分策略(如精确匹配、规则校验及LLM评分),这些均对数据集的严谨性和实用性提出了高要求。
常用场景
经典使用场景
PhySciBench作为物理科学深度研究能力的权威评估基准,其经典使用场景集中于衡量前沿人工智能系统在真实科研流程中的综合表现。该基准精心设计了200道由领域专家筛选的物理与化学问题,覆盖多模态问答、长上下文理解、结构化信息抽取、科学推理、实验方案设计与代码生成六大核心任务类别。研究者和工程师可借助此基准,系统性地测试模型在理解科学图表、整合完整文献信息、遵循特定格式解析数据、运用基础原理进行多步推导、构建完整实验流程以及编写可执行代码等方面的能力,从而全面洞悉智能体在物理科学深度研究中的优势与局限。
解决学术问题
PhySciBench旨在填补当前缺乏针对物理科学领域深度研究能力标准化评估工具的空白。学术界长期面临一个关键挑战:尽管通用大语言模型和智能体系统在众多任务上表现优异,但它们在面对需要深入理解物理原理、化学机制以及复杂科学工作流的真实研究问题时,其能力边界尚未得到系统性的量化与剖析。该基准通过引入涵盖完整科研链条的多维度任务,揭示了现有最先进系统(如Gemini Deep Research)仅达到33.5%准确率的显著性能瓶颈,为理解人工智能在物理科学认知上的根本性缺陷提供了锐利的分析工具。其失败模式分析催生了更优架构的探索,有力推动了科学智能评估方法论的系统性进步。
实际应用
在现实世界中,PhySciBench所评估的能力直接映射到科研辅助、教育智能化和工业研发等关键应用场景。例如,在药物分子设计中,系统需理解化学结构图(多模态问答)、从多篇文献中提取反应条件(长上下文问答与结构化信息抽取)、基于热力学原理预测反应可行性(科学推理)、设计包含纯化步骤的实验方案(实验设计)并编写计算模拟代码(代码生成)。该基准为开发能够加速材料筛选、自动化文献分析、辅助实验优化的智能科研助手提供了量化的性能标尺。企业和研究机构可据此筛选出在特定科学任务上表现可靠的模型,从而在减少人力成本的同时提升科学探索的广度与深度。
数据集最近研究
最新研究方向
在物理与化学领域,当前前沿研究正聚焦于构建能够模拟真实科研工作流的深度研究智能体。PhySciBench作为首个覆盖多模态问答、长上下文综合、结构化信息提取、科学推理、实验设计及代码生成六大任务的综合性基准,精准揭示了现有顶尖AI系统在物理科学深度研究中的显著短板——最强基线Gemini Deep Research的准确率仅达33.5%。这一发现催生了模块化多智能体框架DelveAgent的诞生,其通过自适应规划循环、双粒度记忆与层级物理反思机制,有望突破当前通用模型在科学推理与实验设计上的瓶颈。该基准的发布不仅为评估和推动AI在物理科学中的高阶认知能力提供了标准化测试场,更标志着科研自动化从简单的数据分类向复杂实验设计与科学发现迈出了关键一步,对加速物理化学领域的研究范式变革具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务