遇见数据集

PhySciBench

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

PhySciBench是一个用于评估物理科学领域深度研究能力的综合性基准测试数据集,源自论文《Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark》。该数据集旨在反映真实世界的科学工作流程,包含200个由专家精心策划的问题,均衡覆盖物理学和化学两大领域。数据内容围绕六个核心任务类别构建:multimodal-qa(基于科学图表的感知与推理)、long-context-qa(跨完整文档及补充材料的综合理解)、structured-information-extraction(符合模式的JSON/CSV解析)、scientific-reasoning(基于原理的多步推导)、experimental-design(完整的程序化合成/表征协议设计)以及code-generation(可执行的计算实现)。数据以单一测试集的形式提供,每条记录包含唯一标识符(id)、问题文本(question)、标准答案(answer)、报告标签(category,分为long-form-answer和atomic-answer)、任务类型(type)、引用的文件列表(files)以及评分规则(rubrics,部分项为null)。数据集主体文件为physcibench.json,同时附带一个files/目录,包含问题中引用的141个图表和PDF源文件。该基准测试挑战性高,现有最强基线模型的准确率仅为33.5%。数据集严格限定用于学术研究,禁止任何形式的商业使用。

PhySciBench is a comprehensive benchmark dataset for evaluating deep research capabilities in the physical sciences, originating from the paper Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark. It aims to reflect real-world scientific workflows, containing 200 expert-curated questions that evenly cover physics and chemistry. The data is structured around six core task categories: multimodal-qa (perception and reasoning based on scientific charts), long-context-qa (comprehensive understanding across full documents and supplementary materials), structured-information-extraction (parsing of JSON/CSV in compliance with schemas), scientific-reasoning (multi-step derivation based on principles), experimental-design (complete procedural synthesis/characterization protocol design), and code-generation (executable computational implementations). It is provided as a single test set, with each record including a unique identifier (id), question text (question), standard answer (answer), report label (category, divided into long-form-answer and atomic-answer), task type (type), referenced file list (files), and scoring rubrics (rubrics, with some items as null). The main dataset file is physcibench.json, accompanied by a files/ directory containing 141 referenced charts and PDF source files. This benchmark is highly challenging, with the current strongest baseline model achieving only 33.5% accuracy. The dataset is strictly limited to academic research and prohibits any commercial use.

创建时间:
2026-06-20
原始信息汇总

数据集:PhySciBench

PhySciBench 是一个用于评估物理科学领域深度研究能力的基准测试,由论文 "Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark" (arXiv:2606.18648) 提出。

  • 论文链接: https://arxiv.org/abs/2606.18648
  • 代码与评估: https://github.com/yigengjiang/physci-deepresearch

基本信息

  • 语言: 英语
  • 标签: 物理、化学、深度研究、科学推理、多模态、基准测试
  • 规模: 少于 1000 条记录(实际 200 条)
  • 许可证: physcibench-academic-restricted(仅限学术研究,禁止商业使用)

数据集构成

  • 数据文件: physcibench.json,包含 200 条记录,作为唯一的 test 划分。
  • 补充文件: files/ 目录下包含 141 个引用的图表和源 PDF 文件。仅使用 physcibench.json 即可运行官方评分器。

任务类别

数据集平衡涵盖物理和化学两个学科,包含 六种任务类型

  • multimodal-qa:对科学图表进行感知与推理
  • long-context-qa:综合全文及补充材料进行回答
  • structured-information-extraction:按模式将信息解析为 JSON/CSV 格式
  • scientific-reasoning:基于原理的多步骤推导
  • experimental-design:程序完备的合成/表征方案设计
  • code-generation:生成可执行的计算实现代码

记录字段说明

字段 描述
id 唯一标识符,例如 physci-001
question 问题文本
answer 标准答案
category 报告标签(long-form-answeratomic-answer
type 任务类别(上述六种之一)
files files/ 目录下引用的图表/PDF 文件名
rubrics 评分标准(用于基于评分规则的项目;否则为 null

基准性能

  • 最强基线模型 Gemini Deep Research 的准确率仅为 33.5%,表明现有系统在该基准上表现困难。

使用方式

python from huggingface_hub import hf_hub_download import json

path = hf_hub_download("littletreee/PhySciBench", "physcibench.json", repo_type="dataset") data = json.load(open(path)) print(len(data), "records")

引用

@article{jiang2026physcidr, title = {Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark}, author = {Jiang, Yigeng and Yang, Tengchao and Cui, Taoyong and Wan, Jiaxing and Wang, Yuan and Wang, Weida and Liu, Zhiyu and Peng, Chuyi and Luo, Binzhao and Gao, Maoli and Huang, Huaihai and Zeng, Yuqianer and Zheng, Ziyang and Huang, Dongchen and Chen, Chao and Liu, Zichao and Shen, Weiping and Pu, Shuchen and Zhou, Siyu and Ma, Runmin and Hu, Yusong and Chao, Fei and Zhang, Bo and Zheng, Xiawu and Wang, Zifu and Bai, Lei and Cai, Yunqi and Zhang, Shufei}, journal = {arXiv preprint arXiv:2606.18648}, year = {2026} }

搜集汇总
数据集介绍
PhySciBench 数据集图片
构建方式
PhySciBench是一个专门评估物理科学领域深度研究能力的高标准基准数据集,其构建过程体现了严谨的学术性与专业性。该数据集由200道经由领域专家精心遴选与编制的题目构成,内容均衡覆盖物理学与化学两大核心学科。所有问题被系统性地划分为六类反映真实科研工作流的任务范畴:多模态问答、长上下文问答、结构化信息抽取、科学推理、实验设计以及代码生成,每一类别均旨在模拟实际研究中的关键认知环节。数据集的答案与评分标准也由专家团队提供,确保评估结果的权威性与可靠性。
特点
PhySciBench数据集的核心特点在于其高难度与多维度的评估框架。当前最强的基线模型Gemini Deep Research在该基准上仅能达到33.5%的准确率,凸显了任务对模型在复杂科学推理、多模态融合与长程信息整合方面的极高要求。此外,数据集的六类任务覆盖从感知理解到自主执行的完整研究链条,使得评估结果能够全面反映模型在真实科研场景下的综合能力。每个问题都配备了详细的评分细则和标准答案,支持细粒度的自动化评判,从而保证评测过程的一致性与可重复性。
使用方法
使用PhySciBench数据集进行模型评估时,研究者可通过HuggingFace平台直接加载数据。具体而言,调用huggingface_hub库的hf_hub_download函数下载physcibench.json文件,该文件包含200条测试记录及其元数据字段,包括问题文本、标准答案、任务类型与评分规则。配合GitHub上官方提供的LLM-as-judge评估管线,用户将模型生成的预测结果以predictions.jsonl格式提交,即可获得详尽的metrics.json评估报告。这一标准化的使用流程大幅降低了复现与对比研究的门槛。
背景与挑战
背景概述
在物理与化学等基础科学领域,前沿研究常依赖于对长篇幅文献、复杂图表、结构化数据提取及多步推理的综合能力,传统评测基准难以覆盖此类深度研究场景。PhySciBench于2026年由江乙耿等来自多个研究机构的研究者共同提出,旨在系统评估大规模语言模型在物理科学中的深度研究能力。该基准包含200道经专家精心设计的跨模态试题,覆盖多模态问答、长上下文理解、结构化信息抽取、科学推理、实验方案设计及代码生成六大任务类别,全面映射真实科研流程。当前最优模型Gemini Deep Research仅达到33.5%的正确率,揭示出现有模型在科学深度推理上的显著局限,为相关领域提供了具有挑战性的评测标杆。
当前挑战
PhySciBench所面对的领域挑战在于,现有模型对物理与化学科研中多步骤、跨模态、依赖专业知识的复杂任务处理能力薄弱,难以在真实研究场景中实现有效的深度推理。从构建视角而言,挑战主要来自三个方面:其一,设计能忠实反映科研流程的多样任务类型需要专家深度参与,以确保问题与科研范式的高度契合;其二,答案与评分体系的构建需兼顾开放性长回答与精确原子答案,增加了标注与自动评估的复杂度;其三,覆盖图表、全文等多模态数据的集成,对数据版权与引用管理提出了严格的合规要求,限制了基准的大规模扩展。
常用场景
经典使用场景
PhySciBench作为物理科学领域深度研究能力的权威评估基准,其最经典的使用场景是对多模态大语言模型在真实科学工作流中的综合性能进行系统性评测。该基准精心设计了200道由专家编写的题目,横跨物理与化学两大核心学科,涵盖多模态问答、长文本理解、结构化信息抽取、科学推理、实验方案设计与代码生成六大任务类型。研究者通过评估模型在这些任务上的表现,能够全面诊断其在科学感知、逻辑推理与复杂问题求解方面的能力短板。尤其值得注意的是,当前最先进的Gemini Deep Research系统在该基准上的准确率仅为33.5%,这凸显了PhySciBench在推动科学推理模型研究中的独特价值与挑战性。
解决学术问题
PhySciBench有效解决了物理科学领域中缺乏标准化、多维度的深度研究评估基准这一关键学术问题。以往的科学QA基准往往局限于简单的知识问答或单一步骤的推理,难以反映科研人员在真实工作中需要综合运用文献阅读、图表理解、数据提取与实验设计等多项技能的复杂场景。该基准通过整合多种任务类型与多模态数据,填补了这一空白,使得研究者能够客观衡量AI系统在应对完整科学问题链时的综合能力。其影响力在于推动了从单一任务评测向系统化科学推理能力评估的范式转变,为下一代科学人工智能的研究提供了坚实的数据支撑与方向指引。
衍生相关工作
PhySciBench的发布催生了一系列富有启发的衍生研究方向。该基准所配套的多智能体框架启发了研究者探索如何通过分工协作的Agent系统来应对复杂科学问题,例如结合视觉编码器与推理引擎的混合架构设计。其六大任务分类框架被后续工作广泛采纳,用于构建特定学科(如材料科学或生物化学)的垂直深度研究基准。此外,基于该基准的低准确率结果,研究者开始聚焦于改进大语言模型在长文本与多模态融合场景下的推理连贯性,推动了一系列针对科学图表感知增强与结构化输出约束的研究工作。该基准还促进了自动评分机制与裁判模型在科学领域评估中的规范化应用,为科学AI的标准化评估体系奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务