PhySciBench
收藏资源简介:
PhySciBench是一个用于评估物理科学深度研究能力的基准数据集,包含200个专家策划的问题,涵盖物理和化学领域,涉及六个任务类别,如多模态问答、长文本问答、结构化信息提取等,旨在反映真实世界的科学工作流程。
PhySciBench is a benchmark dataset for evaluating in-depth research capabilities in physical sciences. It contains 200 expert-curated questions spanning the fields of physics and chemistry, covering six task categories such as multimodal question answering, long-text question answering, structured information extraction, and more. This dataset aims to reflect real-world scientific workflows.
数据集概览:PhySciBench
PhySciBench 是一个专门用于评估物理科学领域“深度研究”能力的基准测试集。它由 200 个专家精心筛选的问题 组成,内容均衡覆盖 物理 与 化学 两大领域。
任务类别
该基准测试集的问题涵盖 六种任务类别,模拟了真实的科学研究工作流程:
- 多模态问答 (
multimodal-qa):对科学图表进行感知和推理。 - 长文本问答 (
long-context-qa):对整篇文档及补充材料进行信息综合。 - 结构化信息抽取 (
structured-information-extraction):将信息解析为符合 JSON/CSV 格式的结构化数据。 - 科学推理 (
scientific-reasoning):基于科学原理进行多步骤推导。 - 实验设计 (
experimental-design):设计完整的合成或表征实验方案。 - 代码生成 (
code-generation):生成可执行的计算实现代码。
性能表现
当前最先进的系统在该基准测试集上表现挑战很大,最强基线模型 Gemini Deep Research 的准确率仅为 33.5%。
数据构成
数据集托管在 HuggingFace 上,地址为:littletreee/PhySciBench。
每个数据记录包含以下字段:
| 字段 | 描述 |
|---|---|
id |
唯一标识符,例如 physci-001 |
question |
问题文本 |
answer |
标准答案 |
category |
报告标签(long-form-answer / atomic-answer) |
type |
任务类别(上述六种之一) |
files |
引用的图表或PDF文件名(位于 files/ 目录下) |
rubrics |
评分细则(用于需要按细则评分的题目) |
评估方法
该基准测试提供了一个独立的评分器,用于评估模型预测结果。评分流程结合了精确匹配、基于规则的关键值检查、基于评分细则的 LLM 评判以及沙箱代码执行。
使用许可
- 评估代码:采用 Apache License 2.0 许可。
- PhySciBench 数据集:仅限学术研究使用,具体许可条款见 DATA_LICENSE.md。





