SeePhys
收藏资源简介:
SeePhys是一个全谱多模态基准,用于评估不同知识水平下的物理推理能力。它包含2000个经过严格验证的问题,涵盖从中学生到博士资格考试水平的广泛知识范围,涉及7个主要领域的经典和现代物理学。
SeePhys is a full-spectrum multimodal benchmark designed to evaluate physical reasoning capabilities across varying levels of academic knowledge. It comprises 2000 rigorously validated questions spanning a broad knowledge range from middle school level up to doctoral qualifying exam level, covering classical and modern physics across seven major domains.
SeePhys 数据集概述
数据集简介
- 名称:SeePhys (Vision-Based Physics Reasoning Benchmark)
- 类型:多模态物理推理基准测试
- 论文:SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
- 发布机构:多机构联合研究团队(Sun Yat-sen University, ETH Zurich等)
- 发布时间:2025年5月
核心特征
- 数据规模:2,000个经过严格验证的物理问题
- 知识层级:涵盖从中学到博士资格考试的全谱系物理知识
- 学科领域:7大物理学主要领域(包含经典和现代物理)
- 视觉信息:
- 21种专业图表类型(如费曼图、电路图等)
- 两个视觉信息子集(Vision-Essential和Vision-Optional)
- 2,000个纯视觉实例(问题以图片形式呈现)
评估结果
- 测试模型:28个领先的LLM和MLLM模型
- 最佳表现:
- LLM: DeepSeek-R1(42.2%准确率)
- MLLM: Gemini-2.5-Pro(54.9%准确率)
- 关键发现:当前模型最高准确率不超过55%,视觉信息对物理推理有显著影响
数据获取
- Huggingface地址:SeePhys/SeePhys
- 评估工具:基于VLMEvalKit
相关挑战
- ICML 2025挑战赛:AI for Math Workshop
- 提交指南:Codabench
贡献者
来自中山大学、苏黎世联邦理工学院、华为诺亚方舟实验室和香港大学的研究团队。
引用格式
latex @article{xiang2025seephys, title={SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning}, author={Kun Xiang, Heng Li, Terry Jingchen Zhang, Yinya Huang, Zirong Liu, Peixin Qu, Jixi He, Jiaqi Chen, Yu-Jie Yuan, Jianhua Han, Hang Xu, Hanhui Li, Mrinmaya Sachan, Xiaodan Liang}, journal={arXiv preprint arXiv:2505.19099}, year={2025} }




