Appendix 2 for "From Factual to Critical: Benchmarking Large Language Models Across Physics Domains and Cognitive Levels"
收藏官方服务:
资源简介:
This dataset contains topic classifications and cognitive-level characterizations of physics multiple-choice questions, along with results (1 for correct, 0 for incorrect answer) of 13 large language models (LLMs).
提供机构:
Zenodo创建时间:
2026-05-18



