ScholarBench
收藏资源简介:
ScholarBench是一个专注于深度专家知识和复杂学术问题解决的基准,旨在评估大型语言模型(LLMs)在学术推理能力。该数据集由来自不同学术领域的5,031个韩文示例和5,309个英文示例组成,涵盖了五个不同的问题类型。数据集通过一个三步过程构建,旨在确保高质量的评价数据。该基准旨在评估LLMs在抽象、理解和推理方面的能力,并涵盖了八个不同的研究领域。此外,该数据集是一个英语-韩语的双语数据集,方便同时评估LLMs在两种语言中的语言能力。
ScholarBench is a benchmark focusing on deep expert knowledge and complex academic problem-solving, aiming to evaluate the academic reasoning capabilities of large language models (LLMs). This dataset comprises 5,031 Korean examples and 5,309 English examples from various academic disciplines, covering five distinct question types. The dataset is constructed via a three-step process to ensure high-quality evaluation data. This benchmark is designed to assess LLMs' abilities in abstraction, comprehension and reasoning, spanning eight different research fields. Additionally, this is an English-Korean bilingual dataset, facilitating simultaneous evaluation of LLMs' language proficiency in both languages.

- 1ScholarBench: A Bilingual Benchmark for Abstraction, Comprehension, and Reasoning Evaluation in Academic ContextsHNU, KAIST, UCSB, KISTI · 2025年



