Empirical assessment of ChatGPT's answering capabilities in natural science and engineering
收藏官方服务:
资源简介:
This is a dataset
应用场景:
创建时间:
2023-08-07
相关数据集
OSVBench
OSVBench是一个用于评估大型语言模型(LLMs)在生成操作系统内核验证任务相关完整规范代码方面的基准。该基准将规范生成问题定义为在语法和语义的限定范围内进行程序合成问题,并为LLMs提供编程模型。LLMs需要理解提供的验证假设和潜在的语法和语义空间,然后在操作系统的高级功能描述的指导下,为可能存在错误的操作系统代码实现生成完整的规范。该基准建立在真实的操作系统内核Hyperkernel之上,
arXiv2025-04-30 更新650
open-llm-leaderboard/details_TheBloke__llama-30b-supercot-SuperHOT-8K-fp16
--- pretty_name: Evaluation run of TheBloke/llama-30b-supercot-SuperHOT-8K-fp16 dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [TheBloke/llama-30b-supercot-Sup
Hugging Face2023-08-27 更新140
open-llm-leaderboard/details_automerger__Strangemerges_32Yamshadow-7B
--- pretty_name: Evaluation run of automerger/Strangemerges_32Yamshadow-7B dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [automerger/Strangemerges_32Yamshadow
Hugging Face2024-03-22 更新120
open-llm-leaderboard/details_FoxEngineAi__Mega-Destroyer-8x7B
该数据集是在模型FoxEngineAi/Mega-Destroyer-8x7B在Open LLM Leaderboard上的评估运行期间自动创建的。它由63个配置组成,每个配置对应一个评估任务。数据集是从2次运行中生成的,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个额外的配置results存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboar
Hugging Face2024-03-15 更新210
AUEB-NLP/greek-bar-bench
GreekBarBench 是一个用于评估大型语言模型(LLM)在五个不同法律领域内进行复杂法律推理能力的基准数据集。该数据集由希腊律师资格考试(2015-2024年)中的法律问题组成,要求模型在开放书籍格式下,结合案件事实、法律问题以及相关法律条文进行推理,并提供包含明确引用的案件事实和法律条文的自由文本答案。数据集旨在评估复杂的法律推理能力,包括多跳推理和法律条文的准确应用。
Hugging Face2025-06-06 更新130



