相关数据集
open-llm-leaderboard/details_TheBloke__llama-30b-supercot-SuperHOT-8K-fp16
--- pretty_name: Evaluation run of TheBloke/llama-30b-supercot-SuperHOT-8K-fp16 dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [TheBloke/llama-30b-supercot-Sup
Hugging Face2023-08-27 更新140
open-llm-leaderboard/details_DreadPoor__Eros_n_Psyche-7B-Model_Stock
--- pretty_name: Evaluation run of DreadPoor/Eros_n_Psyche-7B-Model_Stock dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [DreadPoor/Eros_n_Psyche-7B-Model_Stoc
Hugging Face2024-04-06 更新110
smalleval/mmlu-nano
# SmallEval: Browser-Friendly LLM Evaluation Datasets 🚀 [](https://cloudcode.ai) SmallEval is a curated
Hugging Face2025-01-20 更新90
AUEB-NLP/greek-bar-bench
GreekBarBench 是一个用于评估大型语言模型(LLM)在五个不同法律领域内进行复杂法律推理能力的基准数据集。该数据集由希腊律师资格考试(2015-2024年)中的法律问题组成,要求模型在开放书籍格式下,结合案件事实、法律问题以及相关法律条文进行推理,并提供包含明确引用的案件事实和法律条文的自由文本答案。数据集旨在评估复杂的法律推理能力,包括多跳推理和法律条文的准确应用。
Hugging Face2025-06-06 更新130
open-llm-leaderboard/details_FelixChao__Gemma-10.2B-Coder
--- pretty_name: Evaluation run of FelixChao/Gemma-10.2B-Coder dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [FelixChao/Gemma-10.2B-Coder](https://huggingface
Hugging Face2024-03-21 更新110



