官方服务:
资源简介:
Dataset for APORIA benchmark
应用场景:
创建时间:
2026-04-06
相关数据集
open-llm-leaderboard/details_mosaicml__mpt-7b-8k-instruct
该数据集是在Open LLM Leaderboard上对模型mosaicml/mpt-7b-8k-instruct进行评估时自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集由7次运行创建,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于在Open LLM Le
Hugging Face2023-12-04 更新150
DCAgent2/dev_set_v2_100k_epochs3__Qwen3_8B_20260325_231128
--- dataset_info: features: - name: conversations list: - name: content dtype: string - name: role dtype: string - name: agent dtype: string - name: model dtype
Hugging Face2026-03-26 更新110
OMNIX_Benchmarks_Latest
OMNIX Benchmarks 是一个用于评估和基准测试大型语言模型性能的数据集。它旨在通过一套标准化的指标对模型进行综合比较,涵盖格式遵循、逻辑推理、知识回忆、约束遵循、成功率(首次通过和最终)以及推理延迟等多个关键维度。该数据集支持文本生成和问答任务类别,并提供了对多个流行模型(如 Qwen、Gemma、Llama 等系列的不同版本)在上述维度上的量化评分和排名分析,帮助研究人员和开发者了解
Hugging Face2026-07-07 更新100
AUEB-NLP/greek-bar-bench
GreekBarBench 是一个用于评估大型语言模型(LLM)在五个不同法律领域内进行复杂法律推理能力的基准数据集。该数据集由希腊律师资格考试(2015-2024年)中的法律问题组成,要求模型在开放书籍格式下,结合案件事实、法律问题以及相关法律条文进行推理,并提供包含明确引用的案件事实和法律条文的自由文本答案。数据集旨在评估复杂的法律推理能力,包括多跳推理和法律条文的准确应用。
Hugging Face2025-06-06 更新130
open-llm-leaderboard/details_DreadPoor__Eros_n_Psyche-7B-Model_Stock
--- pretty_name: Evaluation run of DreadPoor/Eros_n_Psyche-7B-Model_Stock dataset_summary: "Dataset automatically created during the evaluation run of model\ \ [DreadPoor/Eros_n_Psyche-7B-Model_Stoc
Hugging Face2024-04-06 更新110



