遇见数据集

open-llm-leaderboard-old/details_Steelskull__Umbra-MoE-4x10.7

收藏
Hugging Face2024-01-21 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型Steelskull/Umbra-MoE-4x10.7进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

该数据集是在Open LLM Leaderboard上对模型Steelskull/Umbra-MoE-4x10.7进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

原始信息汇总

数据集概述

数据集简介

该数据集是在对模型Steelskull/Umbra-MoE-4x10.7进行评估运行期间自动创建的,用于Open LLM Leaderboard

数据集组成

  • 数据集包含63个配置,每个配置对应一个评估任务。
  • 数据集从1次运行中创建,每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train"分割始终指向最新结果。
  • 额外的"results"配置存储所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Steelskull__Umbra-MoE-4x10.7", "harness_winogrande_5", split="train")

最新结果

以下是最新结果(来自2024-01-21T00:54:53.184339的运行):

python { "all": { "acc": 0.6674032750190299, "acc_stderr": 0.0314926889496487, "acc_norm": 0.6684896093314947, "acc_norm_stderr": 0.03213090427046816, "mc1": 0.5324357405140759, "mc1_stderr": 0.017466632149577613, "mc2": 0.6782098863716366, "mc2_stderr": 0.015273304296026847 }, "harness|arc:challenge|25": { "acc": 0.6715017064846417, "acc_stderr": 0.013724978465537302, "acc_norm": 0.7030716723549488, "acc_norm_stderr": 0.013352025976725228 }, "harness|hellaswag|10": { "acc": 0.7002589125672177, "acc_stderr": 0.0045720816569656455, "acc_norm": 0.8781119298944433, "acc_norm_stderr": 0.0032648787375868854 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.39, "acc_stderr": 0.04902071300001975, "acc_norm": 0.39, "acc_norm_stderr": 0.04902071300001975 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6074074074074074, "acc_stderr": 0.04218506215368879, "acc_norm": 0.6074074074074074, "acc_norm_stderr": 0.04218506215368879 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.756578947368421, "acc_stderr": 0.034923496688842384, "acc_norm": 0.756578947368421, "acc_norm_stderr": 0.034923496688842384 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.73, "acc_stderr": 0.04461960433384741, "acc_norm": 0.73, "acc_norm_stderr": 0.04461960433384741 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6830188679245283, "acc_stderr": 0.028637235639800886, "acc_norm": 0.6830188679245283, "acc_norm_stderr": 0.028637235639800886 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7708333333333334, "acc_stderr": 0.03514697467862388, "acc_norm": 0.7708333333333334, "acc_norm_stderr": 0.03514697467862388 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.41, "acc_stderr": 0.049431107042371025, "acc_norm": 0.41, "acc_norm_stderr": 0.049431107042371025 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.46, "acc_stderr": 0.05009082659620333, "acc_norm": 0.46, "acc_norm_stderr": 0.05009082659620333 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.34, "acc_stderr": 0.04760952285695235, "acc_norm": 0.34, "acc_norm_stderr": 0.04760952285695235 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6705202312138728, "acc_stderr": 0.03583901754736412, "acc_norm": 0.6705202312138728, "acc_norm_stderr": 0.03583901754736412 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.37254901960784315, "acc_stderr": 0.048108401480826346, "acc_norm": 0.37254901960784315, "acc_norm_stderr": 0.048108401480826346 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.76, "acc_stderr": 0.04292346959909281, "acc_norm": 0.76, "acc_norm_stderr": 0.04292346959909281 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.625531914893617, "acc_stderr": 0.03163910665367291, "acc_norm": 0.625531914893617, "acc_norm_stderr": 0.03163910665367291 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.5175438596491229, "acc_stderr": 0.04700708033551038, "acc_norm": 0.5175438596491229, "acc_norm_stderr": 0.04700708033551038 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.6068965517241379, "acc_stderr": 0.040703290137070705, "acc_norm": 0.6068965517241379, "acc_norm_stderr": 0.040703290137070705 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.47883597883597884, "acc_stderr": 0.025728230952130726, "acc_norm": 0.47883597883597884, "acc_norm_stderr": 0.025728230952130726 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.4523809523809524, "acc_stderr": 0.044518079590553275, "acc_norm": 0.4523809523809524, "acc_norm_stderr": 0.044518079590553275 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.35, "acc_stderr": 0.0479372485441102, "acc_norm": 0.35, "acc_norm_stderr": 0.0479372485441102 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.8129032258064516, "acc_stderr": 0.022185710092252252, "acc_norm": 0.8129032258064516, "acc_norm_stderr": 0.022185710092252252 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5024630541871922, "acc_stderr": 0.03517945038691063, "acc_norm": 0.5024630541871922, "acc_norm_stderr": 0.03517945038691063 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.72, "acc_stderr": 0.04512608598542128, "acc_norm": 0.72, "acc_norm_stderr": 0.04512608598542128 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.8, "acc_stderr": 0.031234752377721175, "acc_norm": 0.8, "acc_norm_stderr": 0.031234752377721175 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.8787878787878788, "acc_stderr": 0.023253157951942084, "acc_norm": 0.8787878787878788, "acc_norm_stderr": 0.023253157951942084 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.9015544041450777, "acc_stderr": 0.02150024957603347, "acc_norm": 0.9015544041450777, "acc_norm_stderr": 0.02150024957603347 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6538461538461539, "acc_stderr": 0.024121125416941183, "acc_norm": 0.6538461538461539, "acc_norm_stderr": 0.024121125416941183 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.35555555555555557, "acc_stderr": 0.029185714949857403, "acc_norm": 0.35555555555555557, "acc_norm_stderr": 0.029185714949

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_Steelskull__Umbra-MoE-4x10.7 数据集图片
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 为模型性能的标准化度量提供了重要平台。该数据集是模型 Steelskull/Umbra-MoE-4x10.7 在 Leaderboard 上自动生成的评估记录。其构建过程基于一次完整的评估运行,涵盖了 63 个不同的任务配置,每个配置对应一个特定的评估任务。数据以 Parquet 格式存储,并通过时间戳分割来区分不同运行批次,其中“train”分割始终指向最新一次评估的结果。此外,一个名为“results”的独立配置汇总了所有任务的聚合指标,用于在 Leaderboard 上展示综合性能。
特点
该数据集的核心特点在于其结构化的任务细分与动态更新机制。每个任务配置均包含详细的评估指标,如准确率及其标准误差,覆盖了从 ARC-Challenge 到 GSM8K 等多样化的推理与知识测试。数据集的“latest”分割设计确保了用户始终能访问到模型的最新评估结果,而历史运行数据则通过时间戳分割完整保留,便于进行纵向性能对比。这种设计不仅提供了微观层面的任务级洞察,还通过“results”配置实现了宏观性能的快速概览,全面反映了模型在多维度上的能力。
使用方法
使用该数据集时,研究人员可通过 Hugging Face 的 datasets 库便捷加载特定任务的评估细节。例如,通过指定配置名称如“harness_winogrande_5”和分割“train”,即可获取 WinoGrande 任务的最新结果。对于需要分析历史运行数据的场景,用户可利用具体的时间戳分割来追溯特定批次的评估记录。数据集的灵活加载方式支持用户按需提取单任务或多任务的指标,从而深入分析模型在特定领域(如医学、法律或数学)的表现,为模型优化与对比研究提供了坚实的数据基础。
背景与挑战
背景概述
该数据集源自HuggingFace社区发起的Open LLM Leaderboard评测平台,专为追踪和比较大规模语言模型(LLMs)的性能而设计。由HuggingFace研究团队于2024年初创建,核心研究问题在于系统化评估混合专家模型(MoE)架构在多样化自然语言理解与推理任务中的表现。数据集记录了Steelskull团队开发的Umbra-MoE-4x10.7模型在63个配置项上的评测结果,覆盖ARC挑战赛、HellaSwag常识推理、MMLU多学科知识以及GSM8K数学问题等基准测试。作为开放式排行榜的附属资源,该数据集为社区提供了透明、可复现的模型评估基准,推动了MoE架构在效率与准确性平衡方面的实证研究,对低参数规模模型的性能优化具有重要参考价值。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两个层面。在领域问题方面,核心挑战在于如何科学衡量混合专家模型在稀疏激活机制下的泛化能力,尤其需应对MMLU中57个学科子任务的知识广度与深度差异,以及GSM8K数学推理对多步逻辑链的依赖性。构建过程中,挑战集中于评测流程的标准化与可复现性:需确保63个配置项在不同时间戳的评测结果具有一致性,同时处理模型输出在truthfulqa等对抗性测试中的虚假相关性。此外,数据集的版本管理面临挑战,需通过parquet文件分片存储与latest split动态指向最新结果,以应对评测任务覆盖范围可能变化带来的数据完整性风险。
常用场景
经典使用场景
在大型语言模型评估领域,该数据集作为Open LLM Leaderboard的标准化评测结果存储库,承载着对Steelskull/Umbra-MoE-4x10.7混合专家模型的系统性性能刻画。它通过63个独立配置项,分别对应ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande及GSM8K等经典基准任务,完整记录了模型在常识推理、知识理解、真实性判别、常识消歧与数学求解等多维度上的细粒度表现。研究者可便捷地通过HuggingFace Datasets库加载各任务的运行细节,从而深入分析模型在不同能力维度上的优势与局限。
解决学术问题
该数据集系统性地解决了大语言模型评估中结果可复现性与细粒度分析缺失的学术难题。传统评估往往仅呈现聚合指标,难以追溯单次运行的详细表现,而此数据集通过将每次评估的完整结果以Parquet格式持久化存储,并建立按时间戳划分的数据分片机制,使得研究者能够精确复现特定时刻的模型性能。这为探究模型在57个MMLU子领域(如抽象代数、临床知识、法学等)中的知识覆盖盲区,以及分析不同推理任务(如数学推理、常识推理)间的能力迁移规律提供了坚实的数据基础,显著推动了评估方法的科学化与透明化。
衍生相关工作
该数据集衍生了一系列围绕大语言模型评估标准化的重要工作。其底层架构启发了后续Open LLM Leaderboard中多模型对比分析框架的设计,使得研究者能够系统性地比较不同架构(如Dense与MoE)在统一评测体系下的表现差异。此外,基于该数据集积累的细粒度结果,学术界已开展关于模型能力边界与数据污染检测的交叉研究,例如通过比对模型在MMLU子任务上的得分分布与训练数据重叠度,探索评估的公平性。这些衍生工作共同推动了大语言模型评测从粗粒度排名向精细化诊断的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务