遇见数据集

open-llm-leaderboard/details_FoxEngineAi__Mega-Destroyer-8x7B

收藏
Hugging Face2024-03-15 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是在模型FoxEngineAi/Mega-Destroyer-8x7B在Open LLM Leaderboard上的评估运行期间自动创建的。它由63个配置组成,每个配置对应一个评估任务。数据集是从2次运行中生成的,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个额外的配置results存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。可以使用`datasets`库中的`load_dataset`函数加载该数据集。

该数据集是在模型FoxEngineAi/Mega-Destroyer-8x7B在Open LLM Leaderboard上的评估运行期间自动创建的。它由63个配置组成,每个配置对应一个评估任务。数据集是从2次运行中生成的,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个额外的配置results存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。可以使用`datasets`库中的`load_dataset`函数加载该数据集。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集名称

  • pretty_name: Evaluation run of FoxEngineAi/Mega-Destroyer-8x7B

数据集描述

数据集组成

  • 数据结构: 包含63个配置,每个配置对应一个评估任务。
  • 数据来源: 数据集由2次运行创建,每次运行作为一个特定的分割,分割名称使用运行时间戳命名。
  • 特别配置: 有一个额外的配置“results”,存储所有运行的聚合结果,用于计算和显示聚合指标。

加载数据示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_FoxEngineAi__Mega-Destroyer-8x7B", "harness_winogrande_5", split="train")

最新结果

  • 结果来源: 来自2024-03-15T05:23:16.350310的运行结果,详细结果见此处

数据集配置详情

配置列表

  • config_name: harness_arc_challenge_25

    • data_files:
      • split: 2024_03_13T23_28_53.163127
        • path: **/details_harness|arc:challenge|25_2024-03-13T23-28-53.163127.parquet
      • split: 2024_03_15T05_23_16.350310
        • path: **/details_harness|arc:challenge|25_2024-03-15T05-23-16.350310.parquet
      • split: latest
        • path: **/details_harness|arc:challenge|25_2024-03-15T05-23-16.350310.parquet
  • config_name: harness_gsm8k_5

    • data_files:
      • split: 2024_03_13T23_28_53.163127
        • path: **/details_harness|gsm8k|5_2024-03-13T23-28-53.163127.parquet
      • split: 2024_03_15T05_23_16.350310
        • path: **/details_harness|gsm8k|5_2024-03-15T05-23-16.350310.parquet
      • split: latest
        • path: **/details_harness|gsm8k|5_2024-03-15T05-23-16.350310.parquet
  • config_name: harness_hellaswag_10

    • data_files:
      • split: 2024_03_13T23_28_53.163127
        • path: **/details_harness|hellaswag|10_2024-03-13T23-28-53.163127.parquet
      • split: 2024_03_15T05_23_16.350310
        • path: **/details_harness|hellaswag|10_2024-03-15T05-23-16.350310.parquet
      • split: latest
        • path: **/details_harness|hellaswag|10_2024-03-15T05-23-16.350310.parquet
  • config_name: harness_hendrycksTest_5

    • data_files:
      • split: 2024_03_13T23_28_53.163127
        • path:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2024-03-13T23-28-53.163127.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2024-03-13T23-28-53.163127.parquet
搜集汇总
数据集介绍
open-llm-leaderboard/details_FoxEngineAi__Mega-Destroyer-8x7B 数据集图片
构建方式
在大型语言模型评估领域,Open LLM Leaderboard作为权威的基准平台,系统性地追踪模型性能。该数据集系对FoxEngineAi/Mega-Destroyer-8x7B模型进行自动化评估时生成,由63个配置组成,每个配置对应一项评测任务。数据源自两次独立运行,每次运行的结果以时间戳命名的分割形式存储于各配置中,其中'train'分割始终指向最新评估结果。此外,名为'results'的额外配置汇总了所有运行的整体指标,用于在排行榜上计算与展示聚合性能。
特点
该数据集的核心特色在于其精细化的任务覆盖与版本管理能力。它囊括了ARC-Challenge、HellaSwag、GSM8K、TruthfulQA、WinoGrande及涵盖57个学科的MMLU等多样化基准,每个任务均记录准确率、标准化准确率及其标准误差等细粒度指标。通过为每次运行保留独立分割,研究者可追溯模型性能的演变轨迹,而'latest'分割的自动指向机制则确保了数据获取的时效性与便捷性,为深入分析模型能力提供了结构化支撑。
使用方法
利用HuggingFace的datasets库可便捷加载该数据集。例如,通过'load_dataset("open-llm-leaderboard/details_FoxEngineAi__Mega-Destroyer-8x7B", "harness_winogrande_5", split="train")'即可获取WinoGrande任务的最新结果。每个配置对应特定任务(如harness_arc_challenge_25),且支持按时间戳分割访问历史数据。对于需要整体性能概览的场景,可直接调用'results'配置,其JSON格式的聚合数据涵盖所有任务的评估指标,便于进行模型间的横向对比或后续分析。
背景与挑战
背景概述
随着大规模语言模型(LLMs)的蓬勃发展,如何系统、公正地评估其多维度能力成为学界与工业界共同关注的焦点。在此背景下,Hugging Face团队于2023年推出了Open LLM Leaderboard评估平台,旨在为开源社区提供标准化的模型性能基准。该数据集正是针对FoxEngineAi团队于2024年发布的Mega-Destroyer-8x7B模型的一次完整评估记录,由Clementine等人主导,于2024年3月通过自动化流程生成。核心研究问题聚焦于该混合专家(MoE)架构模型在常识推理、科学知识、数学逻辑及伦理判断等57项细分任务上的表现,为理解大规模稀疏激活模型的泛化边界提供了实证依据。该数据集通过记录两次独立运行的详细结果,已成为社区评估MoE类模型能力图谱的重要参考,推动了开源LLM评测范式的标准化进程。
当前挑战
该数据集的核心挑战在于多维度评估体系的构建与实施。首先,在领域问题层面,Mega-Destroyer-8x7B模型需应对从基础算术(GSM8K准确率仅33.97%)到高阶科学推理(大学数学33%、大学物理50%)的极端能力跨度,暴露出当前MoE模型在符号推理与复杂知识整合上的结构性短板。其次,构建过程中面临评测一致性难题:两次运行结果需通过63个独立配置分别存储,不同时间戳的评测数据需通过‘latest’分割统一对齐,而各任务采样数量(如5-shot或25-shot)的差异进一步增加了结果聚合的复杂性。此外,数据集的Parquet格式虽利于高效存取,但多元异构任务(如MMLU的57个学科子集)的标准化格式转换与元数据管理,对数据管道的鲁棒性提出了严苛要求。
常用场景
经典使用场景
在大型语言模型(LLM)性能评估的学术生态中,open-llm-leaderboard/details_FoxEngineAi__Mega-Destroyer-8x7B 数据集扮演着标准化的基准测试角色。它源自 HuggingFace 的 Open LLM 排行榜,专为记录模型 FoxEngineAi/Mega-Destroyer-8x7B 在 63 项任务上的推理结果而设计,涵盖 ARC 挑战、HellaSwag、GSM8K、WinoGrande 及涵盖 57 个学科的 MMLU 等经典基准。研究者可借助该数据集,通过加载指定配置与分片,精准复现模型在特定任务上的逐项表现,从而在统一框架下横向比较不同模型的推理能力、知识广度与鲁棒性。
解决学术问题
该数据集的核心学术价值在于解决了 LLM 评估中结果不可复现与指标碎片化的痛点。传统上,模型性能报告常因评估脚本、随机种子或硬件差异而难以验证。此数据集通过存储每一次评估运行的原始细节(如各任务的准确率与标准差),为社区提供了透明的、可审计的评估记录。它使得研究者能够深入分析模型在细粒度任务上的优势与短板,例如在 MMLU 的抽象代数、医学遗传学等子领域上的表现差异,从而推动对模型知识边界与推理局限性的系统性理解。
衍生相关工作
该数据集衍生出的经典工作主要围绕 LLM 评估方法论与模型改进策略。例如,研究者可基于其结构化结果,开发针对特定失败案例的对抗性训练方法,或设计更高效的任务难度分级算法。同时,该数据集作为 Open LLM 排行榜的组成部分,催生了诸如“评估结果可视化仪表盘”、“模型能力雷达图”等分析工具,以及基于多任务性能加权融合的模型排名系统。这些工作共同促进了 LLM 评估从粗粒度分数向诊断性分析的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务