遇见数据集

open-llm-leaderboard/details_dvruette__llama-13b-pretrained-sft-do2

收藏
Hugging Face2023-10-21 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型dvruette/llama-13b-pretrained-sft-do2进行评估时自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果存储在特定的分割中,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于在Open LLM Leaderboard上计算和显示聚合指标。

该数据集是在Open LLM Leaderboard上对模型dvruette/llama-13b-pretrained-sft-do2进行评估时自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果存储在特定的分割中,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于在Open LLM Leaderboard上计算和显示聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在对模型 dvruette/llama-13b-pretrained-sft-do2 进行评估运行时自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_dvruette__llama-13b-pretrained-sft-do2", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-21T22:43:14.661061 运行的最新结果

python { "all": { "em": 0.2528313758389262, "em_stderr": 0.004451070247505258, "f1": 0.3196245805369137, "f1_stderr": 0.004416910326006887, "acc": 0.42391092962847055, "acc_stderr": 0.010031261264359954 }, "harness|drop|3": { "em": 0.2528313758389262, "em_stderr": 0.004451070247505258, "f1": 0.3196245805369137, "f1_stderr": 0.004416910326006887 }, "harness|gsm8k|5": { "acc": 0.09249431387414708, "acc_stderr": 0.007980396874560168 }, "harness|winogrande|5": { "acc": 0.755327545382794, "acc_stderr": 0.012082125654159738 } }

配置详情

  • harness_arc_challenge_25

    • 分割: 2023_07_19T18_57_06.342295
    • 路径: **/details_harness|arc:challenge|25_2023-07-19T18:57:06.342295.parquet
    • 分割: latest
    • 路径: **/details_harness|arc:challenge|25_2023-07-19T18:57:06.342295.parquet
  • harness_drop_3

    • 分割: 2023_10_21T22_43_14.661061
    • 路径: **/details_harness|drop|3_2023-10-21T22-43-14.661061.parquet
    • 分割: latest
    • 路径: **/details_harness|drop|3_2023-10-21T22-43-14.661061.parquet
  • harness_gsm8k_5

    • 分割: 2023_10_21T22_43_14.661061
    • 路径: **/details_harness|gsm8k|5_2023-10-21T22-43-14.661061.parquet
    • 分割: latest
    • 路径: **/details_harness|gsm8k|5_2023-10-21T22-43-14.661061.parquet
  • harness_hellaswag_10

    • 分割: 2023_07_19T18_57_06.342295
    • 路径: **/details_harness|hellaswag|10_2023-07-19T18:57:06.342295.parquet
    • 分割: latest
    • 路径: **/details_harness|hellaswag|10_2023-07-19T18:57:06.342295.parquet
  • harness_hendrycksTest_5

    • 分割: 2023_07_19T18_57_06.342295
    • 路径:
      • **/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-anatomy|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-astronomy|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-business_ethics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-college_biology|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-college_chemistry|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-college_computer_science|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-college_mathematics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-college_medicine|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-college_physics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-computer_security|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-conceptual_physics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-econometrics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-electrical_engineering|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-formal_logic|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-global_facts|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_biology|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_european_history|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_geography|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_physics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_psychology|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_statistics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_us_history|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-high_school_world_history|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-human_aging|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-human_sexuality|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-international_law|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-jurisprudence|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-logical_fallacies|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-machine_learning|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-management|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-marketing|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-medical_genetics|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-miscellaneous|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-moral_disputes|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-moral_scenarios|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-nutrition|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-philosophy|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-prehistory|5_2023-07-19T18:57:06.342295.parquet
      • **/details_harness|hendrycksTest-professional_accounting|5_2023-07-19T18:57:06.342295.parquet
      • `**/details_harness|hendrycksTest-professional_law|5_2023-07-19T18:57:06.34229
搜集汇总
数据集介绍
open-llm-leaderboard/details_dvruette__llama-13b-pretrained-sft-do2 数据集图片
构建方式
该数据集是在Open LLM Leaderboard框架下,对模型dvruette/llama-13b-pretrained-sft-do2进行自动化评估时生成的。数据集构建过程涉及两次独立的评估运行,每次运行的结果被存储为对应的时间戳分割,而'train'分割始终指向最新一次的评估结果。数据集由64个配置组成,每个配置对应一项评估任务,例如harness_winogrande_5等,每个配置下包含多个分割,分别代表不同运行时间点的评估细节。此外,还设有'results'配置,用于汇总所有运行的聚合指标,以支持排行榜上的综合展示。
特点
该数据集的核心特点在于其结构化的多任务评估体系,覆盖了从常识推理(如winogrande)到数学推理(如gsm8k)等多种能力维度。每个配置独立存储特定任务的评估细节,便于细粒度分析模型在不同领域的表现。数据集的版本通过时间戳分割管理,支持历史结果追溯与最新结果对比。聚合配置'results'提供了诸如准确率、F1分数等统一指标,为模型间的横向比较奠定了标准化基础。整体设计兼具模块化与可扩展性,适应持续更新的评估需求。
使用方法
使用该数据集时,可通过HuggingFace的datasets库加载特定配置和分割。例如,加载winogrande任务的最近评估结果,需指定配置名'harness_winogrande_5'及分割'train',即可获取对应的Parquet格式数据。若需访问历史运行结果,可选用具体时间戳分割名,如'2023_10_21T22_43_14.661061'。'results'配置则提供聚合指标,可直接用于模型性能的总体评估。数据加载后,用户可根据任务需求提取相应字段,进行深入分析或二次开发。
背景与挑战
背景概述
大语言模型(LLM)的迅猛发展催生了对其性能进行系统性评估的迫切需求,Open LLM Leaderboard应运而生,成为衡量模型在多样化自然语言理解与推理任务上表现的重要基准平台。该数据集由HuggingFace团队于2023年构建,主要研究人员包括Clémentine Fourrier等,核心研究问题在于如何通过标准化、可复现的评估流程,揭示模型在如ARC挑战、HellaSwag、MMLU及GSM8K等任务上的真实能力。dvruette/llama-13b-pretrained-sft-do2模型在该框架下的评估记录,不仅为Llama系列模型的后续优化提供了实证依据,也推动了开放科学背景下模型评测的透明化与社区协作。
当前挑战
该数据集所解决的领域问题在于应对LLM评估中基准测试碎片化与结果不可复现的挑战,通过统一的任务配置(如few-shot设置)与自动化流水线,为模型横向对比奠定基础。构建过程中,数据集的挑战体现在多任务异构数据的整合与版本管理上,例如需同步处理ARC、DROP、GSM8K等64个配置的评估结果,并确保不同时间戳的运行记录(如2023-07-19与2023-10-21)在Parquet格式下的一致性与可追溯性。此外,模型在GSM8K任务上仅9.25%的准确率,凸显了数学推理能力评估的严峻性,反映了当前LLM在符号推理与复杂问题求解上的根本局限。
常用场景
经典使用场景
在大型语言模型评估领域,该数据集作为Open LLM Leaderboard的标准化评测轨道,为dvruette/llama-13b-pretrained-sft-do2模型提供了涵盖ARC挑战、DROP、GSM8K、HellaSwag、MMLU及WinoGrande等多维度任务的细粒度性能记录。研究者可通过加载特定配置(如harness_winogrande_5)与时间戳分割,精准复现模型在常识推理、数学求解、阅读理解等经典基准上的表现,从而实现对模型能力的纵向追踪与横向比较。
衍生相关工作
基于该数据集所衍生的经典工作主要集中于模型性能诊断与训练策略改进。例如,研究者通过分析WinoGrande(准确率0.755)与ARC挑战等任务上的表现差异,揭示了LLaMA-13B在常识推理与复杂知识推理间的能力鸿沟,进而催生了针对性的数据增强与课程学习方案。同时,该数据集的时间戳分割特性也启发了关于模型训练动态的可视化研究,为探索微调过程中的遗忘与迁移现象提供了关键实证。
数据集最近研究
最新研究方向
在大型语言模型(LLM)评估领域,Open LLM Leaderboard 已成为衡量模型综合能力的重要基准。当前前沿研究方向聚焦于通过标准化、多维度的评测框架(如 ARC、HellaSwag、MMLU、GSM8K 等)对模型进行细粒度性能剖析。该数据集记录了 llama-13b-pretrained-sft-do2 模型在多个任务上的表现,其较低的 GSM8K 数学推理准确率(9.25%)与较高的 Winogrande 常识推理得分(75.53%)揭示了模型在符号推理与常识理解能力上的显著差异。这一趋势与近期研究热点——即提升 LLM 在复杂推理与数值计算任务上的鲁棒性——紧密相关。该数据集的系统化评估不仅为模型迭代提供了可复现的量化依据,也推动了社区对模型能力短板(如数学与逻辑推理)的针对性优化,对构建更可靠、更通用的语言智能系统具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务