遇见数据集

open-llm-leaderboard-old/details_yeontaek__airoboros-2.1-llama-2-13B-QLoRa

收藏
Hugging Face2023-10-22 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型yeontaek/airoboros-2.1-llama-2-13B-QLoRa进行评估时自动生成的。数据集包含64个配置,每个配置对应一个被评估的任务。数据集由2次运行生成,每次运行在每个配置中表示为特定的分割,分割名称由运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个results配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。README还提供了如何使用Python代码加载运行中的数据集详细信息的示例。

该数据集是在Open LLM Leaderboard上对模型yeontaek/airoboros-2.1-llama-2-13B-QLoRa进行评估时自动生成的。数据集包含64个配置,每个配置对应一个被评估的任务。数据集由2次运行生成,每次运行在每个配置中表示为特定的分割,分割名称由运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个results配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。README还提供了如何使用Python代码加载运行中的数据集详细信息的示例。

原始信息汇总

数据集概述

数据集简介

该数据集是在评估模型 yeontaek/airoboros-2.1-llama-2-13B-QLoRa 在 Open LLM Leaderboard 上的自动创建的。

数据集结构

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 额外的配置 "results" 存储所有运行结果的聚合,用于计算和显示在 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_yeontaek__airoboros-2.1-llama-2-13B-QLoRa", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-22T09:08:12.213359 运行的最新结果: python { "all": { "em": 0.32896392617449666, "em_stderr": 0.0048115690575997756, "f1": 0.4162059563758415, "f1_stderr": 0.004644052420088407, "acc": 0.38419152296022013, "acc_stderr": 0.008435465119694497 }, "harness|drop|3": { "em": 0.32896392617449666, "em_stderr": 0.0048115690575997756, "f1": 0.4162059563758415, "f1_stderr": 0.004644052420088407 }, "harness|gsm8k|5": { "acc": 0.028051554207733132, "acc_stderr": 0.004548229533836327 }, "harness|winogrande|5": { "acc": 0.7403314917127072, "acc_stderr": 0.012322700705552667 } }

配置详情

  • harness_arc_challenge_25

    • 分割: 2023_08_29T20_38_29.069623
    • 路径: **/details_harness|arc:challenge|25_2023-08-29T20:38:29.069623.parquet
    • 分割: latest
    • 路径: **/details_harness|arc:challenge|25_2023-08-29T20:38:29.069623.parquet
  • harness_drop_3

    • 分割: 2023_10_22T09_08_12.213359
    • 路径: **/details_harness|drop|3_2023-10-22T09-08-12.213359.parquet
    • 分割: latest
    • 路径: **/details_harness|drop|3_2023-10-22T09-08-12.213359.parquet
  • harness_gsm8k_5

    • 分割: 2023_10_22T09_08_12.213359
    • 路径: **/details_harness|gsm8k|5_2023-10-22T09-08-12.213359.parquet
    • 分割: latest
    • 路径: **/details_harness|gsm8k|5_2023-10-22T09-08-12.213359.parquet
  • harness_hellaswag_10

    • 分割: 2023_08_29T20_38_29.069623
    • 路径: **/details_harness|hellaswag|10_2023-08-29T20:38:29.069623.parquet
    • 分割: latest
    • 路径: **/details_harness|hellaswag|10_2023-08-29T20:38:29.069623.parquet
  • harness_hendrycksTest_5

    • 分割: 2023_08_29T20_38_29.069623
    • 路径:
      • **/details_harness|hendrycksTest-abstract_algebra|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-anatomy|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-astronomy|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-business_ethics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-college_biology|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-college_chemistry|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-college_computer_science|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-college_mathematics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-college_medicine|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-college_physics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-computer_security|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-conceptual_physics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-econometrics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-electrical_engineering|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-formal_logic|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-global_facts|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_biology|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_european_history|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_geography|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_physics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_psychology|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_statistics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_us_history|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-high_school_world_history|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-human_aging|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-human_sexuality|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-international_law|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-jurisprudence|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-logical_fallacies|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-machine_learning|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-management|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-marketing|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-medical_genetics|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-miscellaneous|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-moral_disputes|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-moral_scenarios|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-nutrition|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-philosophy|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-prehistory|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-professional_accounting|5_2023-08-29T20:38:29.069623.parquet
      • **/details_harness|hendrycksTest-professional_
搜集汇总
数据集介绍
构建方式
在大型语言模型评估领域,Open LLM Leaderboard为模型性能的横向比较提供了标准化平台。该数据集是模型yeontaek/airoboros-2.1-llama-2-13B-QLoRa在Leaderboard上自动生成的评估记录,其构建依托于两次独立运行的评估流程。数据集包含64个配置,每个配置对应一个被评估的特定任务,例如ARC挑战、DROP、GSM8K等。每次运行的结果被存储为独立的分割(split),分割名称以运行时间戳命名,而“train”分割始终指向最新一次评估的结果。额外配置“results”则聚合了所有运行的指标,用于在Leaderboard上计算和展示综合性能。数据以Parquet格式存储,确保高效读写与结构化访问。
特点
该数据集的核心特色在于其精细化的任务覆盖与版本化追踪机制。它横跨推理、数学、常识问答及多学科知识等多元任务,如Winogrande的常识推理与Hendrycks测试集的57个学科子集,全面评估模型在零样本与少样本场景下的能力。每个任务配置均独立存储,并保留历史运行快照,研究者可回溯不同时间点的评估细节。最新结果以JSON格式呈现,包含精确匹配率、F1分数及准确率等关键指标及其标准误差,为模型性能的统计显著性分析提供可靠依据。这种结构化设计支持对模型能力的细粒度诊断与进化轨迹的纵向对比。
使用方法
研究者可通过Hugging Face的datasets库便捷加载该数据集。例如,使用load_dataset函数指定任务配置(如“harness_winogrande_5”)和分割(如“train”),即可获取最新评估的详细信息。加载后的数据可直接用于复现Leaderboard评分、分析模型在特定任务上的表现,或作为基线比较的参考。通过遍历不同配置的分割,用户能灵活提取各任务指标与原始评估记录,进而开展深入的误差分析或模型改进研究。数据集与原始模型仓库及Leaderboard空间无缝关联,确保评估结果的透明性与可复现性。
背景与挑战
背景概述
随着大规模语言模型在自然语言处理领域的迅猛发展,如何系统性地评估其多元化能力成为学界与工业界共同关注的焦点。在此背景下,Hugging Face团队于2023年发起了Open LLM Leaderboard项目,旨在构建一套标准化、可复现的模型评测框架。该数据集作为Leaderboard的组成部分,记录了名为airoboros-2.1-llama-2-13B-QLoRa的模型在多项基准任务上的详细表现,涵盖ARC推理挑战、DROP阅读理解、GSM8K数学推理及WinoGrande常识推理等。研究人员通过量化指标如准确率与F1分数,揭示了该模型在复杂推理任务中的能力边界,为后续模型优化提供了关键参考。该数据集由Clementine Fourrier等人维护,其影响力体现在推动了开放语言模型评估的透明化与规范化进程。
当前挑战
当前数据集所面临的挑战主要体现在两个层面。在领域问题层面,尽管Leaderboard覆盖了多种推理任务,但现有基准仍难以全面衡量模型在长文本理解、多模态交互及实时对话等复杂场景下的真实能力,导致评估结果与实用性能之间存在偏差。在构建过程中,数据集面临数据一致性维护的困难,例如不同时间戳运行的评测结果需通过特定分割标识进行管理,增加了跨版本比较的复杂性。此外,模型在GSM8K任务上仅取得2.8%的准确率,暴露出数学推理能力的显著不足,而DROP任务中不足33%的精确匹配率则揭示了模型在处理细节密集型阅读理解时的局限性。这些挑战共同指向了评估体系完善与模型短板突破的双重需求。
常用场景
经典使用场景
在大型语言模型(LLM)的评估与基准测试领域,该数据集作为Open LLM Leaderboard的评估运行记录,被广泛用于量化模型在多维度任务上的表现。其经典使用场景涵盖从常识推理(如Winogrande、HellaSwag)到数学问题求解(如GSM8K)、从阅读理解(如DROP)到广泛学科知识测试(如MMLU的57个细分领域)的全面评测。研究者通过加载该数据集的特定配置与分片,能够复现特定模型在特定时间戳下的细粒度评测结果,从而进行模型性能的横向对比与纵向追踪。这种结构化的评测数据存储方式,为LLM能力图谱的绘制提供了标准化、可重复的实证基础。
实际应用
在实际应用层面,该数据集构成了LLM选型与部署决策的核心参考依据。企业和开发者通过查阅特定模型(如airoboros-2.1-llama-2-13B-QLoRa)在该数据集上的细粒度表现,能够评估其是否适配特定业务场景——例如,高Winogrande得分暗示模型在常识推理任务中的可靠性,而GSM8K的准确率则直接反映其数学问题求解能力。此外,该数据集的持续更新机制允许用户追踪模型版本迭代过程中的性能演变,为模型微调、量化优化(如QLoRa技术效果验证)等工程实践提供了量化的效果反馈。这种基于实证的评估体系,有效降低了LLM落地的试错成本。
衍生相关工作
该数据集作为Open LLM Leaderboard的核心数据组件,催生了一系列关于LLM能力评估与模型优化的经典工作。研究者基于其多任务评测框架,发展出了针对特定能力子集(如数学推理、常识理解)的深度分析研究,并衍生出如模型集成策略、少样本学习能力边界探索等方向。该数据集存储的量化评测结果,为参数高效微调(如QLoRa)对模型性能影响的量化研究提供了直接证据,推动了低资源部署方案与全参数微调效果之间的系统性比较。此外,其标准化的数据格式与加载方式,启发了后续多个评测基准(如LMSys Chatbot Arena)在数据组织与版本管理上的设计范式,成为LLM评测领域数据基础设施建设的参考蓝本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务