遇见数据集

open-llm-leaderboard-old/details_jondurbin__airoboros-65b-gpt4-1.4

收藏
Hugging Face2023-10-29 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在对jondurbin/airoboros-65b-gpt4-1.4模型进行评估运行期间自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集是从4次运行中创建的,每次运行都作为一个特定的分割存在,分割名称使用运行的时间戳命名。此外,还有一个名为results的附加配置,用于存储运行的聚合结果,并用于在Open LLM Leaderboard上计算和显示聚合指标。

该数据集是在对jondurbin/airoboros-65b-gpt4-1.4模型进行评估运行期间自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集是从4次运行中创建的,每次运行都作为一个特定的分割存在,分割名称使用运行的时间戳命名。此外,还有一个名为results的附加配置,用于存储运行的聚合结果,并用于在Open LLM Leaderboard上计算和显示聚合指标。

原始信息汇总

数据集概述

数据集简介

该数据集是在评估模型 jondurbin/airoboros-65b-gpt4-1.4Open LLM Leaderboard 上的运行过程中自动创建的。

数据集结构

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 4 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_jondurbin__airoboros-65b-gpt4-1.4", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-29T17:40:12.862636 运行 的最新结果: python { "all": { "em": 0.048133389261744965, "em_stderr": 0.0021920523387187097, "f1": 0.11759647651006695, "f1_stderr": 0.0024834303220337473, "acc": 0.4884045517729164, "acc_stderr": 0.010955153685387409 }, "harness|drop|3": { "em": 0.048133389261744965, "em_stderr": 0.0021920523387187097, "f1": 0.11759647651006695, "f1_stderr": 0.0024834303220337473 }, "harness|gsm8k|5": { "acc": 0.18043972706595907, "acc_stderr": 0.010592508589147896 }, "harness|winogrande|5": { "acc": 0.7963693764798737, "acc_stderr": 0.011317798781626922 } }

配置详情

以下是数据集的配置详情:

配置列表

  • harness_arc_challenge_25
  • harness_drop_3
  • harness_gsm8k_5
  • harness_hellaswag_10
  • harness_hendrycksTest_5
  • harness_hendrycksTest_abstract_algebra_5
  • harness_hendrycksTest_anatomy_5
  • harness_hendrycksTest_astronomy_5
  • harness_hendrycksTest_business_ethics_5
  • harness_hendrycksTest_clinical_knowledge_5
  • harness_hendrycksTest_college_biology_5
  • harness_hendrycksTest_college_chemistry_5
  • harness_hendrycksTest_college_computer_science_5
  • harness_hendrycksTest_college_mathematics_5
  • harness_hendrycksTest_college_medicine_5
  • harness_hendrycksTest_college_physics_5
  • harness_hendrycksTest_computer_security_5
  • harness_hendrycksTest_conceptual_physics_5
  • harness_hendrycksTest_econometrics_5

数据文件路径

  • 每个配置包含多个分割,每个分割对应一个特定的时间戳。
  • "latest" 分割指向最新的数据文件。

例如:

  • harness_arc_challenge_25 配置包含以下分割:
    • 2023_08_09T18_17_34.414751
    • latest
  • harness_drop_3 配置包含以下分割:
    • 2023_10_23T05_17_46.947970
    • 2023_10_23T05_35_00.206888
    • 2023_10_29T17_40_12.862636
    • latest

具体数据文件路径请参考配置详情部分。

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_jondurbin__airoboros-65b-gpt4-1.4 数据集图片
构建方式
该数据集源自对模型 jondurbin/airoboros-65b-gpt4-1.4 在 Open LLM Leaderboard 上的评估过程。其构建方式为:在多次评估运行中,将每次运行所对应的任务结果分别存储为独立的配置(configuration),共计 64 个配置,每个配置对应一个被评估的任务。每次运行的结果以时间戳命名作为数据分割(split),而 'train' 分割始终指向最新一次运行的评估结果。此外,一个名为 'results' 的额外配置用于汇总所有运行的聚合指标,为排行榜上综合分数的计算与展示提供数据基础。
特点
该数据集最显著的特征在于其精细的结构化组织与版本追踪能力。它通过 64 个独立配置,将模型在诸如 ARC、DROP、GSM8K、HellaSwag 及涵盖 57 个学科的 HendrycksTest 等多样化基准任务上的表现逐一细分记录。每个任务配置下包含多个按时间戳标记的运行分割,使得研究者能够追溯模型性能的演变轨迹。'train' 分割自动指向最新结果的设计,确保了数据访问的便捷性与时效性。这种多任务、多运行、层次分明的架构,为深入分析大语言模型在广泛场景下的能力提供了坚实的数据支撑。
使用方法
研究者可通过 Hugging Face 的 datasets 库便捷地加载该数据集。使用时需指定目标任务的配置名称(如 'harness_winogrande_5')以及所需的分割(如 'train' 以获取最新结果,或通过具体时间戳分割回溯历史数据)。加载后的数据可直接用于复现排行榜结果、分析模型在特定任务上的表现细节,或进行跨运行、跨任务的性能对比研究。数据集以 Parquet 格式存储,保证了高效的数据读取与处理能力,适用于大规模评估分析的场景。
背景与挑战
背景概述
随着大语言模型(LLM)的蓬勃发展,如何系统、公平地评估其综合能力成为学界与工业界共同关注的焦点。在此背景下,Hugging Face团队于2023年发起了Open LLM Leaderboard项目,旨在通过标准化基准测试,为社区提供透明、可复现的模型性能对比。本数据集即为该排行榜对jondurbin/airoboros-65b-gpt4-1.4模型进行自动化评估的产物,由Clémentine Fourrier等研究人员主导构建。该评估覆盖了ARC、HellaSwag、MMLU、GSM8K、Winogrande、DROP等多元任务,从常识推理、数学计算到阅读理解,全面检验模型在零样本与少样本场景下的表现。作为排行榜的核心数据资源,该数据集不仅为airoboros系列模型提供了权威的性能基准,更推动了LLM评估范式的标准化进程,对后续模型研发与社区协作产生了深远影响。
当前挑战
该数据集所承载的挑战体现在两个层面。在领域问题层面,LLM评估面临多维能力的量化难题:如何设计涵盖知识、推理、数学、语言理解等维度的评测体系,以真实反映模型泛化能力,避免单一指标偏颇。例如,GSM8K任务中模型准确率仅约18%,揭示了复杂数学推理的瓶颈。在构建过程层面,挑战在于确保评估的标准化与可复现性:需统一不同任务的提示格式、采样策略及评分规则,并管理多次运行(如本数据集包含四轮评估)的结果版本,避免因环境差异或数据泄露导致偏差。此外,面对如MMLU等57个子任务的庞杂配置,如何高效组织数据文件、维护时间戳分片与最新结果指向,亦对数据基础设施的鲁棒性提出了严苛要求。
常用场景
经典使用场景
在大型语言模型迅猛发展的当下,该数据集作为Open LLM Leaderboard的评估结果记录,为研究者提供了对airoboros-65b-gpt4-1.4模型在多项基准任务上性能的细致洞察。其经典使用场景在于通过加载特定任务配置(如harness_winogrande_5)的详细评估数据,复现模型在常识推理、数学求解和阅读理解等维度上的表现,从而支持模型能力的横向对比与纵向追踪。这种细粒度的评估记录使得研究者能够深入剖析模型在不同难度与领域任务中的优势与局限,为后续模型优化提供实证依据。
实际应用
在实际应用中,该数据集的价值体现在为模型选型与部署决策提供关键支持。开发者和工程师可依据这些细粒度的评估结果,精准判断airoboros-65b-gpt4-1.4在特定任务(如数学推理的GSM8K或常识推理的Winogrande)上的适用性,从而在智能客服、教育辅助、内容生成等场景中做出更优选择。此外,数据集的多轮次运行记录还能帮助团队监控模型在持续迭代中的性能变化,确保部署模型的稳定与可靠。
衍生相关工作
该数据集衍生了一系列围绕模型评估与比较的经典工作。一方面,它催生了更多针对开源大模型的系统性评测研究,例如基于Open LLM Leaderboard框架对多种主流模型进行标准化对比的论文。另一方面,其详尽的评估细节为分析模型在不同任务上的失败模式提供了数据基础,启发了诸如任务难度与模型规模关系、训练数据偏差影响等深入探索。这些工作共同丰富了语言模型评估的方法论,推动了更科学的模型发展路径的建立。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务