遇见数据集

open-llm-leaderboard/details_jondurbin__airoboros-l2-13b-3.0

收藏
Hugging Face2023-10-24 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在模型[jondurbin/airoboros-l2-13b-3.0](https://huggingface.co/jondurbin/airoboros-l2-13b-3.0)的评估过程中自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集是从2次运行中创建的,每次运行的结果都存储为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于计算和显示在[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的聚合指标。

This dataset was automatically created during the evaluation of the model [jondurbin/airoboros-l2-13b-3.0](https://huggingface.co/jondurbin/airoboros-l2-13b-3.0). The dataset consists of 64 configurations, each corresponding to one evaluation task. The dataset is constructed from two runs, where the results of each run are stored as a specific split, with the split name using the timestamp of the corresponding run. The `train` split always points to the most recent results. In addition, there is a configuration named `results` that stores the aggregated results across all runs, and is used to calculate and display the aggregate metrics on the [Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard).

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在对模型 jondurbin/airoboros-l2-13b-3.0 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_jondurbin__airoboros-l2-13b-3.0", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-24T07:06:03.975558 运行的最新结果

python { "all": { "em": 0.20868288590604026, "em_stderr": 0.004161580956848853, "f1": 0.26992973993288605, "f1_stderr": 0.004166447885566019, "acc": 0.4255516933315701, "acc_stderr": 0.009918265858821027 }, "harness|drop|3": { "em": 0.20868288590604026, "em_stderr": 0.004161580956848853, "f1": 0.26992973993288605, "f1_stderr": 0.004166447885566019 }, "harness|gsm8k|5": { "acc": 0.08946171341925702, "acc_stderr": 0.007861583049939738 }, "harness|winogrande|5": { "acc": 0.7616416732438832, "acc_stderr": 0.011974948667702314 } }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|arc:challenge|25_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|arc:challenge|25_2023-10-08T18-14-31.712178.parquet
  • harness_drop_3

    • 分割:2023_10_24T07_06_03.975558
    • 路径:**/details_harness|drop|3_2023-10-24T07-06-03.975558.parquet
    • 分割:latest
    • 路径:**/details_harness|drop|3_2023-10-24T07-06-03.975558.parquet
  • harness_gsm8k_5

    • 分割:2023_10_24T07_06_03.975558
    • 路径:**/details_harness|gsm8k|5_2023-10-24T07-06-03.975558.parquet
    • 分割:latest
    • 路径:**/details_harness|gsm8k|5_2023-10-24T07-06-03.975558.parquet
  • harness_hellaswag_10

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hellaswag|10_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hellaswag|10_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-10-08T18-14-31.712178.parquet 等 50 个文件
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-10-08T18-14-31.712178.parquet 等 50 个文件
  • harness_hendrycksTest_abstract_algebra_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_anatomy_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_astronomy_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_business_ethics_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_clinical_knowledge_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_college_biology_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_college_chemistry_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_college_computer_science_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_college_mathematics_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_college_medicine_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_college_physics_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_computer_security_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_conceptual_physics_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_econometrics_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-10-08T18-14-31.712178.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-10-08T18-14-31.712178.parquet
  • harness_hendrycksTest_electrical_engineering_5

    • 分割:2023_10_08T18_14_31.712178
    • 路径:`**/details_harness|hendrycksTest-electrical_engineering|5_2023-10-08T18-14-31.712178.parquet
搜集汇总
数据集介绍
open-llm-leaderboard/details_jondurbin__airoboros-l2-13b-3.0 数据集图片
构建方式
该数据集是Open LLM Leaderboard在对jondurbin/airoboros-l2-13b-3.0模型进行评估时自动生成的产物。其构建过程基于两次独立的评估运行,每一次运行的结果均被存储为独立的配置项与数据分割。数据集共包含64个配置,每个配置对应一项被评估的任务,例如ARC挑战、DROP、GSM8K、HellaSwag、WinoGrande以及涵盖57个学科的MMLU基准测试。每个配置内以时间戳命名分割,其中“train”分割始终指向最新一次的评估结果。额外存在一个名为“results”的配置,用于聚合所有运行的整体指标,支撑排行榜上综合分数的计算与展示。
使用方法
用户可通过Hugging Face的datasets库便捷加载该数据集。例如,调用`load_dataset("open-llm-leaderboard/details_jondurbin__airoboros-l2-13b-3.0", "harness_winogrande_5", split="train")`即可获取WinoGrande任务的最新详细评估数据。对于需要访问历史结果的研究者,可通过指定具体时间戳分割名称(如“2023_10_24T07_06_03.975558”)来加载特定运行的数据。此外,加载“results”配置可获取所有任务的聚合指标,便于进行模型的横向对比与综合性能分析。
背景与挑战
背景概述
随着大规模语言模型(LLM)的蓬勃发展,如何系统、公平地评估其多维度能力成为学界与工业界共同关注的焦点。Open LLM Leaderboard应运而生,由Hugging Face团队于2023年推出,旨在通过标准化基准测试套件为社区提供透明的模型性能对比。该数据集是针对jondurbin/airoboros-l2-13b-3.0模型在排行榜上的评估结果而自动构建的,记录了其在ARC、DROP、GSM8K、HellaSwag及涵盖57个学科的MMLU等任务上的表现。这一数据集不仅为研究者提供了细粒度的模型能力画像,更推动了LLM评估范式的规范化,对理解13B参数级别模型的推理、常识与专业知识边界具有重要参考价值。
当前挑战
该数据集所反映的核心挑战在于LLM评估的全面性与公平性:一方面,现有基准如GSM8K(数学推理)和DROP(阅读理解)揭示了模型在复杂推理任务上仍存在显著不足,例如airoboros-l2-13b-3.0在GSM8K上的准确率仅约8.9%,凸显了数学逻辑推理的瓶颈;另一方面,构建过程中需应对多任务、多轮次评估的数据一致性问题,如不同时间戳的运行结果需被合理组织为独立分割,并确保最新结果可被准确追溯。此外,MMLU中广泛学科覆盖带来的数据异构性,对评估的标准化和结果的可解释性构成了持续挑战。
常用场景
经典使用场景
在大语言模型迅猛发展的当下,如何公正、全面地评估模型性能成为学界与工业界共同关注的核心议题。该数据集作为Open LLM Leaderboard上对airoboros-l2-13b-3.0模型评估的副产品,系统性地记录了模型在ARC Challenge、DROP、GSM8K、HellaSwag、WinoGrande以及涵盖57个学科的MMLU等经典基准任务上的细粒度表现。研究者可通过加载特定配置(如harness_winogrande_5)与时间戳分割,重现模型在常识推理、数学解题、阅读理解等维度的精确得分,从而为模型能力诊断、版本迭代对比及跨模型横向比较提供标准化、可复现的评估框架。
解决学术问题
该数据集精准回应了当前大语言模型研究中两大痛点:评估结果的可复现性与细粒度分析能力。通过将每次评估的原始细节以结构化Parquet文件存储,并维护基于时间戳的版本化分割,它解决了以往仅依赖宏观指标(如平均准确率)而丢失任务级、甚至样本级诊断信息的局限。这一设计使学术研究者能够深入剖析模型在特定子任务(如抽象代数、临床知识)上的失败模式,探究不同提示策略或采样参数对结果的影响,从而为理解模型能力边界、指导定向优化提供了坚实的数据基础,推动了从“唯分数论”向“诊断式评估”的范式转变。
实际应用
在实际应用中,该数据集为模型开发与部署的全生命周期管理提供了关键支撑。模型训练团队可依据其记录的详尽指标,快速定位模型在数学推理(GSM8K准确率8.95%)或常识推理(WinoGrande准确率76.16%)等维度的短板,进而有针对性地调整训练数据配比或微调策略。同时,企业级AI平台可利用其标准化评估流程,在模型上线前自动执行多维度压力测试,确保模型在金融、医疗等高风险场景下的稳健性。此外,该数据集还可作为模型能力排行榜的底层数据源,为开发者社区提供透明、可信的模型选型参考。
数据集最近研究
最新研究方向
在大型语言模型(LLM)评估体系持续演进的前沿背景下,open-llm-leaderboard/details_jondurbin__airoboros-l2-13b-3.0数据集作为Open LLM Leaderboard的评估产物,深刻反映了当前领域对模型综合能力的精细化度量趋势。该数据集通过涵盖ARC挑战、DROP、GSM8K、WinoGrande及57项MMLU子任务等64个配置,系统性地捕捉了airoboros-l2-13b-3.0模型在推理、数学、常识与多学科知识上的表现。其最新结果揭示了模型在WinoGrande上达到76.16%的准确率,但在GSM8K数学推理任务中仅获8.95%,凸显了领域内对复杂推理与符号计算能力提升的迫切需求。这一数据集不仅为模型迭代提供了可复现的基准,更推动了社区对评估标准化与细粒度诊断的重视,成为衡量LLM在真实世界任务中泛化能力的关键标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务