遇见数据集

open-llm-leaderboard-old/details_Ejafa__vicuna_7B_vanilla_1.1

收藏
Hugging Face2023-10-17 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型Ejafa/vicuna_7B_vanilla_1.1进行评估时自动创建的。数据集由64个配置组成,每个配置对应一个特定的评估任务。数据集是从2次运行中生成的,每次运行在每个配置中表示为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用`datasets`库中的`load_dataset`函数加载数据集的示例。

该数据集是在Open LLM Leaderboard上对模型Ejafa/vicuna_7B_vanilla_1.1进行评估时自动创建的。数据集由64个配置组成,每个配置对应一个特定的评估任务。数据集是从2次运行中生成的,每次运行在每个配置中表示为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用`datasets`库中的`load_dataset`函数加载数据集的示例。

原始信息汇总

数据集概述

该数据集是在评估模型 Ejafa/vicuna_7B_vanilla_1.1 在 Open LLM Leaderboard 上的自动创建的。数据集包含 64 个配置,每个配置对应一个评估任务。

数据集结构

数据集由 2 次运行创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

额外配置

一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Ejafa__vicuna_7B_vanilla_1.1", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-17T05:49:12.117200 运行 的最新结果:

python { "all": { "em": 0.11388422818791946, "em_stderr": 0.00325324428862373, "f1": 0.16976719798657605, "f1_stderr": 0.003380156230610554, "acc": 0.38244753834582057, "acc_stderr": 0.009528517622122097 }, "harness|drop|3": { "em": 0.11388422818791946, "em_stderr": 0.00325324428862373, "f1": 0.16976719798657605, "f1_stderr": 0.003380156230610554 }, "harness|gsm8k|5": { "acc": 0.05534495830174375, "acc_stderr": 0.006298221796179588 }, "harness|winogrande|5": { "acc": 0.7095501183898973, "acc_stderr": 0.012758813448064607 } }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_07_19T16_40_36.774019
      • 路径:**/details_harness|arc:challenge|25_2023-07-19T16:40:36.774019.parquet
    • 分割:latest
      • 路径:**/details_harness|arc:challenge|25_2023-07-19T16:40:36.774019.parquet
  • harness_drop_3

    • 分割:2023_10_17T05_49_12.117200
      • 路径:**/details_harness|drop|3_2023-10-17T05-49-12.117200.parquet
    • 分割:latest
      • 路径:**/details_harness|drop|3_2023-10-17T05-49-12.117200.parquet
  • harness_gsm8k_5

    • 分割:2023_10_17T05_49_12.117200
      • 路径:**/details_harness|gsm8k|5_2023-10-17T05-49-12.117200.parquet
    • 分割:latest
      • 路径:**/details_harness|gsm8k|5_2023-10-17T05-49-12.117200.parquet
  • harness_hellaswag_10

    • 分割:2023_07_19T16_40_36.774019
      • 路径:**/details_harness|hellaswag|10_2023-07-19T16:40:36.774019.parquet
    • 分割:latest
      • 路径:**/details_harness|hellaswag|10_2023-07-19T16:40:36.774019.parquet
  • harness_hendrycksTest_5

    • 分割:2023_07_19T16_40_36.774019
      • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-electrical_engineering|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-elementary_mathematics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-formal_logic|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-global_facts|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_biology|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_chemistry|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_computer_science|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_european_history|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_geography|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_mathematics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_microeconomics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_physics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_psychology|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_statistics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_us_history|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-high_school_world_history|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-human_aging|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-human_sexuality|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-international_law|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-jurisprudence|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-logical_fallacies|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-machine_learning|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-management|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-marketing|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-medical_genetics|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-miscellaneous|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-moral_disputes|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-moral_scenarios|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-nutrition|5_2023-07-19T16:40:36.774019.parquet
      • 路径:**/details_harness|hendrycksTest-philosophy|5_2023-07-19T16:40:36.774019.parquet
      • 路径:`**/details_harness|hendrycksTest-prehistory|5_2023-07-19T16:40
搜集汇总
数据集介绍
open-llm-leaderboard-old/details_Ejafa__vicuna_7B_vanilla_1.1 数据集图片
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 作为权威基准平台,系统性地追踪模型性能演进。本数据集源自对 Ejafa/vicuna_7B_vanilla_1.1 模型的自动化评估流程,通过两次独立运行生成。其构建采用分层配置架构,共计 64 个配置,每个配置对应一项特定的评估任务,如 ARC-Challenge、DROP、GSM8K 等。每次运行的结果被存储为独立的时间戳分割,而 'train' 分割始终指向最新评估结果。此外,增设 'results' 配置用于聚合所有运行的指标,以支撑 Leaderboard 上的综合性能展示。数据以 Parquet 格式存储,确保高效读写与可扩展性。
特点
该数据集的核心特色在于其精细化的任务分割与版本管理机制。64 个配置覆盖了从常识推理到数学解题的多元任务,每个配置下均保留历次运行的时间戳分割,便于研究者追溯模型性能的时序变化。'latest' 分割的设计简化了最新结果的访问,而 'results' 配置则提供了一站式的聚合指标,涵盖准确率、F1 分数等关键统计量及其标准误差。这种结构不仅支持细粒度的任务级分析,还便于跨任务对比与整体性能评估,充分满足大模型评测中对可复现性与透明度的需求。
使用方法
研究者可通过 Hugging Face Datasets 库便捷调用本数据集。例如,使用 `load_dataset` 函数指定配置名称(如 'harness_winogrande_5')与分割(如 'train'),即可加载特定任务的最新评估细节。对于需要历史数据的场景,可直接访问时间戳分割(如 '2023_10_17T05_49_12.117200')。聚合结果可从 'results' 配置中获取,其中包含了如 DROP 任务的精确匹配率与 F1 分数、GSM8K 的准确率等指标。此设计使得数据加载灵活高效,支持从单任务深入分析到多任务综合评估的多样化研究需求。
背景与挑战
背景概述
大语言模型(LLM)的迅猛发展催生了对其能力进行系统化评估的迫切需求,但以往评测往往碎片化且缺乏统一标准。在此背景下,HuggingFace团队于2023年推出了Open LLM Leaderboard,旨在构建一个公开、可复现的模型性能竞技平台。该数据集正是为评估Ejafa团队于2023年发布的Vicuna-7B-v1.1模型而自动生成的评测记录。Vicuna系列模型以LLaMA为基础,通过用户分享的对话数据进行微调,在对话能力上展现出显著优势,其7B版本在保持轻量级的同时力求性能与效率的平衡。该数据集由Clémentine Fourrier等人创建,记录了模型在ARC、HellaSwag、MMLU、GSM8K等多项基准任务上的详细表现,为社区提供了标准化的模型比对依据,对推动开源LLM的透明化评估具有重要价值。
当前挑战
该数据集所承载的核心挑战在于如何全面且公正地衡量Vicuna-7B-v1.1这类对话模型的真实能力。首先,从领域问题层面看,当前评估基准如MMLU和GSM8K多聚焦于知识问答与数学推理,但对对话连贯性、安全性及指令遵循等关键维度覆盖不足,导致评测结果与实际应用表现存在偏差。其次,在构建过程中,数据集面临两大技术难题:一是评测任务配置的复杂性,需为每项基准设定不同样本数(如ARC的25-shot、GSM8K的5-shot),且要确保跨模型间的公平性;二是结果聚合与版本管理的挑战,多次运行产生的评测数据需被精确追踪并以时间戳区分,同时保持最新结果的实时更新,这对数据存储与索引架构提出了较高要求。
常用场景
经典使用场景
在大规模语言模型如雨后春笋般涌现的时代,如何公正、系统地评估其性能成为学界与工业界共同关注的焦点。该数据集作为Open LLM Leaderboard的评估记录,其经典使用场景在于为研究者提供一个标准化、可复现的评测框架。通过加载该数据集中不同任务配置下的详细结果,如ARC挑战赛、GSM8K数学推理、WinoGrande常识推理等,研究者能够精确剖析特定模型(如Vicuna 7B)在多样任务上的表现优劣,从而横向对比不同模型的泛化能力与领域专长。
衍生相关工作
该数据集衍生了一系列具有里程碑意义的相关工作。Open LLM Leaderboard本身即基于此数据构建了动态更新的模型排行榜,成为社区衡量开源大模型进展的权威参考。后续研究如《Scaling Data-Constrained Language Models》利用此类评估数据进行规模定律分析,而《LIMA: Less Is More for Alignment》则借助其基准结果验证微调策略的有效性。此外,该数据集启发了多任务评估套件(如LM Eval Harness)的标准化设计,推动了如EleutherAI的GPT-NeoX-20B等模型在统一框架下的性能追踪与对比。
数据集最近研究
最新研究方向
在大语言模型评测领域,开源模型的标准化评估已成为推动技术迭代的关键环节。围绕Vicuna 7B这一经典对话模型,研究者通过Open LLM Leaderboard平台开展了系统性评测,聚焦于其在多维度任务上的泛化能力。该数据集记录了模型在DROP、GSM8K、Winogrande等基准上的表现,其中Winogrande准确率达70.96%,而GSM8K数学推理任务仅5.53%,鲜明揭示了当前开源小模型在复杂推理与常识理解间的显著鸿沟。这一方向的研究不仅为模型优化提供了量化基准,更推动了社区对轻量级模型能力边界的认知,成为评估开源大语言模型实用性的重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务