遇见数据集

open-llm-leaderboard/details_Aspik101__StableBeluga-13B-instruct-PL-lora_unload

收藏
Hugging Face2023-10-13 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在模型Aspik101/StableBeluga-13B-instruct-PL-lora_unload在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由64个配置组成,每个配置对应一个被评估的任务。它由2次运行创建,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了一个使用Python中的datasets库加载运行细节的示例。

This dataset was automatically created during the evaluation run of the model Aspik101/StableBeluga-13B-instruct-PL-lora_unload on the Open LLM Leaderboard. The dataset consists of 64 configurations, each corresponding to one evaluated task. It was created via two runs, where each run is represented as a specific split within each configuration. The 'train' split always points to the most recent results. An additional configuration named 'results' stores the aggregated results across all runs, which are used to calculate and display the aggregate metrics on the Open LLM Leaderboard. The README also provides an example of loading run details using the datasets library in Python.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在评估模型 Aspik101/StableBeluga-13B-instruct-PL-lora_unload 在 Open LLM Leaderboard 上的运行过程中自动创建的。

数据集组成

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

最新结果

以下是 2023-10-13T13:27:06.134462 运行的最新结果:

python { "all": { "em": 0.014786073825503355, "em_stderr": 0.0012360366760472946, "f1": 0.08531564597315425, "f1_stderr": 0.001909056545524939, "acc": 0.44382508573319457, "acc_stderr": 0.010461592536002241 }, "harness|drop|3": { "em": 0.014786073825503355, "em_stderr": 0.0012360366760472946, "f1": 0.08531564597315425, "f1_stderr": 0.001909056545524939 }, "harness|gsm8k|5": { "acc": 0.12206216830932524, "acc_stderr": 0.009017054965766495 }, "harness|winogrande|5": { "acc": 0.7655880031570639, "acc_stderr": 0.011906130106237986 } }

配置详情

以下是数据集的部分配置详情:

  • harness_arc_challenge_25

    • 分割:2023_08_09T11_43_44.316126
      • 路径:**/details_harness|arc:challenge|25_2023-08-09T11:43:44.316126.parquet
    • 分割:latest
      • 路径:**/details_harness|arc:challenge|25_2023-08-09T11:43:44.316126.parquet
  • harness_drop_3

    • 分割:2023_10_13T13_27_06.134462
      • 路径:**/details_harness|drop|3_2023-10-13T13-27-06.134462.parquet
    • 分割:latest
      • 路径:**/details_harness|drop|3_2023-10-13T13-27-06.134462.parquet
  • harness_gsm8k_5

    • 分割:2023_10_13T13_27_06.134462
      • 路径:**/details_harness|gsm8k|5_2023-10-13T13-27-06.134462.parquet
    • 分割:latest
      • 路径:**/details_harness|gsm8k|5_2023-10-13T13-27-06.134462.parquet
  • harness_hellaswag_10

    • 分割:2023_08_09T11_43_44.316126
      • 路径:**/details_harness|hellaswag|10_2023-08-09T11:43:44.316126.parquet
    • 分割:latest
      • 路径:**/details_harness|hellaswag|10_2023-08-09T11:43:44.316126.parquet
  • harness_hendrycksTest_5

    • 分割:2023_08_09T11_43_44.316126
      • 路径:
        • **/details_harness|hendrycksTest-abstract_algebra|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-anatomy|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-astronomy|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-business_ethics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-college_biology|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-college_chemistry|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-college_computer_science|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-college_mathematics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-college_medicine|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-college_physics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-computer_security|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-conceptual_physics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-econometrics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-electrical_engineering|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-formal_logic|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-global_facts|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_biology|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_european_history|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_geography|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_physics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_psychology|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_statistics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_us_history|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-high_school_world_history|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-human_aging|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-human_sexuality|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-international_law|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-jurisprudence|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-logical_fallacies|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-machine_learning|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-management|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-marketing|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-medical_genetics|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-miscellaneous|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-moral_disputes|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-moral_scenarios|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-nutrition|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-philosophy|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-prehistory|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-professional_accounting|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-professional_law|5_2023-08-09T11:43:44.316126.parquet
        • **/details_harness|hendrycksTest-professional_medicine|5_2023-08-09T11:43:44.316126.parquet
搜集汇总
数据集介绍
open-llm-leaderboard/details_Aspik101__StableBeluga-13B-instruct-PL-lora_unload 数据集图片
构建方式
在大型语言模型评估的广阔领域中,本数据集专为记录模型Aspik101/StableBeluga-13B-instruct-PL-lora_unload在Open LLM Leaderboard上的评测细节而自动生成。其构建过程基于多次运行,每次运行的结果均以时间戳为标识,作为独立的数据拆分存储于各个配置中。数据集共包含64个配置,每个配置对应一项被评估的任务。此外,一个名为“results”的独立配置汇集了所有运行的聚合结果,用于计算并展示整体指标。最新的评估结果始终通过“train”拆分指向。
特点
该数据集的核心特色在于其结构化的多任务评估记录能力。每个配置都精细地对应一个特定任务,如ARC挑战、DROP、GSM8K等,从而支持细粒度的性能分析。数据拆分以运行时间戳命名,保留了历史版本,便于追溯模型性能的演变。同时,“latest”拆分自动指向最新结果,确保了数据的时效性。这种设计不仅提供了全面的评测视角,还通过聚合配置实现了跨任务的综合对比,为理解模型在不同维度上的表现提供了坚实的数据基础。
使用方法
利用此数据集,研究人员可便捷地加载特定任务的评测细节。例如,通过Hugging Face的datasets库,使用load_dataset函数并指定配置名称(如“harness_winogrande_5”)及拆分(如“train”),即可获取该任务的最新评估数据。对于历史版本的分析,只需将拆分参数替换为对应的时间戳字符串。此外,通过加载“results”配置,用户能够直接访问所有任务的聚合指标,从而快速评估模型的整体性能。这种方法使得深度分析模型在多种基准上的表现变得高效而直观。
背景与挑战
背景概述
随着大型语言模型(LLMs)在自然语言处理领域的迅猛发展,如何系统性地评估这些模型的多维度能力成为学术界与工业界共同关注的核心议题。在此背景下,Hugging Face团队于2023年发起了Open LLM Leaderboard项目,旨在为开源社区提供一个标准化、可复现的模型性能评测平台。该数据集作为Leaderboard的一部分,专门记录了模型Aspik101/StableBeluga-13B-instruct-PL-lora_unload在多项基准任务上的评估结果,由Hugging Face研究团队(主要联系人Clementine)主导创建。数据集覆盖了包括ARC挑战、DROP、GSM8K、HellaSwag及涵盖57个学科的MMLU在内的多样化任务,其核心研究问题聚焦于如何通过低秩适配(LoRA)微调后的指令跟随模型在知识推理、数学计算与常识理解等方面的综合表现。这一数据集不仅为模型开发者提供了透明的性能参照,更推动了开源LLM评估范式的规范化进程。
当前挑战
该数据集所面临的挑战主要体现在两个层面。在领域问题层面,当前LLM评估仍面临任务多样性不足与评测指标单一化的困境,例如GSM8K任务中模型准确率仅达12.2%,揭示了数学推理能力这一核心瓶颈;而DROP任务的F1分数仅为8.5%,凸显了模型在复杂文本理解与精确信息抽取上的局限性。在数据集构建层面,多轮评估结果的时间戳管理(如2023年8月与10月的两次运行)带来了版本控制与结果回溯的复杂性,同时64个配置项与海量parquet文件的组织方式对数据加载效率提出了较高要求。此外,不同任务采用不同few-shot设置(如3-shot与5-shot)导致的评估标准不统一,以及跨语言模型(波兰语微调版本)在英文基准上的泛化能力验证,均为数据集的设计与维护增添了技术挑战。
常用场景
经典使用场景
该数据集为Open LLM Leaderboard中针对StableBeluga-13B-instruct-PL-lora_unload模型的评估结果集合,涵盖了ARC挑战、DROP、GSM8K、HellaSwag、Winogrande及MMLU等多个经典自然语言理解与推理基准任务的细粒度性能记录。研究者可借此深入剖析模型在不同认知维度上的表现,包括常识推理、数学解题、文本蕴含及多学科知识掌握程度,从而全面评估指令微调与低秩适配(LoRA)技术对大型语言模型能力的提升效果。
实际应用
在实际应用中,该数据集可作为模型选型与部署决策的量化依据。当开发者需要在算力受限环境下选择适配方案时,可参照该数据集中StableBeluga-13B在Winogrande(76.56%准确率)和GSM8K(12.21%准确率)上的表现,权衡推理能力与资源消耗。此外,该数据集还可用于自动化模型监控系统,通过持续追踪新版本模型在相同基准上的性能变化,预警潜在的回归退化,保障生产环境中大语言模型的服务质量。
衍生相关工作
该数据集衍生了一系列关于大模型评估标准化与参数高效微调对比分析的研究工作。典型的衍生方向包括:基于该数据构建多维度模型能力雷达图的可视化分析工具;利用其细粒度评测记录探究LoRA秩数与模型性能之间的缩放规律;以及将其作为数据源训练性能预测器,实现对未评测模型在同类任务上表现的预估。这些工作共同推进了开源大模型生态中评测体系的规范化与自动化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务