遇见数据集

open-llm-leaderboard-old/details_TFLai__gpt-neo-1.3B-4bit-alpaca

收藏
Hugging Face2023-09-23 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型TFLai/gpt-neo-1.3B-4bit-alpaca进行评估时自动生成的。数据集由64个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行在每个配置中表示为特定的分割,分割名称由运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个results配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。README还提供了如何使用Python中的datasets库加载运行细节的示例。

该数据集是在Open LLM Leaderboard上对模型TFLai/gpt-neo-1.3B-4bit-alpaca进行评估时自动生成的。数据集由64个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行在每个配置中表示为特定的分割,分割名称由运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个results配置存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。README还提供了如何使用Python中的datasets库加载运行细节的示例。

原始信息汇总

数据集概述

数据集简介

该数据集是在对模型 TFLai/gpt-neo-1.3B-4bit-alpaca 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集结构

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_TFLai__gpt-neo-1.3B-4bit-alpaca", "harness_winogrande_5", split="train")

最新结果

以下是 2023-09-23T17:57:15.784929 运行的最新结果: python { "all": { "em": 0.0009437919463087249, "em_stderr": 0.00031446531194133983, "f1": 0.05118708053691287, "f1_stderr": 0.001257884278930374, "acc": 0.2821159149890526, "acc_stderr": 0.007628169555669113 }, "harness|drop|3": { "em": 0.0009437919463087249, "em_stderr": 0.00031446531194133983, "f1": 0.05118708053691287, "f1_stderr": 0.001257884278930374 }, "harness|gsm8k|5": { "acc": 0.002274450341167551, "acc_stderr": 0.0013121578148674233 }, "harness|winogrande|5": { "acc": 0.5619573796369376, "acc_stderr": 0.013944181296470803 } }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_08_18T13_07_16.687815
      • 路径:**/details_harness|arc:challenge|25_2023-08-18T13:07:16.687815.parquet
    • 分割:latest
      • 路径:**/details_harness|arc:challenge|25_2023-08-18T13:07:16.687815.parquet
  • harness_drop_3

    • 分割:2023_09_23T17_57_15.784929
      • 路径:**/details_harness|drop|3_2023-09-23T17-57-15.784929.parquet
    • 分割:latest
      • 路径:**/details_harness|drop|3_2023-09-23T17-57-15.784929.parquet
  • harness_gsm8k_5

    • 分割:2023_09_23T17_57_15.784929
      • 路径:**/details_harness|gsm8k|5_2023-09-23T17-57-15.784929.parquet
    • 分割:latest
      • 路径:**/details_harness|gsm8k|5_2023-09-23T17-57-15.784929.parquet
  • harness_hellaswag_10

    • 分割:2023_08_18T13_07_16.687815
      • 路径:**/details_harness|hellaswag|10_2023-08-18T13:07:16.687815.parquet
    • 分割:latest
      • 路径:**/details_harness|hellaswag|10_2023-08-18T13:07:16.687815.parquet
  • harness_hendrycksTest_5

    • 分割:2023_08_18T13_07_16.687815
      • 路径:
        • **/details_harness|hendrycksTest-abstract_algebra|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-anatomy|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-astronomy|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-business_ethics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-college_biology|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-college_chemistry|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-college_computer_science|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-college_mathematics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-college_medicine|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-college_physics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-computer_security|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-conceptual_physics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-econometrics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-electrical_engineering|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-formal_logic|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-global_facts|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_biology|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_european_history|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_geography|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_physics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_psychology|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_statistics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_us_history|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-high_school_world_history|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-human_aging|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-human_sexuality|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-international_law|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-jurisprudence|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-logical_fallacies|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-machine_learning|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-management|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-marketing|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-medical_genetics|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-miscellaneous|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-moral_disputes|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-moral_scenarios|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-nutrition|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-philosophy|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-prehistory|5_2023-08-18T13:07:16.687815.parquet
        • **/details_harness|hendrycksTest-professional_accounting|5_2023-08-18T13:07:16.687815.parquet
        • `**/details_harness|hendrycksTest-professional_law|5_2023-08-18T13:07:16.
搜集汇总
数据集介绍
open-llm-leaderboard-old/details_TFLai__gpt-neo-1.3B-4bit-alpaca 数据集图片
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 提供了一个标准化的评测框架。该数据集专为记录模型 TFLai/gpt-neo-1.3B-4bit-alpaca 在排行榜上的评估过程而构建,由两次独立运行生成。数据集包含 64 个配置,每个配置对应一项被评估的任务,例如 ARC Challenge、DROP、GSM8K 等。每次运行的结果被存储为对应配置下的一个独立分割(split),并以运行时间戳命名,而名为“train”的分割则始终指向最新一次运行的结果。此外,一个名为“results”的附加配置汇集了所有运行的聚合指标,用于在排行榜界面上计算和展示综合得分。数据以 Parquet 格式存储,确保了高效的读取与处理能力。
特点
该数据集的核心特征在于其精细化的结构和版本追踪能力。每个任务配置下的多个分割(如时间戳命名的分割和 latest 分割)使得研究者能够回溯模型在特定时间点的表现,方便进行历史对比和性能趋势分析。数据集涵盖了从常识推理(如 HellaSwag)、数学问题求解(GSM8K)到广泛学科知识(MMLU 的 57 个子任务)等多种评估维度,提供了对模型能力的多角度刻画。所有评估结果均包含详细的统计指标(如准确率、F1 分数及其标准误),为深入分析模型性能的稳定性与可靠性提供了坚实的数据基础。
使用方法
研究者可通过 Hugging Face 的 datasets 库便捷地加载该数据集。使用时,需指定具体的配置名称(即任务名称,如 "harness_winogrande_5")以及期望的分割(split),例如加载最新结果可使用 split="train",而加载特定历史运行结果则使用对应的时间戳字符串。加载后的数据集可直接用于复现排行榜上的评估结果、进行模型性能的细粒度分析,或作为教学示例展示语言模型评估流程。对于需要获取聚合指标的场景,可直接访问 "results" 配置,其中存储了所有任务的汇总得分,便于快速了解模型的整体表现水平。
背景与挑战
背景概述
随着大语言模型(LLM)领域的蓬勃发展,如何系统性地评估模型性能已成为推动技术进步的核心议题。在此背景下,Hugging Face团队于2023年发起了Open LLM Leaderboard项目,旨在为各类开源模型提供标准化、多维度的评估基准。该数据集作为Leaderboard的组成部分,专门记录了TFLai团队提交的gpt-neo-1.3B-4bit-alpaca模型的详细评测结果,由Clementine Fourrier等研究人员主导构建。数据集涵盖了ARC-Challenge、HellaSwag、MMLU、GSM8K、Winogrande及DROP等多项经典任务,通过统一的评估框架(LM Evaluation Harness)对模型在推理、常识、数学及阅读理解等维度的表现进行量化分析。这一工作不仅为模型开发者提供了可复现的细粒度性能反馈,也为社区对比不同模型能力、探索模型优化方向提供了可靠的数据支撑,在推动开源LLM生态透明化与标准化方面具有重要影响力。
当前挑战
该数据集所解决的领域问题在于,大语言模型性能评估长期面临评测标准不一、任务覆盖不全、结果难以复现等困境。通过构建包含64个配置项的标准化评测流水线,数据集首次将多任务评估结果以结构化形式统一存储,使得不同模型的横向比较成为可能。然而,在构建过程中同样面临诸多挑战:其一,评测任务涵盖从常识推理到数学计算的多样领域,需确保各任务数据格式与评估协议的兼容性;其二,模型在不同运行时间点产生的评测结果需通过时间戳分片进行管理,如何保证最新结果与历史数据的无缝衔接成为技术难点;其三,面对如gsm8k任务中模型仅获得0.2%的准确率等极端表现,如何设计鲁棒的统计指标以准确反映模型真实能力,避免因样本量不足或任务难度失衡导致的偏差,始终是评估体系设计中的核心挑战。
常用场景
经典使用场景
在大型语言模型评估领域,该数据集作为Open LLM Leaderboard的评测产物,专门用于记录和存储模型TFLai/gpt-neo-1.3B-4bit-alpaca在多项基准任务上的细粒度性能指标。其核心应用在于通过64个独立配置对应不同评测任务,如ARC挑战、DROP、GSM8K、HellaSwag及涵盖57个学科的MMLU等,为研究人员提供模型在常识推理、数学解题、文本理解等多维度能力的量化分析基础。每个配置内按时间戳划分运行批次,便于追踪模型迭代过程中的性能演变,从而支撑对量化压缩(4-bit)与指令微调(Alpaca)策略效果的深入剖析。
衍生相关工作
该数据集衍生出的相关工作主要围绕Open LLM Leaderboard生态展开,催生了一系列模型性能对比分析与排行榜优化研究。例如,基于其提供的细粒度评测日志,研究者开发了针对不同模型家族(如GPT-Neo、LLaMA等)的性能退化诊断工具,用以识别量化或微调操作导致的能力短板。同时,数据集中丰富的MMLU子任务结果激发了关于模型知识覆盖广度与深度关系的探讨,部分工作据此提出了面向特定学科(如医学、法律)的定向增强训练策略。此外,评测元数据的结构化存储范式也被后续模型评估基准(如HELM、LM Evaluation Harness)采纳为参考模板。
数据集最近研究
最新研究方向
当前,随着大语言模型(LLM)的广泛应用,模型性能的标准化评估成为领域内备受瞩目的热点。该数据集作为Open LLM Leaderboard评估流程的产物,专门记录了TFLai/gpt-neo-1.3B-4bit-alpaca模型在多项任务上的细粒度表现,涵盖ARC挑战、DROP、GSM8K、HellaSwag及涵盖57个学科的MMLU等基准测试。其前沿研究方向聚焦于模型量化与指令微调后的泛化能力剖析,特别是4-bit量化策略在保持推理效率的同时对模型在数学推理、常识问答和复杂阅读理解等任务上准确率与鲁棒性的影响。通过追踪多次评估运行的结果,该数据集为探究轻量化部署方案与模型性能的权衡提供了关键实证,推动了边缘计算场景下高效LLM的实用化进程,其意义在于构建了透明、可复现的模型比较框架,助力社区客观审视模型压缩技术的真实效能。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务