遇见数据集

open-llm-leaderboard/details_ajibawa-2023__scarlett-33b

收藏
Hugging Face2023-10-16 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在评估模型ajibawa-2023/scarlett-33b时自动创建的,包含3个配置,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割使用运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个results配置存储了所有运行的聚合结果,并用于计算和显示在Open LLM Leaderboard上的聚合指标。

This dataset was automatically created during the evaluation of the model ajibawa-2023/scarlett-33b. It contains 3 configurations, each corresponding to one evaluation task. The dataset is generated from a single run, where each configuration has a dedicated data split, and the splits are named with the timestamp of the run. The train split always points to the most recent results. Additionally, there is a "results" configuration that stores the aggregated results across all runs, and is used to calculate and display the aggregate metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集卡片 for Evaluation run of ajibawa-2023/scarlett-33b

数据集描述

数据集概述

该数据集是在模型 ajibawa-2023/scarlett-33b 的评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集由3个配置组成,每个配置对应一个评估任务。

数据集是从1次运行中创建的。每次运行可以在每个配置中找到一个特定的分割,分割名称使用运行的 timestamp。"train" 分割始终指向最新的结果。

一个额外的配置 "results" 存储了所有运行的聚合结果(并用于计算和显示 Open LLM Leaderboard 上的聚合指标)。

要加载某个运行的详细信息,可以执行以下操作: python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_ajibawa-2023__scarlett-33b", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-16T22:35:33.432949 运行的最新结果

python { "all": { "em": 0.3665058724832215, "em_stderr": 0.004934593891762348, "f1": 0.43883598993288797, "f1_stderr": 0.004751167980569885, "acc": 0.39800367765635275, "acc_stderr": 0.008206189612832142 }, "harness|drop|3": { "em": 0.3665058724832215, "em_stderr": 0.004934593891762348, "f1": 0.43883598993288797, "f1_stderr": 0.004751167980569885 }, "harness|gsm8k|5": { "acc": 0.028051554207733132, "acc_stderr": 0.00454822953383635 }, "harness|winogrande|5": { "acc": 0.7679558011049724, "acc_stderr": 0.011864149691827933 } }

数据集结构

配置

  • harness_drop_3

    • 分割: 2023_10_16T22_35_33.432949
      • 路径: **/details_harness|drop|3_2023-10-16T22-35-33.432949.parquet
    • 分割: latest
      • 路径: **/details_harness|drop|3_2023-10-16T22-35-33.432949.parquet
  • harness_gsm8k_5

    • 分割: 2023_10_16T22_35_33.432949
      • 路径: **/details_harness|gsm8k|5_2023-10-16T22-35-33.432949.parquet
    • 分割: latest
      • 路径: **/details_harness|gsm8k|5_2023-10-16T22-35-33.432949.parquet
  • harness_winogrande_5

    • 分割: 2023_10_16T22_35_33.432949
      • 路径: **/details_harness|winogrande|5_2023-10-16T22-35-33.432949.parquet
    • 分割: latest
      • 路径: **/details_harness|winogrande|5_2023-10-16T22-35-33.432949.parquet
  • results

    • 分割: 2023_10_16T22_35_33.432949
      • 路径: results_2023-10-16T22-35-33.432949.parquet
    • 分割: latest
      • 路径: results_2023-10-16T22-35-33.432949.parquet
搜集汇总
数据集介绍
open-llm-leaderboard/details_ajibawa-2023__scarlett-33b 数据集图片
构建方式
该数据集是在Open LLM Leaderboard框架下,对ajibawa-2023/scarlett-33b模型进行自动化评估过程中生成的。数据集包含三个配置,分别对应三个不同的评测任务,每个任务的结果以Parquet格式存储。一次完整的运行产生了四个配置,其中三个任务配置各自存储对应任务的详细评测结果,而额外的“results”配置则汇总了所有任务的聚合指标。每次运行的快照均以时间戳命名的分割形式保存,而“train”分割始终指向最新一次运行的结果,确保了数据的时效性与可追溯性。
特点
该数据集的核心特色在于其结构化的多任务评测体系。它涵盖了DROP、GSM8K和WinoGrande三个典型基准任务,分别评估模型在阅读理解、数学推理和常识推理方面的能力。每个任务的评测结果均包含精确匹配率、F1分数或准确率等关键指标及其标准误差。数据集不仅记录了单次运行的细粒度结果,还通过聚合配置提供了整体性能概览,便于研究者全面理解模型在不同维度上的表现。
使用方法
用户可通过HuggingFace的datasets库便捷地加载该数据集。具体而言,调用load_dataset函数时需指定数据集名称和所需的任务配置名称,例如“harness_winogrande_5”,并选择“train”分割以获取最新结果。加载后的数据可直接用于分析模型在特定任务上的表现,或结合其他模型结果进行横向比较。该数据集的设计旨在简化评估流程,使研究者能够快速获取并利用标准化的评测数据。
背景与挑战
背景概述
在大型语言模型(LLM)迅猛发展的时代,如何公正、系统地评估模型性能成为推动领域进步的关键。Open LLM Leaderboard由Hugging Face团队于2023年发起,旨在为开放源代码的大语言模型提供标准化评测平台。该数据集记录了模型ajibawa-2023/scarlett-33b在2023年10月16日的单次评估运行结果,涵盖DROP、GSM8K和WinoGrande三项任务,分别考察模型的阅读理解、数学推理与常识推理能力。作为Open LLM Leaderboard生态的重要组成部分,该数据集为研究者提供了模型性能的细粒度细节,助力比较不同模型的优劣,推动开源LLM的透明化发展。其核心研究问题在于通过多任务基准揭示模型在多样化场景下的真实能力,从而引导模型优化方向。
当前挑战
该数据集所解决的领域问题在于应对大语言模型评估中的碎片化与不可复现性,即缺乏统一、可比的评测标准。具体挑战包括:1) 多任务评估的覆盖度不足,仅三项任务难以全面反映模型在复杂语言理解、逻辑推理与知识应用上的综合表现;2) 构建过程中面临数据标准化难题,不同任务(如DROP的精确匹配与F1分数、GSM8K的准确率)的指标需在统一框架下整合,但各任务难度与评估粒度差异显著;3) 单次运行结果受随机性影响(如模型采样温度、种子设置),导致结果波动,而该数据集仅包含一次运行,缺乏多次均值与置信区间,限制了统计稳健性;4) 数据版本管理复杂,评估结果需与模型版本、时间戳严格关联,但README中未明确标注模型的具体版本号,可能引入溯源歧义。
常用场景
经典使用场景
在大型语言模型(LLM)的评估与比较研究中,该数据集被广泛用于基准测试场景。它通过记录ajibawa-2023/scarlett-33b模型在Open LLM Leaderboard上的多次评估运行细节,为研究者提供了标准化、可复现的评测数据。具体而言,数据集包含DROP、GSM8K和Winogrande三个经典任务的逐项结果,涵盖精确匹配率(EM)、F1分数及准确率等核心指标,使得不同模型在相同任务上的性能对比成为可能。这种结构化的评估数据,为后续模型改进和算法迭代提供了坚实的实证基础。
解决学术问题
该数据集有效回应了大型语言模型评测中普遍存在的“结果不可复现”与“评价标准不统一”两大痛点。通过将每次评估运行的结果独立存储为时间戳命名的数据分片,并统一聚合为“results”配置,研究者得以精确追溯模型在特定时刻的具体表现。其解决的学术问题包括:如何构建跨模型、跨任务的公平比较框架,以及如何在缺乏标准评测集的情况下,利用公开排行榜数据验证模型能力。这一工作极大推动了LLM领域实证研究的严谨性与透明度。
衍生相关工作
基于该数据集所记载的评估流程与结果,衍生了一系列重要的学术工作。首先,Open LLM Leaderboard项目本身即以此类数据集为基石,构建了覆盖数百个模型的公开排行榜,催生了大量关于模型能力对比的元分析研究。其次,研究者利用其中的细粒度结果,开发了多种评估结果可视化工具与模型性能预测模型,例如通过历史运行数据推断模型在未测试任务上的表现。此外,该数据集还启发了针对特定任务(如Winogrande)的对抗样本生成研究,旨在探索模型在边界条件下的鲁棒性边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务