遇见数据集

open-llm-leaderboard/details_KoboldAI__OPT-6B-nerys-v2

收藏
Hugging Face2023-10-17 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型KoboldAI/OPT-6B-nerys-v2进行评估运行时自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。数据集是从2次运行中生成的,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用`datasets`库中的`load_dataset`函数加载数据集的示例。

This dataset was automatically created during the evaluation run of the model KoboldAI/OPT-6B-nerys-v2 on the Open LLM Leaderboard. The dataset consists of 64 configurations, each corresponding to one evaluation task. The dataset is generated from two evaluation runs, with each run representing a specific split for each configuration. The 'train' split always points to the most recent results. An additional configuration named 'results' stores the aggregated results across all runs, which are used to calculate and display the aggregate metrics on the Open LLM Leaderboard. The README also provides examples of how to load the dataset using the `load_dataset` function from the `datasets` library.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集简介

该数据集是在对模型 KoboldAI/OPT-6B-nerys-v2 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集结构

  • 配置数量:64个配置,每个配置对应一个评估任务。
  • 创建来源:数据集来自2次运行,每次运行在每个配置中作为一个特定的分片存在,分片名称使用运行的时间戳。
  • 最新结果:"train" 分片始终指向最新的结果。
  • 汇总结果:一个额外的配置 "results" 存储所有运行的汇总结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_KoboldAI__OPT-6B-nerys-v2", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-17T17:27:37.555726 运行的最新结果: python { "all": { "em": 0.001363255033557047, "em_stderr": 0.00037786091964606383, "f1": 0.04780515939597329, "f1_stderr": 0.0011803538106248462, "acc": 0.331351691297071, "acc_stderr": 0.007809829503630222 }, "harness|drop|3": { "em": 0.001363255033557047, "em_stderr": 0.00037786091964606383, "f1": 0.04780515939597329, "f1_stderr": 0.0011803538106248462 }, "harness|gsm8k|5": { "acc": 0.006823351023502654, "acc_stderr": 0.0022675371022545087 }, "harness|winogrande|5": { "acc": 0.6558800315706393, "acc_stderr": 0.013352121905005935 } }

配置详情

  • harness_arc_challenge_25

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|arc:challenge|25_2023-07-19T15:44:43.030305.parquet
  • harness_drop_3

    • 分片:2023_10_17T17_27_37.555726, latest
    • 路径:**/details_harness|drop|3_2023-10-17T17-27-37.555726.parquet
  • harness_gsm8k_5

    • 分片:2023_10_17T17_27_37.555726, latest
    • 路径:**/details_harness|gsm8k|5_2023-10-17T17-27-37.555726.parquet
  • harness_hellaswag_10

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hellaswag|10_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:多个路径,例如 **/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_abstract_algebra_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_anatomy_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_astronomy_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_business_ethics_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_clinical_knowledge_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_college_biology_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_college_chemistry_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_college_computer_science_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_college_mathematics_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_college_medicine_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_college_physics_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_computer_security_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_conceptual_physics_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_econometrics_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_electrical_engineering_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-electrical_engineering|5_2023-07-19T15:44:43.030305.parquet
  • harness_hendrycksTest_elementary_mathematics_5

    • 分片:2023_07_19T15_44_43.030305, latest
    • 路径:**/details_harness|hendrycksTest-elementary_mathematics|5_2023-07-19T15:44:43.030305.parquet

以上是对数据集的详细概述,包括数据集的简介、结构、加载示例、最新结果以及各个配置的详细信息。

搜集汇总
数据集介绍
open-llm-leaderboard/details_KoboldAI__OPT-6B-nerys-v2 数据集图片
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 作为权威的基准测试平台,为模型性能的横向比较提供了标准化框架。该数据集正是在此背景下,针对 KoboldAI/OPT-6B-nerys-v2 模型在 Leaderboard 上的评估过程而自动生成的。其构建方式具有高度的系统性与自动化特征:数据集由 64 个配置组成,每个配置精准对应一个被评估的任务,如 ARC Challenge、DROP、GSM8K 等。评估过程共执行了两次运行,每次运行的结果均以独立的分片形式存储,分片名称采用运行的时间戳进行标识,而“train”分片则始终指向最新一次运行的结果。此外,专门设立的“results”配置用于汇总所有运行的聚合指标,为 Leaderboard 上最终分数的计算与展示提供数据基础。
使用方法
该数据集的使用方法遵循 HuggingFace Datasets 库的标准接口,操作直观且灵活。用户可通过 `load_dataset` 函数加载指定配置下的数据,例如加载 Winogrande 任务的详细信息时,只需传入数据集名称与配置名“harness_winogrande_5”,并指定分片为“train”即可获取最新评估结果。若需回溯历史评估,则可将分片参数替换为对应运行的时间戳字符串,从而访问特定时间点的原始数据。对于需要获取模型整体性能的研究者,直接加载“results”配置即可获得所有任务的聚合指标,免去了逐一处理的繁琐。这种设计兼顾了微观分析与宏观概览的双重需求,显著降低了数据检索与复用的门槛。
背景与挑战
背景概述
在大规模语言模型迅猛发展的当下,如何系统、公平地评估模型的多维能力成为学界与工业界共同关注的焦点。Open LLM Leaderboard应运而生,旨在通过标准化基准为各类开源语言模型提供可复现的性能度量。该数据集由HuggingFace团队于2023年创建,核心联络人为Clémentine Fourrier,其研究问题聚焦于构建一个自动化、透明化的评估流水线,涵盖从常识推理到数学解题等多样化任务。作为KoboldAI/OPT-6B-nerys-v2模型在排行榜上的评估记录,该数据集不仅反映了特定模型在ARC、HellaSwag、MMLU等基准上的表现,更通过多次运行的时间戳分片设计,为追踪模型性能演化提供了独特视角,对推动开源语言模型的可比性研究具有重要示范意义。
当前挑战
该数据集所应对的核心挑战在于如何克服语言模型评估中的碎片化与不可复现性问题。传统评估常因环境差异、提示格式不一或采样策略不同而导致结果失真,Open LLM Leaderboard通过固定评估框架(如LM Evaluation Harness)和统一的任务配置(如few-shot样本数)来缓解这一困境。构建过程中面临的挑战包括:需协调64个不同任务配置的并行评估,确保每个子任务(如Winogrande的5-shot设置)的评分逻辑严格一致;同时,由于模型输出具有随机性,多次运行间的结果波动(如DROP任务中F1值仅0.0478)要求设计合理的统计聚合策略,以区分模型能力差异与随机噪声。此外,大规模评测的计算资源调度与结果存储的版本化管理,也是保障数据集长期可用性的技术难点。
常用场景
经典使用场景
该数据集作为Open LLM Leaderboard评估体系的核心组件,专门用于标准化评测KoboldAI/OPT-6B-nerys-v2等大语言模型的多维度能力。其经典使用场景涵盖了对模型在ARC挑战赛、HellaSwag常识推理、MMLU多学科知识、GSM8K数学推理及Winogrande指代消解等64项任务上的表现进行系统性量化分析。研究者可通过加载特定配置(如harness_winogrande_5)获取模型在每项任务中的详细得分,从而实现对模型推理、知识储备及语言理解能力的精准刻画。
解决学术问题
该数据集有效攻克了大语言模型评估中缺乏统一基准与细粒度指标的核心难题。通过将模型在DROP、GSM8K等任务上的准确率(acc)、精确匹配率(em)及F1分数等关键指标结构化存储,它解决了跨模型横向对比时评价标准不统一的问题。这一设计为学术界提供了可复现的评估范式,其影响力体现在推动了模型性能透明化报告与可重复性研究的发展,为后续模型优化提供了可靠的量化依据。
实际应用
在实际应用中,该数据集服务于模型选型与迭代优化的全流程。开发团队可基于其记录的详细评估结果(如2023-10-17T17:27:37.555726运行批次),精准定位模型在特定任务(如数学推理或常识问答)上的短板,进而指导微调策略的制定。同时,该数据集为模型排行榜的实时更新提供了数据支撑,帮助工业界在部署前快速筛选出最适合特定场景的高性能模型,降低试错成本。
数据集最近研究
最新研究方向
当前,大语言模型(LLM)的评估与基准测试已成为推动模型发展的关键环节。Open LLM Leaderboard 作为该领域的重要公共评估平台,其数据集构建方式反映了前沿研究方向——即通过标准化、多任务、多轮次的自动化评测体系,系统性地衡量模型的综合能力。该数据集围绕 KoboldAI/OPT-6B-nerys-v2 模型,整合了涵盖常识推理(如 Winogrande)、数学解题(GSM8K)、阅读理解(DROP)以及多学科知识(MMLU)等多样化的评测任务,每个任务均包含多次独立运行的详细结果,从而支持对模型性能的细粒度分析与复现。这一研究方向的核心意义在于,它推动了 LLM 评估从单一指标向多维、动态、可追溯的范式转变,为社区提供了透明、公平的模型对比基准,进而加速了更强大、更鲁棒的语言模型的研发与迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务