遇见数据集

open-llm-leaderboard/details_KoboldAI__GPT-J-6B-Janeway

收藏
Hugging Face2023-10-21 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在评估模型KoboldAI/GPT-J-6B-Janeway时自动创建的,用于Open LLM Leaderboard的评估任务。数据集包含64个配置,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果存储为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

This dataset was automatically created during the evaluation of the model KoboldAI/GPT-J-6B-Janeway for the evaluation tasks of the Open LLM Leaderboard. It includes 64 configurations, each corresponding to one evaluation task. The dataset is generated from two runs, with the results of each run stored as a specific data split, where the split name uses the timestamp of the corresponding run. The `train` split always points to the most recent results. Additionally, there is a configuration named `results` that stores the aggregated results of all runs, which is used to calculate and display the aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集来源

该数据集是在对模型 KoboldAI/GPT-J-6B-Janeway 进行评估运行时自动创建的,评估结果展示在 Open LLM Leaderboard 上。

数据集结构

数据集由64个配置组成,每个配置对应一个评估任务。数据集从2次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

额外配置

一个额外的配置 "results" 存储了所有运行的聚合结果,用于计算和显示在 Open LLM Leaderboard 上的聚合指标。

数据加载示例

以下是一个加载特定运行详细信息的示例代码: python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_KoboldAI__GPT-J-6B-Janeway", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-21T15:51:36.283517 运行 的最新结果: python { "all": { "em": 0.001153523489932886, "em_stderr": 0.0003476179896857095, "f1": 0.04762374161073833, "f1_stderr": 0.001208940406482686, "acc": 0.33042240390432354, "acc_stderr": 0.008312737588634883 }, "harness|drop|3": { "em": 0.001153523489932886, "em_stderr": 0.0003476179896857095, "f1": 0.04762374161073833, "f1_stderr": 0.001208940406482686 }, "harness|gsm8k|5": { "acc": 0.013646702047005308, "acc_stderr": 0.0031957470754808088 }, "harness|winogrande|5": { "acc": 0.6471981057616417, "acc_stderr": 0.013429728101788958 } }

配置详情

以下是数据集的配置详情:

  • config_name: harness_arc_challenge_25

    • split: 2023_07_19T15_39_54.753616
      • path: **/details_harness|arc:challenge|25_2023-07-19T15:39:54.753616.parquet
    • split: latest
      • path: **/details_harness|arc:challenge|25_2023-07-19T15:39:54.753616.parquet
  • config_name: harness_drop_3

    • split: 2023_10_21T15_51_36.283517
      • path: **/details_harness|drop|3_2023-10-21T15-51-36.283517.parquet
    • split: latest
      • path: **/details_harness|drop|3_2023-10-21T15-51-36.283517.parquet
  • config_name: harness_gsm8k_5

    • split: 2023_10_21T15_51_36.283517
      • path: **/details_harness|gsm8k|5_2023-10-21T15-51-36.283517.parquet
    • split: latest
      • path: **/details_harness|gsm8k|5_2023-10-21T15-51-36.283517.parquet
  • config_name: harness_hellaswag_10

    • split: 2023_07_19T15_39_54.753616
      • path: **/details_harness|hellaswag|10_2023-07-19T15:39:54.753616.parquet
    • split: latest
      • path: **/details_harness|hellaswag|10_2023-07-19T15:39:54.753616.parquet
  • config_name: harness_hendrycksTest_5

    • split: 2023_07_19T15_39_54.753616
      • path:
        • **/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-anatomy|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-astronomy|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-business_ethics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-college_biology|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-college_chemistry|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-college_computer_science|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-college_mathematics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-college_medicine|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-college_physics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-computer_security|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-conceptual_physics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-econometrics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-electrical_engineering|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-formal_logic|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-global_facts|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_biology|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_european_history|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_geography|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_physics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_psychology|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_statistics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_us_history|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-high_school_world_history|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-human_aging|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-human_sexuality|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-international_law|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-jurisprudence|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-logical_fallacies|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-machine_learning|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-management|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-marketing|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-medical_genetics|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-miscellaneous|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-moral_disputes|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-moral_scenarios|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-nutrition|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-philosophy|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-prehistory|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-professional_accounting|5_2023-07-19T15:39:54.753616.parquet
        • **/details_harness|hendrycksTest-professional_law|5_2023-07-19T
搜集汇总
数据集介绍
构建方式
在大型语言模型评估的学术实践中,该数据集作为Open LLM Leaderboard评测框架下的产物,专为KoboldAI/GPT-J-6B-Janeway模型而生。其构建过程遵循自动化流水线,通过两次独立的评估运行,将模型在64个不同任务上的表现细节以Parquet格式文件进行存储。每个任务对应一个独立的配置项,而每次运行的结果则被封装为以时间戳命名的数据分割,其中'train'分割始终指向最新一次的评估输出,确保了数据溯源与更新的一致性。此外,一个名为'results'的配置项被专门设立,用于汇聚所有评估轮次的聚合指标,为排行榜的最终可视化呈现提供计算基础。
特点
该数据集的核心特质在于其精细化的任务导向结构与时序演进能力。它横跨了如ARC挑战赛、DROP推理、GSM8K数学、HellaSwag常识、Winogrande指代消解以及涵盖57个学科的MMLU基准测试等多元评估维度,充分体现了对模型综合能力的深度剖析。通过将每次评估独立归档并保留历史快照,数据集不仅记录了模型性能的瞬时状态,更捕捉了其随时间推移的演变轨迹。这种设计使得研究者能够精准回溯任一时刻的评测细节,从而为模型迭代与性能对比提供了宝贵的时间序列视角。
使用方法
研究者可通过Hugging Face的datasets库便捷地接入该数据集。以目标任务'harness_winogrande_5'为例,通过调用load_dataset函数并指定相应的配置名称与分割(如'train'),即可加载最新一次评估的详细记录。若需追溯历史评估数据,则只需将分割参数替换为对应的时间戳标识符。这种灵活的加载机制允许用户按需获取特定任务在特定时刻的完整评估日志,从而支持从微观指标到宏观趋势的多样化分析需求,极大地便利了模型性能的深入解读与横向比较。
背景与挑战
背景概述
在自然语言处理领域,大规模语言模型的性能评估一直是推动技术进步的核心议题。由KoboldAI团队研发的GPT-J-6B-Janeway模型,基于EleutherAI的GPT-J-6B架构,旨在探索6B参数规模下语言模型的推理与生成能力。该数据集由Hugging Face的Open LLM Leaderboard项目于2023年创建,主要研究人员包括Clémentine等,用于系统化评估模型在多项基准任务上的表现,涵盖ARC挑战、DROP、GSM8K、HellaSwag、WinoGrande及MMLU等多样化评测。这一数据集的出现,为社区提供了标准化、可复现的模型评估框架,显著推动了开源大语言模型的透明化比较与性能优化研究。
当前挑战
该数据集所解决的领域问题在于,大语言模型在复杂推理、数学计算、常识理解及多领域知识掌握等任务上仍存在显著能力短板,例如在GSM8K数学推理任务中准确率仅1.36%,DROP阅读理解任务中F1值仅4.76%,揭示了模型在精确推理与信息抽取方面的不足。构建过程中面临的挑战包括:需协调64个评测配置的标准化执行,确保不同运行批次间指标的可比性;处理海量评测结果的聚合与存储,以支持动态更新的最新结果展示;同时需维护模型版本与评测任务之间的映射关系,避免因模型迭代导致的评估基准漂移问题。
常用场景
经典使用场景
在开放大语言模型评估领域,该数据集作为Open LLM Leaderboard的标准化评测组件,被广泛用于对KoboldAI/GPT-J-6B-Janeway模型进行多维度能力测试。其典型应用方式是通过加载'harness_winogrande_5'等配置,在常识推理、数学推理、阅读理解等数十个任务上获取模型的细粒度性能指标,从而实现对模型综合能力的系统性评估。
解决学术问题
该数据集有效解决了大语言模型性能对比中缺乏统一评测基准的学术难题。通过提供涵盖ARC挑战、DROP、GSM8K、HellaSwag、MMLU等经典评测任务的标准化数据格式,研究者能够以可复现的方式量化模型在不同认知维度上的表现,为模型架构创新、训练策略优化提供了坚实的实证基础,推动了开放语言模型评估体系的规范化进程。
衍生相关工作
该数据集催生了多项具有影响力的衍生工作。基于其提供的细粒度评估结果,研究者开发了多种模型性能预测方法;其多任务、多轮次的评估设计启发了自适应评测策略的研究;数据集中的失败案例分析促进了针对特定能力短板(如数学推理)的定向增强技术。这些工作共同推动了开源大语言模型从粗放式评估向精细化诊断的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务