遇见数据集

open-llm-leaderboard/details_AlpinDale__pygmalion-instruct

收藏
Hugging Face2023-12-03 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在评估模型AlpinDale/pygmalion-instruct时自动创建的,用于Open LLM Leaderboard。数据集由64个配置组成,每个配置对应一个评估任务。数据集由3次运行创建,每次运行的结果作为特定分割存储在配置中,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,还有一个名为results的配置,存储所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型AlpinDale/pygmalion-instruct时自动创建的,用于Open LLM Leaderboard。数据集由64个配置组成,每个配置对应一个评估任务。数据集由3次运行创建,每次运行的结果作为特定分割存储在配置中,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,还有一个名为results的配置,存储所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在模型 AlpinDale/pygmalion-instruct 的评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 3 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_AlpinDale__pygmalion-instruct", "harness_gsm8k_5", split="train")

最新结果

以下是 2023-12-03T16:32:30.526837 运行的最新结果: python { "all": { "acc": 0.09855951478392722, "acc_stderr": 0.008210320350946347 }, "harness|gsm8k|5": { "acc": 0.09855951478392722, "acc_stderr": 0.008210320350946347 } }

配置详情

  • harness_arc_challenge_25

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|arc:challenge|25_2023-08-17T11:20:15.687659.parquet
  • harness_drop_3

    • 分割: 2023_09_09T13_40_12.695061, latest
    • 路径: **/details_harness|drop|3_2023-09-09T13-40-12.695061.parquet
  • harness_gsm8k_5

    • 分割: 2023_09_09T13_40_12.695061, 2023_12_03T16_32_30.526837, latest
    • 路径: **/details_harness|gsm8k|5_2023-09-09T13-40-12.695061.parquet, **/details_harness|gsm8k|5_2023-12-03T16-32-30.526837.parquet
  • harness_hellaswag_10

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hellaswag|10_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: 多个路径,详见原文
  • harness_hendrycksTest_abstract_algebra_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-abstract_algebra|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_anatomy_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-anatomy|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_astronomy_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-astronomy|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_business_ethics_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-business_ethics|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_clinical_knowledge_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-clinical_knowledge|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_college_biology_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-college_biology|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_college_chemistry_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-college_chemistry|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_college_computer_science_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-college_computer_science|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_college_mathematics_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-college_mathematics|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_college_medicine_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-college_medicine|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_college_physics_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-college_physics|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_computer_security_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-computer_security|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_conceptual_physics_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-conceptual_physics|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_econometrics_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-econometrics|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_electrical_engineering_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-electrical_engineering|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_elementary_mathematics_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-elementary_mathematics|5_2023-08-17T11:20:15.687659.parquet
  • harness_hendrycksTest_formal_logic_5

    • 分割: 2023_08_17T11_20_15.687659, latest
    • 路径: **/details_harness|hendrycksTest-formal_logic|5_2023-08-17T11:20:15.687659.parquet
搜集汇总
数据集介绍
open-llm-leaderboard/details_AlpinDale__pygmalion-instruct 数据集图片
构建方式
在大规模语言模型评估的蓬勃发展中,Open LLM Leaderboard为模型性能的横向比较提供了标准化舞台。该数据集专为记录AlpinDale/pygmalion-instruct模型的评估过程而构建,其构建方式遵循自动化流水线逻辑:通过运行三次独立的评估任务,将每次运行的结果分别存储为以时间戳命名的数据分割(split),并统一将最新一次运行的结果标记为'train'分割。数据集涵盖64个配置(config),每个配置对应一项具体评估任务(如harness_gsm8k_5),此外还设有'results'配置,用于聚合所有运行的汇总指标,这些指标直接服务于Leaderboard上综合分数的计算与展示。
特点
该数据集的核心特色在于其精细化的版本管理与任务覆盖广度。每一次评估运行都被独立保存为时间戳分割,便于研究者回溯历史性能变化;而'train'分割始终指向最新结果,确保了数据引用的简洁性。配置设计上,数据集囊括了ARC挑战赛、DROP、GSM8K、HellaSwag以及涵盖57个学科的HendrycksTest等多样化任务,从常识推理到专业数学,从医学知识到法律伦理,全面映射了模型在多个维度的能力。这种多任务、多版本的结构,使得数据集不仅是评估记录的容器,更成为模型演进轨迹的忠实档案。
使用方法
研究人员可通过HuggingFace的datasets库便捷地调用该数据集。以加载GSM8K任务的评估细节为例,只需指定配置名'harness_gsm8k_5'及分割'train',即可获取最新运行结果。若需回溯历史,可将分割参数替换为对应的时间戳字符串,如'2023_12_03T16_32_30.526837'。所有数据以Parquet格式存储,支持高效列式读取。对于需要整体性能概览的场景,可直接加载'results'配置,其中包含了如准确率(acc)及其标准误(acc_stderr)等聚合指标,助力快速完成模型能力的定量分析。
背景与挑战
背景概述
随着大规模语言模型在自然语言处理领域的迅猛发展,如何系统、公正地评估模型性能成为学术界与工业界共同关注的焦点。Open LLM Leaderboard应运而生,由Hugging Face团队于2023年创建,旨在为开源大语言模型提供一个标准化的评估平台。该数据集是AlpinDale/pygmalion-instruct模型在Leaderboard上的评测结果记录,涵盖ARC、HellaSwag、GSM8K、MMLU等多项基准测试,通过多次运行追踪模型在不同时间点的表现变化。其核心研究问题在于构建一个透明、可复现的模型评估框架,推动开源社区对语言模型能力的深入理解与比较。该数据集的影响力体现在它为研究者提供了细粒度的评测细节,促进了模型改进方向的明确化,并成为衡量开源LLM进展的重要参考标准。
当前挑战
该数据集所解决的领域挑战主要源于大语言模型评估的碎片化与不透明性。传统评估方式往往依赖单一指标或私有数据集,难以全面反映模型真实能力,且缺乏跨模型的公平比较基准。构建过程中面临的挑战包括:如何设计覆盖多维度能力(如常识推理、数学计算、知识理解)的评测任务组合,确保评估的全面性与代表性;如何管理多次评测运行的时间戳与版本控制,避免数据混乱;以及如何高效存储与分发包含64个配置、大量parquet文件的细粒度评测结果,同时保证数据加载的灵活性与可扩展性。这些技术难题的克服,使得该数据集成为推动开源LLM评估标准化的重要基石。
常用场景
经典使用场景
在大规模语言模型评估领域,Open LLM Leaderboard上的评测数据集已成为衡量模型性能的黄金标准。该数据集专为评估AlpinDale/pygmalion-instruct模型而构建,涵盖64种任务配置,包括ARC挑战赛、HellaSwag常识推理、GSM8K数学问题求解以及涵盖57个学科的MMLU基准测试。研究者通过加载不同任务配置下的细粒度评测结果,能够系统性地分析模型在推理、知识检索与数学计算等多维度能力上的表现,从而精准定位模型的优势与短板。
解决学术问题
该数据集有效解决了大语言模型评估中缺乏标准化、可复现基准的学术难题。传统上,模型性能报告常因评测环境差异而难以横向比较,而此数据集通过统一的任务配置与时间戳标记的多次运行记录,为研究者提供了透明、可追溯的评测轨迹。它使得模型在不同时间点的性能变化得以量化,促进了关于训练策略、数据分布对模型泛化能力影响的深入探讨,对理解模型鲁棒性与持续学习特性具有重要学术价值。
衍生相关工作
基于此数据集,衍生出了多项推动大模型评估体系发展的经典工作。例如,研究者利用其多任务配置开发了模型能力图谱可视化工具,直观展示不同模型在学科知识、逻辑推理等维度的对比。另有工作以此数据集为基准,提出了动态难度调整的评测方案,弥补了静态基准在区分高能力模型时的不足。此外,该数据集的运行日志结构启发了自动化评估管线的设计,促进了Open LLM Leaderboard社区中评测流程的标准化与自动化演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务