遇见数据集

open-llm-leaderboard-old/details_pszemraj__pythia-31m-goodwiki-deduped-2048-scratch

收藏
Hugging Face2023-10-29 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在模型[pszemraj/pythia-31m-goodwiki-deduped-2048-scratch](https://huggingface.co/pszemraj/pythia-31m-goodwiki-deduped-2048-scratch)的评估运行过程中自动创建的,用于[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的评估。数据集由64个配置组成,每个配置对应一个评估任务。数据集是从2次运行中创建的,每次运行的结果都作为一个特定的分割存储在配置中,分割的名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,并用于计算和显示[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的聚合指标。

该数据集是在模型[pszemraj/pythia-31m-goodwiki-deduped-2048-scratch](https://huggingface.co/pszemraj/pythia-31m-goodwiki-deduped-2048-scratch)的评估运行过程中自动创建的,用于[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的评估。数据集由64个配置组成,每个配置对应一个评估任务。数据集是从2次运行中创建的,每次运行的结果都作为一个特定的分割存储在配置中,分割的名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,并用于计算和显示[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的聚合指标。

原始信息汇总

数据集概述

该数据集是在评估模型 pszemraj/pythia-31m-goodwiki-deduped-2048-scratch 在 Open LLM Leaderboard 上的运行过程中自动创建的。

数据集组成

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_pszemraj__pythia-31m-goodwiki-deduped-2048-scratch", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-29T03:01:00.285716 运行的最新结果:

python { "all": { "em": 0.00010486577181208053, "em_stderr": 0.00010486577181208337, "f1": 0.008596895973154373, "f1_stderr": 0.0005046567083861136, "acc": 0.2494080505130229, "acc_stderr": 0.007026223145264504 }, "harness|drop|3": { "em": 0.00010486577181208053, "em_stderr": 0.00010486577181208337, "f1": 0.008596895973154373, "f1_stderr": 0.0005046567083861136 }, "harness|gsm8k|5": { "acc": 0.0, "acc_stderr": 0.0 }, "harness|winogrande|5": { "acc": 0.4988161010260458, "acc_stderr": 0.014052446290529009 } }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|arc:challenge|25_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|arc:challenge|25_2023-09-15T02-30-14.696113.parquet
  • harness_drop_3

    • 分割:2023_10_29T03_01_00.285716
    • 路径:**/details_harness|drop|3_2023-10-29T03-01-00.285716.parquet
    • 分割:latest
    • 路径:**/details_harness|drop|3_2023-10-29T03-01-00.285716.parquet
  • harness_gsm8k_5

    • 分割:2023_10_29T03_01_00.285716
    • 路径:**/details_harness|gsm8k|5_2023-10-29T03-01-00.285716.parquet
    • 分割:latest
    • 路径:**/details_harness|gsm8k|5_2023-10-29T03-01-00.285716.parquet
  • harness_hellaswag_10

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hellaswag|10_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hellaswag|10_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-09-15T02-30-14.696113.parquet 等 50 个文件
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-09-15T02-30-14.696113.parquet 等 50 个文件
  • harness_hendrycksTest_abstract_algebra_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_anatomy_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_astronomy_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_business_ethics_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_clinical_knowledge_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_college_biology_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_college_chemistry_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_college_computer_science_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_college_mathematics_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_college_medicine_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_college_physics_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_computer_security_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_conceptual_physics_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_econometrics_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-09-15T02-30-14.696113.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-09-15T02-30-14.696113.parquet
  • harness_hendrycksTest_electrical_engineering_5

    • 分割:2023_09_15T02_30_14.696113
    • 路径:`**/details_harness|hendrycksTest-electrical_engineering|5_2023-09-15T02-30-14.696113.parquet
搜集汇总
数据集介绍
open-llm-leaderboard-old/details_pszemraj__pythia-31m-goodwiki-deduped-2048-scratch 数据集图片
构建方式
在大型语言模型评估领域,该数据集是专为记录模型pszemraj/pythia-31m-goodwiki-deduped-2048-scratch在Open LLM Leaderboard上的评测过程而自动生成的。构建方式基于两轮独立的评估运行,每轮运行对应一个独立的时间戳分割,其中“train”分割始终指向最新一轮的评估结果。数据集包含64个配置,每个配置对应一个被评估的任务,如ARC挑战、DROP、GSM8K、WinoGrande等,此外还设有一个“results”配置,用于汇总所有任务的聚合指标。数据以Parquet格式存储,确保高效存取。
特点
该数据集的核心特点在于其结构化的多任务评估体系,覆盖了从常识推理(如HellaSwag)到数学问题求解(如GSM8K)的多样化能力测试。每个配置均独立存储特定任务的详细结果,包括准确率、F1值等关键性能指标及其标准误差。通过时间戳分割,数据集能够追溯不同评估历史版本,支持对比分析。此外,聚合配置“results”提供了整体性能概览,便于快速了解模型在各项任务上的综合表现。
使用方法
使用方法简洁直观,研究人员可通过Hugging Face的datasets库加载指定任务的数据。例如,使用load_dataset函数并指定配置名称(如“harness_winogrande_5”)和分割(如“train”)即可获取最新结果。若要访问历史评估数据,可替换分割名称为对应的时间戳字符串。数据集支持按需加载特定任务的Parquet文件,便于深入分析模型在单项任务上的表现,或结合“results”配置进行跨任务性能对比。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的浪潮中,如何系统、公正地评估模型性能成为学界与工业界共同关注的焦点。Open LLM Leaderboard由HuggingFace团队于2023年发起,旨在为开源社区提供一个标准化、可复现的模型评测平台。该数据集作为Leaderboard的一部分,专门记录了名为pszemraj/pythia-31m-goodwiki-deduped-2048-scratch的轻量级语言模型在多种任务上的评估细节,涵盖ARC挑战赛、DROP、GSM8K、HellaSwag及MMLU等广泛基准。通过存储每次运行的分项指标与聚合结果,该数据集不仅揭示了小规模模型在复杂推理与常识理解任务中的能力边界,也为后续模型优化与对比研究提供了坚实的数据基础。
当前挑战
该数据集所承载的评测任务本身构成了多重挑战。在领域问题层面,模型需应对从科学问答(ARC)到数学推理(GSM8K)再到常识判断(Winogrande)的多样化任务,这对仅有3100万参数的模型而言极具难度,尤其是GSM8K任务中零分结果凸显了小模型在符号推理上的天然短板。在构建过程中,挑战体现在评测流程的标准化与可复现性上:需要为64个配置项统一数据格式、处理多轮运行的时间戳分片,并确保最新结果与历史结果间的正确映射。此外,DROP任务中极低的精确匹配与F1分数(均不足1%)进一步暴露了模型在细粒度文本理解上的不足,这些结果对于理解小模型的能力边界与改进方向具有重要参考价值。
常用场景
经典使用场景
在自然语言处理领域,该数据集作为Open LLM Leaderboard的评测结果记录,其经典使用场景在于为大语言模型提供标准化、多维度的性能评估基准。研究者通过加载该数据集中的各任务配置,如ARC挑战、HellaSwag、MMLU等,能够系统性地比较模型在常识推理、知识问答、数学计算等不同维度的表现,从而精准定位模型的优势与短板。
解决学术问题
该数据集解决了大语言模型评测中缺乏统一、可复现的评估框架这一核心学术问题。通过记录pszemraj/pythia-31m-goodwiki-deduped-2048-scratch模型在多个任务上的细粒度结果,它为模型能力对比、训练策略优化提供了可靠的数据支撑。其意义在于推动了模型评测的标准化进程,使研究者能基于客观指标衡量模型进展,进而促进语言模型领域的良性竞争与透明化发展。
衍生相关工作
该数据集衍生出的相关工作包括:基于其评测结果开发的模型性能可视化工具,以及用于自动化模型选型的排行榜聚合算法。研究者利用该数据集中的细粒度指标,进一步提出了任务难度加权评分方法,以更公平地评估不同规模模型的综合能力。这些衍生工作共同构建了从模型评测到优化决策的完整闭环,深化了学术界与工业界对大语言模型能力边界的认知。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务