遇见数据集

open-llm-leaderboard-old/details_PulsarAI__SlimOpenOrca-Mistral-7B-v2

收藏
Hugging Face2023-11-12 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在评估模型PulsarAI/SlimOpenOrca-Mistral-7B-v2时自动创建的,评估在Open LLM Leaderboard上进行。数据集由64个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置的特定分割中找到,分割以运行的时间戳命名。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型PulsarAI/SlimOpenOrca-Mistral-7B-v2时自动创建的,评估在Open LLM Leaderboard上进行。数据集由64个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置的特定分割中找到,分割以运行的时间戳命名。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

数据集简介

该数据集是在模型 PulsarAI/SlimOpenOrca-Mistral-7B-v2Open LLM Leaderboard 上的评估运行期间自动创建的。

数据集结构

  • 配置数量:64个配置,每个配置对应一个评估任务。
  • 创建来源:数据集从1次运行中创建。每个运行在每个配置中作为一个特定的分割存在,分割名称使用运行的时间戳。
  • 训练分割:"train" 分割始终指向最新的结果。
  • 结果配置:一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示在 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_PulsarAI__SlimOpenOrca-Mistral-7B-v2_public", "harness_winogrande_5", split="train")

最新结果

以下是 2023-11-12T18:15:51.369317 运行的最新结果

python { "all": { "acc": 0.6159393027066592, "acc_stderr": 0.032593338844127864, "acc_norm": 0.6242559279403389, "acc_norm_stderr": 0.03329458303258477, "mc1": 0.3929008567931457, "mc1_stderr": 0.017097248285233065, "mc2": 0.5664808334981362, "mc2_stderr": 0.015491636686254535, "em": 0.004718959731543624, "em_stderr": 0.0007018360183131115, "f1": 0.09190750838926176, "f1_stderr": 0.0018302287340192876 }, "harness|arc:challenge|25": { "acc": 0.5938566552901023, "acc_stderr": 0.014351656690097858, "acc_norm": 0.628839590443686, "acc_norm_stderr": 0.014117971901142824 }, "harness|hellaswag|10": { "acc": 0.6448914558852819, "acc_stderr": 0.004775681871529862, "acc_norm": 0.8340967934674368, "acc_norm_stderr": 0.003712334763856884 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.28, "acc_stderr": 0.04512608598542128, "acc_norm": 0.28, "acc_norm_stderr": 0.04512608598542128 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.5851851851851851, "acc_stderr": 0.04256193767901408, "acc_norm": 0.5851851851851851, "acc_norm_stderr": 0.04256193767901408 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6907894736842105, "acc_stderr": 0.037610708698674805, "acc_norm": 0.6907894736842105, "acc_norm_stderr": 0.037610708698674805 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.61, "acc_stderr": 0.04902071300001975, "acc_norm": 0.61, "acc_norm_stderr": 0.04902071300001975 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6754716981132075, "acc_stderr": 0.028815615713432108, "acc_norm": 0.6754716981132075, "acc_norm_stderr": 0.028815615713432108 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7361111111111112, "acc_stderr": 0.03685651095897532, "acc_norm": 0.7361111111111112, "acc_norm_stderr": 0.03685651095897532 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.51, "acc_stderr": 0.05024183937956912, "acc_norm": 0.51, "acc_norm_stderr": 0.05024183937956912 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.53, "acc_stderr": 0.05016135580465919, "acc_norm": 0.53, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.37, "acc_stderr": 0.04852365870939099, "acc_norm": 0.37, "acc_norm_stderr": 0.04852365870939099 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.5549132947976878, "acc_stderr": 0.03789401760283648, "acc_norm": 0.5549132947976878, "acc_norm_stderr": 0.03789401760283648 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.38235294117647056, "acc_stderr": 0.04835503696107223, "acc_norm": 0.38235294117647056, "acc_norm_stderr": 0.04835503696107223 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.77, "acc_stderr": 0.04229525846816505, "acc_norm": 0.77, "acc_norm_stderr": 0.04229525846816505 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5319148936170213, "acc_stderr": 0.03261936918467381, "acc_norm": 0.5319148936170213, "acc_norm_stderr": 0.03261936918467381 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.42105263157894735, "acc_stderr": 0.046446020912223177, "acc_norm": 0.42105263157894735, "acc_norm_stderr": 0.046446020912223177 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5586206896551724, "acc_stderr": 0.04137931034482758, "acc_norm": 0.5586206896551724, "acc_norm_stderr": 0.04137931034482758 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.41534391534391535, "acc_stderr": 0.02537952491077839, "acc_norm": 0.41534391534391535, "acc_norm_stderr": 0.02537952491077839 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.4523809523809524, "acc_stderr": 0.044518079590553275, "acc_norm": 0.4523809523809524, "acc_norm_stderr": 0.044518079590553275 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.27, "acc_stderr": 0.0446196043338474, "acc_norm": 0.27, "acc_norm_stderr": 0.0446196043338474 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7483870967741936, "acc_stderr": 0.024685979286239963, "acc_norm": 0.7483870967741936, "acc_norm_stderr": 0.024685979286239963 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.4630541871921182, "acc_stderr": 0.035083705204426656, "acc_norm": 0.4630541871921182, "acc_norm_stderr": 0.035083705204426656 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.72, "acc_stderr": 0.04512608598542127, "acc_norm": 0.72, "acc_norm_stderr": 0.04512608598542127 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7575757575757576, "acc_stderr": 0.03346409881055953, "acc_norm": 0.7575757575757576, "acc_norm_stderr": 0.03346409881055953 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7575757575757576, "acc_stderr": 0.030532892233932022, "acc_norm": 0.7575757575757576, "acc_norm_stderr": 0.030532892233932022 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8549222797927462, "acc_stderr": 0.02541634309630645, "acc_norm": 0.8549222797927462, "acc_norm_stderr": 0.02541634309630645 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.5974358974358974, "acc_stderr": 0.02486499515976775, "acc_norm": 0.59

搜集汇总
数据集介绍
构建方式
该数据集是在Open LLM Leaderboard框架下,针对PulsarAI/SlimOpenOrca-Mistral-7B-v2模型进行自动化评估过程中生成的。数据集包含64个配置项,每个配置对应一个评估任务,例如ARC挑战、HellaSwag、GSM8K等。每次评估运行的结果被存储为独立的拆分,并以时间戳命名,而'train'拆分则始终指向最新一次运行的结果。此外,还有一个名为'results'的配置项,用于汇总所有运行的整体评估指标,支撑排行榜上聚合度量的计算与展示。
特点
该数据集的核心特点在于其结构化与时效性。它通过多配置设计,将每个评估任务的结果独立存储,便于研究者针对特定任务进行细致分析。每次运行的详细结果均以时间戳区分,确保了数据版本的可追溯性。同时,'train'拆分自动指向最新结果,简化了持续追踪模型性能演变的流程。所有任务的评估指标,包括准确率、标准差、F1分数等,均被完整记录,为模型能力的全面评估提供了坚实的数据基础。
使用方法
研究者可通过Hugging Face的datasets库便捷地加载该数据集。例如,使用`load_dataset`函数指定数据集名称、配置名称(如'harness_winogrande_5')及拆分(如'train'),即可获取对应任务的最新评估细节。若需访问历史运行记录,可改用时间戳命名的拆分。此外,'results'配置提供了所有任务的聚合结果,适合进行整体性能的快速概览与比较分析。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的浪潮中,如何系统性地评估模型在多样化任务上的表现,成为推动领域进步的关键课题。Open LLM Leaderboard由Hugging Face团队于2023年发起,旨在为开源LLM提供标准化、可复现的评估框架。该数据集记录了模型PulsarAI/SlimOpenOrca-Mistral-7B-v2在2023年11月12日的一次完整评估运行,涵盖了ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande、DROP和GSM8K等64个配置,分别对应常识推理、知识问答、数学求解等核心研究问题。通过公开细粒度的评测结果,该数据集不仅为模型开发者提供了性能基准,更促进了社区对LLM能力边界与局限性的深入理解,成为检验模型泛化能力的重要标尺。
当前挑战
该数据集所解决的领域挑战在于,LLM评测长期面临任务单一、标准不一与结果不可复现的困境。传统评估多依赖人工标注或封闭基准,难以全面反映模型在真实场景中的鲁棒性与多任务泛化能力。Open LLM Leaderboard通过整合多样化的任务集与统一的评测流水线,试图构建公平透明的竞技场,但仍面临若干挑战:其一,评测任务虽广却仍无法覆盖所有实际应用场景,如多轮对话与指令遵循;其二,模型在MMLU等知识密集型任务上的表现易受训练数据泄露影响,导致泛化能力被高估;其三,数据集的构建需持续更新任务集与版本,以应对模型能力的快速演进,而自动化评测流程中偶发的配置错误(如任务参数不一致)也可能引入偏差,影响评估的可靠性。
常用场景
经典使用场景
在大型语言模型(LLM)的评估与比较研究中,该数据集作为Open LLM Leaderboard的评测结果记录,被广泛用于标准化地衡量模型在多任务上的表现。其经典使用场景包括对模型在ARC挑战、HellaSwag、MMLU、TruthfulQA、Winogrande、DROP和GSM8K等基准测试中的性能进行细粒度分析,通过64个配置项分别对应不同任务,为研究者提供统一的评估框架,以量化模型在常识推理、知识理解、数学求解和文本生成等方面的能力。
解决学术问题
该数据集解决了LLM领域长期存在的评估标准不统一与结果可重复性不足的学术难题。它通过系统记录模型在多样化任务上的原始得分与统计误差,为研究者提供了透明、可复现的基准数据,从而支持对模型优劣的客观比较。其意义在于推动了LLM性能评估的规范化进程,使学术界能够更准确地识别模型在不同认知维度上的强项与短板,为后续模型优化与理论突破奠定了数据基础。
衍生相关工作
围绕该数据集,衍生了一系列重要的学术工作,包括基于其评测结果提出的模型改进方法(如针对GSM8K数学任务的推理链优化)以及跨模型性能分析研究。研究者利用该数据构建了模型能力雷达图,揭示了不同架构在MMLU知识子集上的分布差异。此外,该数据集成为后续LLM排行榜(如EleutherAI的评估框架)的参照标准,催生了更多关于评测噪声控制与任务难度校准的方法论探索,进一步丰富了模型评估的理论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务