遇见数据集

open-llm-leaderboard-old/details_Azure99__blossom-v5-mistral-7b

收藏
Hugging Face2024-03-14 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型Azure99/blossom-v5-mistral-7b进行评估时自动创建的。它由63个配置组成,每个配置对应一个被评估的任务。数据集包含1次运行的结果,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。可以使用`datasets`库中的`load_dataset`函数加载数据集,指定数据集名称和所需的配置及分割。

该数据集是在Open LLM Leaderboard上对模型Azure99/blossom-v5-mistral-7b进行评估时自动创建的。它由63个配置组成,每个配置对应一个被评估的任务。数据集包含1次运行的结果,每次运行在每个配置中表示为特定的分割。train分割始终指向最新的结果。一个名为results的额外配置存储了所有运行的聚合结果,这些结果用于计算和显示Open LLM Leaderboard上的聚合指标。可以使用`datasets`库中的`load_dataset`函数加载数据集,指定数据集名称和所需的配置及分割。

原始信息汇总

数据集概述

数据集摘要

该数据集是在对模型 Azure99/blossom-v5-mistral-7b 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集由 1 次运行创建,每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 额外的 "results" 配置存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Azure99__blossom-v5-mistral-7b", "harness_winogrande_5", split="train")

最新结果

以下是 2024-03-14T15:50:14.881828 运行的最新结果

python { "all": { "acc": 0.6219106953731333, "acc_stderr": 0.03255725468524983, "acc_norm": 0.6282316752090723, "acc_norm_stderr": 0.0332240390263187, "mc1": 0.35006119951040393, "mc1_stderr": 0.01669794942015103, "mc2": 0.5183469931839926, "mc2_stderr": 0.015126966845957131 }, "harness|arc:challenge|25": { "acc": 0.5938566552901023, "acc_stderr": 0.01435165669009786, "acc_norm": 0.6262798634812287, "acc_norm_stderr": 0.014137708601759086 }, "harness|hellaswag|10": { "acc": 0.6444931288587931, "acc_stderr": 0.004776883632722614, "acc_norm": 0.8425612427803226, "acc_norm_stderr": 0.003634695906909659 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.34, "acc_stderr": 0.047609522856952365, "acc_norm": 0.34, "acc_norm_stderr": 0.047609522856952365 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.5851851851851851, "acc_stderr": 0.04256193767901408, "acc_norm": 0.5851851851851851, "acc_norm_stderr": 0.04256193767901408 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6776315789473685, "acc_stderr": 0.03803510248351585, "acc_norm": 0.6776315789473685, "acc_norm_stderr": 0.03803510248351585 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.54, "acc_stderr": 0.05009082659620333, "acc_norm": 0.54, "acc_norm_stderr": 0.05009082659620333 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6943396226415094, "acc_stderr": 0.028353298073322666, "acc_norm": 0.6943396226415094, "acc_norm_stderr": 0.028353298073322666 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7291666666666666, "acc_stderr": 0.03716177437566017, "acc_norm": 0.7291666666666666, "acc_norm_stderr": 0.03716177437566017 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.44, "acc_stderr": 0.04988876515698589, "acc_norm": 0.44, "acc_norm_stderr": 0.04988876515698589 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.53, "acc_stderr": 0.05016135580465919, "acc_norm": 0.53, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.34, "acc_stderr": 0.04760952285695236, "acc_norm": 0.34, "acc_norm_stderr": 0.04760952285695236 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.630057803468208, "acc_stderr": 0.0368122963339432, "acc_norm": 0.630057803468208, "acc_norm_stderr": 0.0368122963339432 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.3235294117647059, "acc_stderr": 0.046550104113196156, "acc_norm": 0.3235294117647059, "acc_norm_stderr": 0.046550104113196156 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.78, "acc_stderr": 0.04163331998932261, "acc_norm": 0.78, "acc_norm_stderr": 0.04163331998932261 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.5531914893617021, "acc_stderr": 0.032500536843658404, "acc_norm": 0.5531914893617021, "acc_norm_stderr": 0.032500536843658404 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.5087719298245614, "acc_stderr": 0.04702880432049615, "acc_norm": 0.5087719298245614, "acc_norm_stderr": 0.04702880432049615 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5448275862068965, "acc_stderr": 0.04149886942192117, "acc_norm": 0.5448275862068965, "acc_norm_stderr": 0.04149886942192117 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.37566137566137564, "acc_stderr": 0.024942368931159788, "acc_norm": 0.37566137566137564, "acc_norm_stderr": 0.024942368931159788 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.42063492063492064, "acc_stderr": 0.04415438226743744, "acc_norm": 0.42063492063492064, "acc_norm_stderr": 0.04415438226743744 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.33, "acc_stderr": 0.047258156262526045, "acc_norm": 0.33, "acc_norm_stderr": 0.047258156262526045 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7451612903225806, "acc_stderr": 0.02479011845933221, "acc_norm": 0.7451612903225806, "acc_norm_stderr": 0.02479011845933221 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.46798029556650245, "acc_stderr": 0.035107665979592154, "acc_norm": 0.46798029556650245, "acc_norm_stderr": 0.035107665979592154 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.7, "acc_stderr": 0.046056618647183814, "acc_norm": 0.7, "acc_norm_stderr": 0.046056618647183814 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7636363636363637, "acc_stderr": 0.03317505930009181, "acc_norm": 0.7636363636363637, "acc_norm_stderr": 0.03317505930009181 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.797979797979798, "acc_stderr": 0.028606204289229872, "acc_norm": 0.797979797979798, "acc_norm_stderr": 0.028606204289229872 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.844559585492228, "acc_stderr": 0.02614848346915331, "acc_norm": 0.844559585492228, "acc_norm_stderr": 0.02614848346915331 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6538461538461539, "acc_stderr": 0.02412112541694119, "acc_norm": 0.6538461538461539, "acc_norm_stderr": 0.02412112541694119 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.3111111111111111, "acc_stderr": 0.028226446749683515, "acc_norm": 0.3111111111111111, "acc_norm_stderr":

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_Azure99__blossom-v5-mistral-7b 数据集图片
构建方式
该数据集源于对Azure99/blossom-v5-mistral-7b模型在Open LLM Leaderboard上的自动化评估流程。数据集由63个配置构成,每个配置对应一项评估任务,所有数据均来自单次运行。每次运行的结果以时间戳命名的分割(split)形式存储于各配置中,而'train'分割则始终指向最新一次运行的成果。此外,一个名为'results'的额外配置汇总了所有运行的综合指标,用于在排行榜上计算与展示聚合度量。
特点
数据集的核心特点在于其结构化的多任务评估体系,覆盖了从常识推理(如ARC、HellaSwag)到数学问题求解(GSM8K)、知识问答(MMLU涵盖57个学科)以及对抗性推理(TruthfulQA、Winogrande)等广泛领域。每个任务配置均包含详细的性能指标,如准确率(acc)及其标准误(acc_stderr),为模型能力的细粒度分析提供了坚实的数据基础。数据集还支持追踪不同时间点的运行结果,便于历史对比与模型迭代评估。
使用方法
使用该数据集时,可通过HuggingFace的datasets库便捷加载。例如,加载'harness_winogrande_5'配置中的最新结果,只需指定配置名和分割为'train'即可:from datasets import load_dataset; data = load_dataset('open-llm-leaderboard/details_Azure99__blossom-v5-mistral-7b', 'harness_winogrande_5', split='train')。用户亦可根据时间戳分割加载特定运行的历史数据,从而进行深入的纵向分析。
背景与挑战
背景概述
随着大语言模型(LLM)在自然语言处理领域取得突破性进展,如何系统性地评估其综合能力成为学界与工业界共同关注的焦点。在此背景下,Hugging Face社区于2023年发起了Open LLM Leaderboard项目,旨在通过标准化评测框架对开源模型进行多维度性能对比。该数据集源自对Azure99团队开发的blossom-v5-mistral-7b模型的自动化评估,该模型基于Mistral-7B架构,于2024年3月14日完成评测。核心研究问题在于揭示该模型在常识推理、知识理解、数学求解及逻辑判断等57项细分任务上的表现,尤其关注其在ARC挑战集、HellaSwag、GSM8K及MMLU等权威基准中的能力边界。该数据集通过公开可复现的评测流程,为开源社区提供了衡量模型进展的量化标尺,对推动LLM性能透明化与可比性具有重要实践价值。
当前挑战
该数据集所反映的领域挑战集中于大语言模型在复杂推理与多领域知识融合上的局限性。具体而言,模型在GSM8K数学推理任务上仅取得31.84%的准确率,暴露出符号推理与多步计算能力的显著不足;在MMLU的抽象代数、大学数学等子领域得分仅34%,揭示了专业领域知识迁移的瓶颈。构建过程中亦面临多重技术挑战:需处理63个独立评测配置的标准化对齐,确保不同任务间评估协议的一致性;面对HendrycksTest中57个学科子集的异构数据格式,需设计统一的解析与打分逻辑;同时需解决评测结果的可复现性问题,通过时间戳分割机制记录每次运行的完整元数据,但多轮评测间的任务覆盖差异仍对结果横向比较构成干扰。
常用场景
经典使用场景
该数据集主要用于大规模语言模型(LLM)的标准化性能评估,是Open LLM Leaderboard平台自动生成的测评记录。其经典使用场景涵盖了对模型在多项基准任务上的细粒度表现进行量化分析,包括ARC挑战集、HellaSwag常识推理、GSM8K数学问题求解、TruthfulQA真实性检测以及WinoGrande代词消歧等。研究者可通过加载不同配置下的子集,复现模型在特定任务上的准确率与标准误差,从而横向比较不同模型的综合能力。
实际应用
在实际应用中,该数据集为模型选型与部署提供了关键参考。开发者可依据blossom-v5-mistral-7b在各项任务上的表现,判断其是否适用于智能问答、教育辅导、内容生成等场景。例如,其在HellaSwag上84.26%的归一化准确率表明其具备优秀的常识推理能力,适合构建对话助手;而在GSM8K上31.84%的数学准确率则提示其在算术推理任务中需谨慎使用。这些细粒度指标直接指导了模型在产业落地中的适配决策。
衍生相关工作
该数据集衍生了一系列重要工作,包括基于其评估结果进行的模型优化与对比研究。例如,研究者利用该数据集的细分任务成绩,针对blossom-v5-mistral-7b在数学推理和知识密集型任务上的不足,开发了专门的微调策略或知识增强方法。同时,该数据集作为Open LLM Leaderboard的组成部分,催生了多篇关于LLM评估方法论的研究,探讨了不同采样策略、任务难度对评估稳定性的影响,并推动了更公平、更全面的模型排行榜构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务