遇见数据集

open-llm-leaderboard/details_CobraMamba__mamba-gpt-3b-v2

收藏
Hugging Face2023-08-27 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在评估模型CobraMamba/mamba-gpt-3b-v2时自动创建的。数据集由61个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示在Open LLM Leaderboard上的聚合指标。

This dataset was automatically created during the evaluation of the model CobraMamba/mamba-gpt-3b-v2. The dataset consists of 61 configurations, each corresponding to one evaluation task. The dataset was generated from a single run, where each configuration has dedicated splits, and the names of these splits are based on the timestamp of the run. The "train" split always points to the most recent results. Additionally, the "results" configuration stores the aggregated results across all runs, and is used to compute and display the aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集简介

该数据集是在模型 CobraMamba/mamba-gpt-3b-v2Open LLM Leaderboard 上的评估运行期间自动创建的。

数据集结构

  • 配置数量:61个配置,每个配置对应一个评估任务。
  • 创建来源:从1次运行中创建,每个运行在每个配置中作为一个特定的分割存在,分割名称使用运行的时间戳。
  • 最新结果:"train" 分割总是指向最新的结果。
  • 聚合结果:一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示在 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_CobraMamba__mamba-gpt-3b-v2", "harness_truthfulqa_mc_0", split="train")

最新结果

以下是 2023-07-27T10:38:04.478796 运行的最新结果:

python { "all": { "acc": 0.2773460846321751, "acc_stderr": 0.03238661474119926, "acc_norm": 0.2811003145526316, "acc_norm_stderr": 0.03238192601606109, "mc1": 0.23623011015911874, "mc1_stderr": 0.014869755015871112, "mc2": 0.36736867775864135, "mc2_stderr": 0.013883449396602417 }, "harness|arc:challenge|25": { "acc": 0.386518771331058, "acc_stderr": 0.01423008476191048, "acc_norm": 0.42150170648464164, "acc_norm_stderr": 0.014430197069326023 }, "harness|hellaswag|10": { "acc": 0.5284803823939455, "acc_stderr": 0.004981680090303706, "acc_norm": 0.7149970125473013, "acc_norm_stderr": 0.0045049329997363914 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.22, "acc_stderr": 0.04163331998932269, "acc_norm": 0.22, "acc_norm_stderr": 0.04163331998932269 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.32592592592592595, "acc_stderr": 0.040491220417025055, "acc_norm": 0.32592592592592595, "acc_norm_stderr": 0.040491220417025055 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.23684210526315788, "acc_stderr": 0.03459777606810536, "acc_norm": 0.23684210526315788, "acc_norm_stderr": 0.03459777606810536 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.4, "acc_stderr": 0.049236596391733084, "acc_norm": 0.4, "acc_norm_stderr": 0.049236596391733084 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.27169811320754716, "acc_stderr": 0.02737770662467071, "acc_norm": 0.27169811320754716, "acc_norm_stderr": 0.02737770662467071 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.2361111111111111, "acc_stderr": 0.03551446610810826, "acc_norm": 0.2361111111111111, "acc_norm_stderr": 0.03551446610810826 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.24, "acc_stderr": 0.04292346959909284, "acc_norm": 0.24, "acc_norm_stderr": 0.04292346959909284 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.3, "acc_stderr": 0.046056618647183814, "acc_norm": 0.3, "acc_norm_stderr": 0.046056618647183814 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.32, "acc_stderr": 0.046882617226215034, "acc_norm": 0.32, "acc_norm_stderr": 0.046882617226215034 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.1791907514450867, "acc_stderr": 0.029242513059063294, "acc_norm": 0.1791907514450867, "acc_norm_stderr": 0.029242513059063294 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.22549019607843138, "acc_stderr": 0.04158307533083286, "acc_norm": 0.22549019607843138, "acc_norm_stderr": 0.04158307533083286 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.33, "acc_stderr": 0.04725815626252605, "acc_norm": 0.33, "acc_norm_stderr": 0.04725815626252605 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.3404255319148936, "acc_stderr": 0.030976692998534443, "acc_norm": 0.3404255319148936, "acc_norm_stderr": 0.030976692998534443 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.22807017543859648, "acc_stderr": 0.03947152782669416, "acc_norm": 0.22807017543859648, "acc_norm_stderr": 0.03947152782669416 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.19310344827586207, "acc_stderr": 0.03289445522127401, "acc_norm": 0.19310344827586207, "acc_norm_stderr": 0.03289445522127401 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.25396825396825395, "acc_stderr": 0.022418042891113946, "acc_norm": 0.25396825396825395, "acc_norm_stderr": 0.022418042891113946 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.24603174603174602, "acc_stderr": 0.038522733649243156, "acc_norm": 0.24603174603174602, "acc_norm_stderr": 0.038522733649243156 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.31, "acc_stderr": 0.04648231987117316, "acc_norm": 0.31, "acc_norm_stderr": 0.04648231987117316 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.23870967741935484, "acc_stderr": 0.02425107126220884, "acc_norm": 0.23870967741935484, "acc_norm_stderr": 0.02425107126220884 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.2512315270935961, "acc_stderr": 0.030516530732694433, "acc_norm": 0.2512315270935961, "acc_norm_stderr": 0.030516530732694433 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.28, "acc_stderr": 0.04512608598542128, "acc_norm": 0.28, "acc_norm_stderr": 0.04512608598542128 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.2606060606060606, "acc_stderr": 0.034277431758165236, "acc_norm": 0.2606060606060606, "acc_norm_stderr": 0.034277431758165236 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.2222222222222222, "acc_stderr": 0.02962022787479047, "acc_norm": 0.2222222222222222, "acc_norm_stderr": 0.02962022787479047 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.20725388601036268, "acc_stderr": 0.02925282329180363, "acc_norm": 0.20725388601036268, "acc_norm_stderr": 0.02925282329180363 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.2358974358974359, "acc_stderr": 0.021525965407408726, "acc_norm": 0.2358974358974359, "acc_norm_stderr": 0.021525965407408726 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.24074074074074073, "acc_stderr": 0.026067159

搜集汇总
数据集介绍
open-llm-leaderboard/details_CobraMamba__mamba-gpt-3b-v2 数据集图片
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 提供了标准化的评测框架。该数据集是围绕模型 CobraMamba/mamba-gpt-3b-v2 在 Open LLM Leaderboard 上的评估过程自动生成的。其构建方式基于一次完整的评测运行,涵盖了 61 个不同的任务配置,每个配置对应一个特定的评估任务。数据集中,每次运行的结果被存储为独立的拆分(split),并以运行的时间戳命名,而名为“train”的拆分则始终指向最新的评测结果。此外,一个名为“results”的额外配置用于汇总所有运行的整体指标,为计算和展示聚合度量提供支撑。
特点
该数据集的核心特色在于其结构化的多任务评测体系。它囊括了从常识推理(如 ARC-Challenge、HellaSwag)到多学科知识(涵盖 MMLU 中的 57 个学科,包括医学、法律、物理等)以及事实性问答(TruthfulQA)等多样化的任务类型。每个任务配置下均存储了详细的模型输出与评估指标,如准确率(acc)及其标准误差,确保了评测的粒度与可复现性。数据集的设计支持多版本运行结果的追溯,通过时间戳拆分保留了历史评测轨迹,而“latest”拆分则方便用户快速获取最新进展。
使用方法
研究人员可通过 Hugging Face 的 datasets 库便捷地加载该数据集。具体而言,使用 load_dataset 函数,指定数据集标识符“open-llm-leaderboard/details_CobraMamba__mamba-gpt-3b-v2”以及目标任务配置名称(如“harness_truthfulqa_mc_0”),并设置 split 参数为“train”即可获取最新结果。若需访问特定历史运行的数据,则可将 split 参数设为对应的时间戳字符串。加载后的数据以 Parquet 格式存储,便于高效处理与分析,从而支持对模型性能的细粒度比较与深入探究。
背景与挑战
背景概述
在大规模语言模型迅猛发展的时代,如何公正、全面地评估模型在多样化任务上的表现,成为推动该领域进步的关键议题。由HuggingFace团队于2023年创建并维护的Open LLM Leaderboard,正是为了应对这一需求而诞生的权威评估平台。该数据集记录了CobraMamba团队提出的mamba-gpt-3b-v2模型在排行榜上的详细评估结果,涵盖ARC-Challenge、HellaSwag、TruthfulQA以及涵盖数十个学科领域的MMLU(HendrycksTest)等共计61项配置任务。通过自动化的评估流水线,该数据集不仅为研究者提供了模型在常识推理、知识问答和真实性判断等方面的量化性能指标,更构建了一个可复现、可比较的标准化基准,对推动轻量级语言模型(如3B参数级别)的性能优化与社区交流产生了深远影响。
当前挑战
该数据集所聚焦的核心挑战之一在于如何精准衡量小规模语言模型在复杂认知任务上的真实能力。mamba-gpt-3b-v2模型在MMLU的众多子领域(如大学医学、专业医学)中准确率低于20%,而在HellaSwag上归一化准确率却达到71.5%,这种显著的性能差异揭示了模型在不同知识类型与推理深度上的不均衡性,成为评估体系必须正视的难题。此外,数据集的构建过程本身亦面临严峻挑战:自动评估流水线需要处理来自61个不同配置的异构任务,每个任务拥有独立的评估指标(如acc、acc_norm、mc1、mc2)及统计误差,如何确保数据采集的完整性、时间戳对齐的准确性以及最新结果与历史运行结果之间的无缝衔接,均对数据工程提出了极高要求。
常用场景
经典使用场景
该数据集专为大型语言模型在Open LLM Leaderboard上的标准化评估而设计,其经典应用场景在于系统性地衡量模型在多维度自然语言理解任务中的表现。通过涵盖ARC-Challenge、HellaSwag、TruthfulQA以及涵盖57个学科的MMLU基准测试,研究者能够利用该数据集对模型进行零样本或少样本的推理能力测试,从而全面剖析模型在常识推理、知识问答和事实一致性等方面的性能边界。
解决学术问题
该数据集有效解决了大语言模型性能评估缺乏统一基准与细粒度分析工具的学术困境。传统评估往往依赖单一指标或有限任务,难以揭示模型在不同知识领域和推理类型上的优劣。通过提供跨学科、多配置的标准化评估框架,该数据集使研究者能够精准定位模型在特定领域(如医学、法律、物理学)的认知短板,为理解模型能力的内在结构、探索知识迁移机制以及改进训练策略提供了坚实的数据支撑与可复现的评估范式。
衍生相关工作
该数据集衍生了一系列具有深远影响的研究工作。其一,基于MMLU子任务的细粒度分析催生了针对模型知识边界和泛化能力的深入探讨,促进了如Chain-of-Thought提示、知识增强等方法的提出。其二,TruthfulQA评测结果引发了关于模型事实性与幻觉问题的广泛研究,催生了多种去偏和诚实生成技术。其三,该数据集的标准化评估流程被广泛借鉴,推动了后续多个领域专用评测基准的构建,形成了大语言模型评估体系的良性生态发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务