遇见数据集

open-llm-leaderboard/details_mahiatlinux__MasherAI-v6.1-7B-checkpoint6

收藏
Hugging Face2024-04-03 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是在模型mahiatlinux/MasherAI-v6.1-7B-checkpoint6在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train"分割始终指向最新结果。此外,一个名为"results"的配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在模型mahiatlinux/MasherAI-v6.1-7B-checkpoint6在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train"分割始终指向最新结果。此外,一个名为"results"的配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在评估模型 mahiatlinux/MasherAI-v6.1-7B-checkpoint6 的过程中自动创建的,用于 Open LLM Leaderboard。

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集从 1 次运行中创建,每个运行在每个配置中作为一个特定的分割存在,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_mahiatlinux__MasherAI-v6.1-7B-checkpoint6", "harness_winogrande_5", split="train")

最新结果

以下是 2024-04-03T00:27:25.187300 运行的最新结果:

python { "all": { "acc": 0.6340235638092514, "acc_stderr": 0.03244618936783548, "acc_norm": 0.6341517986071581, "acc_norm_stderr": 0.03311799480334889, "mc1": 0.4283965728274174, "mc1_stderr": 0.017323088597314754, "mc2": 0.5929961374222686, "mc2_stderr": 0.015311632400170822 }, "harness|arc:challenge|25": { "acc": 0.6117747440273038, "acc_stderr": 0.014241614207414044, "acc_norm": 0.6305460750853242, "acc_norm_stderr": 0.01410457836649189 }, "harness|hellaswag|10": { "acc": 0.6409081856203943, "acc_stderr": 0.0047875373851530055, "acc_norm": 0.8340967934674368, "acc_norm_stderr": 0.0037123347638568847 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.32, "acc_stderr": 0.046882617226215034, "acc_norm": 0.32, "acc_norm_stderr": 0.046882617226215034 }, # 其他任务的结果... }

配置详情

  • config_name: harness_arc_challenge_25

    • split: 2024_04_03T00_27_25.187300
      • path: **/details_harness|arc:challenge|25_2024-04-03T00-27-25.187300.parquet
    • split: latest
      • path: **/details_harness|arc:challenge|25_2024-04-03T00-27-25.187300.parquet
  • config_name: harness_gsm8k_5

    • split: 2024_04_03T00_27_25.187300
      • path: **/details_harness|gsm8k|5_2024-04-03T00-27-25.187300.parquet
    • split: latest
      • path: **/details_harness|gsm8k|5_2024-04-03T00-27-25.187300.parquet
  • config_name: harness_hellaswag_10

    • split: 2024_04_03T00_27_25.187300
      • path: **/details_harness|hellaswag|10_2024-04-03T00-27-25.187300.parquet
    • split: latest
      • path: **/details_harness|hellaswag|10_2024-04-03T00-27-25.187300.parquet
  • config_name: harness_hendrycksTest_5

    • split: 2024_04_03T00_27_25.187300
      • path:
        • **/details_harness|hendrycksTest-abstract_algebra|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-anatomy|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-astronomy|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-business_ethics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-college_biology|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-college_chemistry|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-college_computer_science|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-college_mathematics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-college_medicine|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-college_physics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-computer_security|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-conceptual_physics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-econometrics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-electrical_engineering|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-elementary_mathematics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-formal_logic|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-global_facts|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_biology|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_chemistry|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_computer_science|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_european_history|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_geography|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_mathematics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_microeconomics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_physics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_psychology|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_statistics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_us_history|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-high_school_world_history|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-human_aging|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-human_sexuality|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-international_law|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-jurisprudence|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-logical_fallacies|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-machine_learning|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-management|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-marketing|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-medical_genetics|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-miscellaneous|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-moral_disputes|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-moral_scenarios|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-nutrition|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-philosophy|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-prehistory|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-professional_accounting|5_2024-04-03T00-27-25.187300.parquet
        • **/details_harness|hendrycksTest-professional_law|5_2024-04-03T00-27-25.187300.parquet
        • `**/details_harness
搜集汇总
数据集介绍
open-llm-leaderboard/details_mahiatlinux__MasherAI-v6.1-7B-checkpoint6 数据集图片
构建方式
在大型语言模型评估的广阔领域中,Open LLM Leaderboard 扮演着标准化评测平台的角色。本数据集正是为记录模型 mahiatlinux/MasherAI-v6.1-7B-checkpoint6 在该排行榜上的评估结果而自动生成。其构建方式基于一次完整的评估运行,涵盖了63个不同的评测任务配置,每个配置对应一项具体的基准测试。数据以时间戳为标识划分为独立的分片,其中“train”分片始终指向最新一次运行的结果,而额外的“results”配置则用于汇总并呈现所有任务的聚合指标,从而支撑排行榜上综合得分的计算与展示。
特点
本数据集最显著的特点在于其结构化的组织方式与动态更新的机制。它并非静态快照,而是通过分片(split)概念将不同时间点的评估结果加以区分,使得研究人员能够追溯特定历史运行中的详细表现。每个配置下的数据以高效的Parquet格式存储,保证了大规模数据的读取性能。此外,数据集内嵌了从ARC、HellaSwag、MMLU等经典基准到TruthfulQA、Winogrande、GSM8K等多样化任务的详尽指标,覆盖了常识推理、知识理解、数学求解及对抗性测试等多个维度,为模型能力的全面剖析提供了丰富素材。
使用方法
借助HuggingFace的datasets库,用户可以便捷地加载本数据集以进行深入分析。具体而言,通过load_dataset函数指定数据集名称及目标配置,例如选取“harness_winogrande_5”配置,并设定split参数为“train”,即可获取该任务的最新评估细节。对于希望研究特定历史运行结果的场景,则可将split参数替换为对应的时间戳分片名称。数据加载后,用户能够直接访问各任务中的准确率(acc)、标准化准确率(acc_norm)及其标准误差等核心指标,便于进行模型性能对比或复现排行榜上的评分结果。
背景与挑战
背景概述
随着大语言模型(LLM)性能的飞速提升,如何系统、公正地评估其多维度能力成为学界与工业界共同关注的核心议题。Open LLM Leaderboard由Hugging Face团队于2023年发起,旨在为开源社区提供一个标准化、透明化的模型评测平台。该数据集记录了模型mahiatlinux/MasherAI-v6.1-7B-checkpoint6在2024年4月3日的一次完整评估结果,涵盖ARC-Challenge、HellaSwag、MMLU(57个学科子集)、TruthfulQA、Winogrande和GSM8K等多项基准任务。通过63个独立配置存储各任务细节,该数据集不仅反映了模型在常识推理、数学求解、事实一致性及多学科知识上的综合表现,更推动了开源LLM评测范式的可复现性与可比性,对社区理解模型能力边界、引导后续优化方向具有重要参考价值。
当前挑战
该数据集所承载的评测体系面临多重挑战。首先,在领域问题层面,现有基准如MMLU虽覆盖57个学科,但部分任务(如高中物理、大学数学)模型准确率不足40%,揭示出LLM在强逻辑推理与专业领域知识上的系统性短板;TruthfulQA中mc1仅42.8%的表现更凸显了模型生成事实性内容时的可靠性危机。其次,构建过程中,评测结果高度依赖提示词模板、少样本设置及随机种子等超参数,不同运行间可能存在偏差;此外,数据集仅包含单次运行结果,缺乏多次重复实验以量化评估的统计稳定性,且对于模型在安全、偏见等伦理维度上的表现尚无覆盖,制约了评测维度的全面性。
常用场景
经典使用场景
该数据集作为Open LLM Leaderboard自动生成的评估记录,核心用途在于系统性地衡量MasherAI-v6.1-7B-checkpoint6模型在多项自然语言理解与推理任务上的表现。涵盖ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande及GSM8K等经典基准,每条配置对应特定任务的细粒度结果,包括准确率与标准误差。研究者可通过加载特定任务配置的分片数据,复现模型在常识推理、知识问答、数学求解与事实一致性等维度的性能,从而进行跨模型比较或追踪训练过程中的能力演变。
衍生相关工作
该数据集衍生了一系列关于大模型评估标准化与动态追踪的经典工作。其自动生成的结构化评估记录范式被后续模型排行榜广泛采纳,催生了如Open LLM Leaderboard v2等迭代版本,推动社区形成统一的评测协议。此外,基于该数据集的细粒度结果,研究者开展了多项实证分析,例如探究模型规模与特定学科表现的非线性关系,或利用其时间戳分片追踪模型在持续训练中的能力演化曲线,为模型迭代与资源分配提供了数据驱动的指导框架。
数据集最近研究
最新研究方向
在大型语言模型评估领域,Open LLM Leaderboard 已成为衡量模型综合性能的权威基准平台。针对 MasherAI-v6.1-7B-checkpoint6 这一 7B 参数规模的开源模型,该数据集通过 63 项涵盖常识推理、数学求解、多学科知识及伦理判断等维度的评测任务,揭示了当前中等规模模型的性能边界。前沿研究热点聚焦于模型在 ARC 挑战赛和 HellaSwag 等复杂推理任务中的表现,以及其在 MMLU 基准下横跨 57 个学科的知识广度。值得注意的是,该模型在 TruthfulQA 上的 mc2 得分达 0.593,反映出在事实一致性方面的显著提升,而 GSM8K 数学推理准确率突破 66% 则标志着开源模型在符号推理能力上的重要进展。这一评估体系不仅为模型迭代提供了量化标尺,更推动了社区对 7B 参数级模型能力极限的系统性探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务