遇见数据集

open-llm-leaderboard/details_zarakiquemparte__zarafusionex-1.2-l2-7b

收藏
Hugging Face2023-10-23 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在评估模型zarakiquemparte/zarafusionex-1.2-l2-7b时自动生成的,主要用于Open LLM Leaderboard的评估任务。数据集包含64个配置,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果存储在不同的split中,split以时间戳命名。此外,数据集还包含一个名为"results"的配置,用于存储所有运行的聚合结果,并在Open LLM Leaderboard上显示聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集来源

该数据集是在评估模型 zarakiquemparte/zarafusionex-1.2-l2-7bOpen LLM Leaderboard 上的自动创建的。

数据集结构

数据集包含 64 个配置,每个配置对应一个评估任务。数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

额外配置

一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

以下是加载特定运行详细信息的示例代码: python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_zarakiquemparte__zarafusionex-1.2-l2-7b", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-23T14:21:00.502633 运行 的最新结果: python { "all": { "em": 0.13590604026845637, "em_stderr": 0.0035094536867653074, "f1": 0.22546770134228172, "f1_stderr": 0.003699492065854956, "acc": 0.4165529242035385, "acc_stderr": 0.009960183652638432 }, "harness|drop|3": { "em": 0.13590604026845637, "em_stderr": 0.0035094536867653074, "f1": 0.22546770134228172, "f1_stderr": 0.003699492065854956 }, "harness|gsm8k|5": { "acc": 0.08567096285064443, "acc_stderr": 0.007709218855882758 }, "harness|winogrande|5": { "acc": 0.7474348855564326, "acc_stderr": 0.012211148449394107 } }

配置详情

以下是数据集的部分配置详情:

  • config_name: harness_arc_challenge_25

    • data_files:
      • split: 2023_09_22T00_24_36.284847
        • path: **/details_harness|arc:challenge|25_2023-09-22T00-24-36.284847.parquet
      • split: latest
        • path: **/details_harness|arc:challenge|25_2023-09-22T00-24-36.284847.parquet
  • config_name: harness_drop_3

    • data_files:
      • split: 2023_10_23T14_21_00.502633
        • path: **/details_harness|drop|3_2023-10-23T14-21-00.502633.parquet
      • split: latest
        • path: **/details_harness|drop|3_2023-10-23T14-21-00.502633.parquet
  • config_name: harness_gsm8k_5

    • data_files:
      • split: 2023_10_23T14_21_00.502633
        • path: **/details_harness|gsm8k|5_2023-10-23T14-21-00.502633.parquet
      • split: latest
        • path: **/details_harness|gsm8k|5_2023-10-23T14-21-00.502633.parquet
  • config_name: harness_hellaswag_10

    • data_files:
      • split: 2023_09_22T00_24_36.284847
        • path: **/details_harness|hellaswag|10_2023-09-22T00-24-36.284847.parquet
      • split: latest
        • path: **/details_harness|hellaswag|10_2023-09-22T00-24-36.284847.parquet
  • config_name: harness_hendrycksTest_5

    • data_files:
      • split: 2023_09_22T00_24_36.284847
        • path:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_biology|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_european_history|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_geography|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_physics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_psychology|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_statistics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_us_history|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-high_school_world_history|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-human_aging|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-human_sexuality|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-international_law|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-jurisprudence|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-logical_fallacies|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-machine_learning|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-management|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-marketing|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-medical_genetics|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-miscellaneous|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-moral_disputes|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-moral_scenarios|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-nutrition|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-philosophy|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-prehistory|5_2023-09-22T00-24-36.284847.parquet
          • **/details_harness|hendrycksTest-
搜集汇总
数据集介绍
open-llm-leaderboard/details_zarakiquemparte__zarafusionex-1.2-l2-7b 数据集图片
构建方式
该数据集是在Open LLM Leaderboard对模型zarakiquemparte/zarafusionex-1.2-l2-7b进行评估的过程中自动生成的。整个数据集由64个配置组成,每个配置对应一个被评估的任务。数据源自两次独立的运行记录,每次运行的结果作为一个特定的分割(split)存储在各配置中,分割名称以运行时间戳命名。此外,一个名为“results”的额外配置用于存储所有运行的聚合结果,并服务于排行榜上汇总指标的展示与计算。
特点
本数据集的结构设计精妙而灵活,每个配置均对应一项具体的评估任务,涵盖从常识推理到数学解题等多样化能力测试。数据集中“train”分割始终指向最新一次运行的结果,便于用户获取最新评测数据。每次运行的结果以时间戳为标识独立存储,支持对模型性能的历史演变进行纵向比较。整体架构既保证了数据的可追溯性,也提供了便捷的版本管理,充分体现了在大型语言模型评测场景下的实用性与扩展性。
使用方法
用户可通过HuggingFace的datasets库便捷地加载该数据集。以加载winogrande任务的评估结果为例,只需调用load_dataset函数,指定数据集名称、配置名(如"harness_winogrande_5")及分割(如"train")即可获取最新数据。若需访问历史运行结果,则使用对应的时间戳分割名。这种设计使得研究人员能够灵活地提取特定任务、特定版本的模型表现数据,进行深入的性能分析与对比研究。
背景与挑战
背景概述
在大规模语言模型迅猛发展的当下,如何系统性地评估其综合能力已成为学术界与工业界的核心议题。由Hugging Face团队于2023年创建的Open LLM Leaderboard,旨在为开源语言模型提供标准化、可复现的性能评测框架。该数据集记录了zarakiquemparte/zarafusionex-1.2-l2-7b模型在多项基准任务上的评估结果,涵盖ARC挑战、DROP、GSM8K、HellaSwag、Winogrande及涵盖多学科的MMLU(HendrycksTest)等。研究团队通过自动化流水线生成64个配置项,每个配置对应一项评估任务,并保留多次运行的时间戳分片,确保结果的透明性与可追溯性。这一数据集不仅为模型开发者提供了细粒度的性能剖析,更推动了开源社区在模型比较与复现方面的规范化进程,对语言模型评估领域产生了深远影响。
当前挑战
该数据集所应对的核心挑战在于构建一个兼具广度与深度的语言模型评估体系。领域层面,现有基准如GSM8K(数学推理)和DROP(阅读理解)虽能测试模型特定能力,但难以全面反映模型在复杂现实场景中的泛化表现,且不同任务间的评分标准与难度差异导致横向比较困难。构建过程中,团队面临多重技术难题:需为每个模型自动化运行数十个评估任务,并处理因任务配置或模型版本更新引发的数据版本管理问题;同时,确保评估结果的统计显著性(如记录标准误差)与跨运行的可重复性,对计算资源与工程实现提出了严苛要求。此外,如何平衡评测任务的覆盖度与计算成本,避免因任务冗余或缺失而影响评估的公正性,亦是持续存在的挑战。
常用场景
经典使用场景
该数据集作为Open LLM Leaderboard的评测产物,主要服务于大语言模型在标准化基准上的性能追踪与比较。其经典使用场景在于,研究者可通过加载特定任务配置(如harness_winogrande_5或harness_gsm8k_5),获取zarakiquemparte/zarafusionex-1.2-l2-7b模型在常识推理、数学求解、阅读理解等维度的细粒度评估结果。数据集以parquet格式存储了多次运行的任务级指标(如准确率、F1分数),支持通过时间戳拆分对比模型迭代前后的表现差异,为模型优化提供量化依据。
解决学术问题
此数据集解决了大语言模型评估中结果碎片化与不可复现的学术痛点。传统上,模型评测常因评测脚本差异或随机种子波动导致结论难以对齐,而该数据集通过统一评测框架(EleutherAI Harness)记录了完整运行日志,使研究者能精确复现每次评测的原始输出与统计误差。它推动了模型能力横向对比的标准化进程,尤其在分析模型在MMLU、HellaSwag等复杂任务上的泛化瓶颈时,提供了可靠的数据基础,助力学界揭示不同架构或训练策略的优劣本质。
衍生相关工作
该数据集衍生了一系列关于模型评测方法论与性能归因的经典研究。基于其多任务、多轮次的评测数据,研究人员提出了评测结果的可信度分析框架,如利用标准误差评估模型在特定任务上的稳定性。此外,工作如“模型能力谱系图”通过聚类该数据集中的任务级指标,揭示了不同模型在知识型任务与推理型任务上的能力分化模式。这些衍生工作不仅深化了对zarafusionex-1.2-l2-7b模型特性的理解,更推动了Open LLM Leaderboard生态中评测数据二次利用的规范化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务