遇见数据集

open-llm-leaderboard/details_aisquared__chopt-2_7b

收藏
Hugging Face2023-10-13 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在模型 aisquared/chopt-2_7b 在 Open LLM Leaderboard 上进行评估时自动生成的。数据集包含 64 个配置,每个配置对应一个被评估的任务。数据集由 2 次运行生成,每次运行在每个配置中表示为特定的分割,分割名称由运行的时间戳命名。train 分割始终指向最新的结果。此外,results 配置存储了所有运行的聚合结果,用于在 Open LLM Leaderboard 上计算和显示聚合指标。README 还提供了如何使用 Python 中的 datasets 库加载数据集的示例,并包含了特定运行的最新结果。

This dataset was automatically generated when the model aisquared/chopt-2_7b was evaluated on the Open LLM Leaderboard. It contains 64 configurations, each corresponding to one evaluated task. The dataset is derived from two runs, where each run is represented as a dedicated split under each configuration, with split names named after the run's timestamp. The 'train' split always points to the most recent results. Furthermore, the 'results' configuration stores aggregated results across all runs, which are used to compute and display aggregate metrics on the Open LLM Leaderboard. The README also provides examples of loading the dataset using the `datasets` library in Python, and includes the latest results from specific runs.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集来源

数据集结构

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示在 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_aisquared__chopt-2_7b", "harness_winogrande_5", split="train")

最新结果

  • 这些是最新的结果,来自 2023-10-13T00:33:45.271884 的运行: python { "all": { "em": 0.001363255033557047, "em_stderr": 0.0003778609196461222, "f1": 0.04857906879194641, "f1_stderr": 0.0012385170365466402, "acc": 0.2888713496448303, "acc_stderr": 0.006940791015329276 }, "harness|drop|3": { "em": 0.001363255033557047, "em_stderr": 0.0003778609196461222, "f1": 0.04857906879194641, "f1_stderr": 0.0012385170365466402 }, "harness|gsm8k|5": { "acc": 0.0, "acc_stderr": 0.0 }, "harness|winogrande|5": { "acc": 0.5777426992896606, "acc_stderr": 0.013881582030658552 } }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|arc:challenge|25_2023-07-19T16:07:47.560826.parquet
  • harness_drop_3

    • 分割:2023_10_13T00_33_45.271884, latest
    • 路径:**/details_harness|drop|3_2023-10-13T00-33-45.271884.parquet
  • harness_gsm8k_5

    • 分割:2023_10_13T00_33_45.271884, latest
    • 路径:**/details_harness|gsm8k|5_2023-10-13T00-33-45.271884.parquet
  • harness_hellaswag_10

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hellaswag|10_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:多个路径,例如 **/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_abstract_algebra_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_anatomy_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_astronomy_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_business_ethics_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_clinical_knowledge_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_college_biology_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_college_chemistry_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_college_computer_science_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_college_mathematics_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_college_medicine_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_college_physics_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_computer_security_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_conceptual_physics_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_econometrics_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_electrical_engineering_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-electrical_engineering|5_2023-07-19T16:07:47.560826.parquet
  • harness_hendrycksTest_elementary_mathematics_5

    • 分割:2023_07_19T16_07_47.560826, latest
    • 路径:**/details_harness|hendrycksTest-elementary_mathematics|5_2023-07-19T16:07:47.560826.parquet
搜集汇总
数据集介绍
open-llm-leaderboard/details_aisquared__chopt-2_7b 数据集图片
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 作为权威基准平台,为模型性能提供标准化度量。该数据集源于对 aisquared/chopt-2_7b 模型的评估过程,系统性地记录了模型在多项任务上的表现。数据集由 64 个配置组成,每个配置对应一个评估任务。它基于两次独立的运行构建而成,每次运行的结果存储为对应配置下的特定数据分割,分割名称以运行的时间戳命名。此外,一个名为“results”的附加配置汇总了所有运行的聚合结果,用于在 Leaderboard 上计算和展示综合指标。
特点
该数据集的核心特色在于其结构化的多任务评估框架。它涵盖了从常识推理(如 Winogrande)到数学推理(如 GSM8K)再到阅读理解(如 DROP)等多样化任务,以及涵盖 57 个学科的 MMLU 测试,全面衡量模型的知识广度与推理能力。每个任务配置下均包含历次运行的历史数据与指向最新结果的“train”分割,便于追踪模型性能的演变。数据以 Parquet 格式存储,支持高效加载与处理。
使用方法
研究人员可通过 HuggingFace Datasets 库便捷地访问该数据集。例如,使用 load_dataset 函数指定数据集名称、任务配置(如“harness_winogrande_5”)以及所需的分割(如“latest”或具体时间戳)即可加载特定评估结果。这种设计允许用户灵活地获取单个任务的详细日志或跨任务的聚合性能,从而深入分析模型在不同维度上的表现。
背景与挑战
背景概述
在大型语言模型(LLM)能力评估的浪潮中,Hugging Face社区于2023年推出了Open LLM Leaderboard,旨在为开源模型提供标准化、可复现的基准测试框架。该数据集作为对模型aisquared/chopt-2_7b的评估运行记录,由Clémentine Fourrier(contact: clementine@hf.co)等研究人员主导创建,核心研究问题聚焦于如何系统性地衡量2.7B参数级别模型在多种自然语言理解与推理任务上的表现。数据集涵盖了ARC挑战、HellaSwag、MMLU(涵盖57个学科)、GSM8K及Winogrande等经典基准,其影响力在于为社区提供了细粒度的模型性能快照,推动了开源LLM透明化评估的进程,尤其为中小规模模型的横向对比提供了关键数据支撑。
当前挑战
该数据集所解决的领域问题在于,LLM评估常因任务选择、评估框架差异及评分标准不统一而难以横向比较,导致模型性能报告缺乏可信度。具体挑战包括:1)多任务异构性——需在单一框架内整合常识推理(如HellaSwag)、数学解题(GSM8K)与复杂知识问答(MMLU),任务难度与格式差异对评估一致性构成考验;2)构建过程中的时序一致性——数据集由多次运行(如2023年7月与10月的两次评估)拼接而成,不同时间点的模型版本或环境变化可能引入偏差,需通过时间戳分割(如'split: 2023_10_13T00_33_45.271884')来追溯结果,但latest分割仅指向最新运行,历史结果的回溯与对齐仍存在管理复杂度。
常用场景
经典使用场景
在自然语言处理与大规模语言模型蓬勃发展的当下,对模型性能进行系统化、标准化的评估已成为推动技术进步的核心环节。open-llm-leaderboard/details_aisquared__chopt-2_7b数据集正是为此而生,它作为Open LLM Leaderboard评估流程的自动化产物,完整记录了模型aisquared/chopt-2_7b在多个基准任务上的细粒度评测结果。该数据集涵盖64个配置,对应ARC-Challenge、HellaSwag、MMLU、GSM8K、Winogrande等经典任务,每个配置均以时间戳分割存储历次运行结果,便于研究者追踪模型能力的动态演变。通过加载该数据集,用户可复现官方排行榜的评测流程,深入分析模型在常识推理、数学解题、知识理解等维度上的表现,为模型迭代提供精准的量化依据。
衍生相关工作
该数据集衍生了一系列推动评测标准化的经典工作。Open LLM Leaderboard本身已成为社区公认的模型能力竞技场,其评测框架(如EleutherAI的lm-evaluation-harness)被广泛用于后续研究,例如Meta的LLaMA系列、Mistral AI的Mistral-7B等模型均通过该平台发布官方评测结果。基于该数据集,研究者进一步开发了任务难度分析与能力图谱构建方法,例如通过对比不同规模模型在相同任务上的得分差异,揭示模型规模与特定能力之间的缩放规律。此外,该数据集还催生了面向鲁棒性评测的扩展工作——部分研究通过扰动评测样本(如修改GSM8K问题表述)并对比原始结果,评估模型对输入变体的稳定性。在低资源语言模型领域,该数据集为评估跨语言迁移能力提供了基线参考,推动了多语言评测基准的构建。
数据集最近研究
最新研究方向
在大语言模型能力评估的浪潮中,Open LLM Leaderboard已成为衡量模型综合性能的核心标尺。针对aisquared/chopt-2_7b模型的评测数据集,其研究前沿聚焦于通过多维度、细粒度的基准测试来揭示中小规模模型的真实能力边界。该数据集整合了ARC挑战、HellaSwag常识推理、MMLU多学科知识及GSM8K数学推理等多样化任务,尤其关注模型在DROP阅读理解与WinoGrande指代消解等复杂场景下的表现。当前热点在于利用此类标准化评测结果,系统分析2.7B参数级别模型在零样本与少样本设置下的泛化短板,例如GSM8K上零准确率的现象揭示了数学推理能力的显著瓶颈。这一研究方向的意义在于为模型迭代提供可复现的量化依据,推动轻量级模型在资源受限场景下的实用性优化,同时促进开源社区建立更透明、更具区分度的模型比较体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务