遇见数据集

open-llm-leaderboard/details_Undi95__MLewd-v2.4-13B

收藏
Hugging Face2023-12-01 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在评估模型Undi95/MLewd-v2.4-13B时自动生成的,包含3个配置,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果作为特定分割存储在配置中,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,还有一个results配置存储所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

This dataset was automatically generated during the evaluation of the model Undi95/MLewd-v2.4-13B. It includes three configurations, each mapped to a distinct evaluation task. The dataset is compiled from two evaluation runs, with the outputs of each run stored as a dedicated split within its corresponding configuration, where the split name is derived from the timestamp of the respective run. The `train` split consistently references the most recently generated results. Furthermore, a `results` configuration is provided to store the aggregated results across all runs, which is utilized for computing and presenting aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集描述

  • 数据集摘要: 该数据集是在对模型 Undi95/MLewd-v2.4-13B 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

  • 数据集组成: 数据集包含 3 个配置,每个配置对应一个评估任务。

  • 数据集创建: 数据集从 2 次运行中创建。每次运行在每个配置中作为一个特定的分割存在,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

  • 额外配置: 一个额外的配置 "results" 存储所有运行的聚合结果,并用于计算和显示 Open LLM Leaderboard 上的聚合指标。

最新结果

以下是来自 2023-11-06T15:01:09.022171 运行的最新结果:

python { "all": { "em": 0.37153942953020136, "em_stderr": 0.004948586020359345, "f1": 0.4432686661073842, "f1_stderr": 0.0047496461477472855, "acc": 0.4214342261393644, "acc_stderr": 0.010215463395612735 }, "harness|drop|3": { "em": 0.37153942953020136, "em_stderr": 0.004948586020359345, "f1": 0.4432686661073842, "f1_stderr": 0.0047496461477472855 }, "harness|gsm8k|5": { "acc": 0.0978013646702047, "acc_stderr": 0.008182119821849047 }, "harness|winogrande|5": { "acc": 0.745067087608524, "acc_stderr": 0.012248806969376422 } }

数据集结构

配置

  • harness_drop_3

    • 分割:2023_11_05T06_43_46.123528
      • 路径:**/details_harness|drop|3_2023-11-05T06-43-46.123528.parquet
    • 分割:2023_11_06T15_01_09.022171
      • 路径:**/details_harness|drop|3_2023-11-06T15-01-09.022171.parquet
    • 分割:latest
      • 路径:**/details_harness|drop|3_2023-11-06T15-01-09.022171.parquet
  • harness_gsm8k_5

    • 分割:2023_11_05T06_43_46.123528
      • 路径:**/details_harness|gsm8k|5_2023-11-05T06-43-46.123528.parquet
    • 分割:2023_11_06T15_01_09.022171
      • 路径:**/details_harness|gsm8k|5_2023-11-06T15-01-09.022171.parquet
    • 分割:latest
      • 路径:**/details_harness|gsm8k|5_2023-11-06T15-01-09.022171.parquet
  • harness_winogrande_5

    • 分割:2023_11_05T06_43_46.123528
      • 路径:**/details_harness|winogrande|5_2023-11-05T06-43-46.123528.parquet
    • 分割:2023_11_06T15_01_09.022171
      • 路径:**/details_harness|winogrande|5_2023-11-06T15-01-09.022171.parquet
    • 分割:latest
      • 路径:**/details_harness|winogrande|5_2023-11-06T15-01-09.022171.parquet
  • results

    • 分割:2023_11_05T06_43_46.123528
      • 路径:results_2023-11-05T06-43-46.123528.parquet
    • 分割:2023_11_06T15_01_09.022171
      • 路径:results_2023-11-06T15-01-09.022171.parquet
    • 分割:latest
      • 路径:results_2023-11-06T15-01-09.022171.parquet
搜集汇总
数据集介绍
open-llm-leaderboard/details_Undi95__MLewd-v2.4-13B 数据集图片
构建方式
在大规模语言模型评估领域,Open LLM Leaderboard 作为权威的基准评测平台,为模型性能的横向对比提供了标准化框架。该数据集是模型 Undi95/MLewd-v2.4-13B 在 Open LLM Leaderboard 上进行评估时自动生成的副产品,其构建过程紧密围绕评测流程展开。数据集包含三个配置,分别对应三项被评估的任务:DROP、GSM8K 和 Winogrande。每次评估运行均被记录为一个独立的分片,分片名称以运行时间戳命名,而“train”分片始终指向最新一次评估的结果。此外,还设有一个名为“results”的额外配置,用于存储所有评估运行的聚合指标,这些指标最终被用于 Leaderboard 上综合分数的计算与展示。数据以 parquet 格式存储,确保了高效的数据存取与结构化表达。
使用方法
使用者可通过 HuggingFace 的 datasets 库便捷地加载该数据集。具体而言,调用 load_dataset 函数并指定数据集标识符,同时传入目标配置名称(如 "harness_winogrande_5")和所需分片(如 "train" 以获取最新结果),即可获取对应的评估数据。例如,代码 data = load_dataset("open-llm-leaderboard/details_Undi95__MLewd-v2.4-13B_public", "harness_winogrande_5", split="train") 将加载 Winogrande 任务的最新评估细节。此外,通过指定具体的时间戳分片(如 "2023_11_06T15_01_09.022171"),用户能够回溯历史评估记录,进行版本间的性能对比。数据以 parquet 格式提供,支持高效的读取与后续分析,适用于模型性能追踪、基准测试复现及评估方法研究等场景。
背景与挑战
背景概述
在大规模语言模型(LLM)蓬勃发展的浪潮中,如何公正、系统地评估模型性能成为推动技术进步的关键议题。Open LLM Leaderboard应运而生,旨在通过标准化评测基准,为研究者提供模型能力的横向对比平台。该数据集诞生于2023年11月,由HuggingFace团队主导,核心研究人员包括Clémentine等,专注于对Undi95/MLewd-v2.4-13B这一13B参数规模的模型进行自动化评估。数据集覆盖DROP、GSM8K和WinoGrande三项经典任务,分别考察模型的推理能力、数学求解与常识理解。其影响力体现在为社区提供了透明、可复现的评测记录,促进了模型迭代与基准方法的演进,成为LLM领域公认的评估基础设施。
当前挑战
该数据集所面临的挑战首先源于领域问题的复杂性:DROP任务要求模型在离散推理场景下实现精确匹配与F1评分,GSM8K对数学逻辑链的准确率提出严苛要求,而WinoGrande则需模型突破代词指代消解的歧义陷阱,这三项任务共同构成了对LLM综合认知能力的严峻考验。其次,构建过程中面临技术挑战:评测数据需从多次运行中自动整合,并以时间戳分片管理,确保最新结果的指向性;同时,不同任务配置间的结果存储与聚合逻辑需保持一致性,避免因评测覆盖范围变化导致指标偏差。此外,如何在高方差环境下稳定计算标准误差,以及确保parquet格式数据的高效加载与版本回溯,也是不可忽视的工程难题。
常用场景
经典使用场景
在大型语言模型(LLM)的评估与比较研究中,开放LLM排行榜(Open LLM Leaderboard)扮演着至关重要的角色。该数据集作为Undi95/MLewd-v2.4-13B模型在排行榜上自动化评估的产物,其经典使用场景聚焦于模型性能的标准化度量。通过涵盖DROP、GSM8K和WinoGrande三项经典任务,研究者可系统性地评估模型在阅读理解、数学推理与常识推理维度的能力。数据集以时间戳分割记录多次运行结果,并自动聚合为最新指标,为横向对比不同模型在统一基准下的表现提供了可靠且可复现的数据基础,成为LLM社区验证模型改进效果的核心工具。
解决学术问题
该数据集有效回应了大型语言模型评估中普遍存在的基准不统一与结果不可复现的学术困境。通过将模型在多个标准化任务上的详细输出与聚合指标结构化存储,解决了传统评估中因随机性、提示格式差异或计算环境不同而导致的比较偏差问题。其意义在于构建了一个透明、动态的评估生态:研究者可追溯单次运行的细粒度得分(如准确率、F1值),亦可利用聚合结果快速定位模型短板。这一机制推动了LLM领域从主观描述向量化实证的范式转变,为模型能力的科学归因与系统性优化提供了方法论支撑,显著提升了学术研究的严谨性与可重复性。
实际应用
在实际应用中,该数据集为模型选型与部署决策提供了直观的量化依据。企业或开发者可通过查询特定模型在DROP、GSM8K和WinoGrande上的表现,快速判断其是否适合处理涉及文档理解、数学问题求解或语义歧义消解的业务场景。例如,在智能客服系统中,若模型在WinoGrande上表现优异,则表明其具备较强的代词指代消解能力,可优先应用于需要精准理解用户意图的对话场景。此外,数据集的持续更新机制使得用户能够跟踪模型随版本迭代的性能演进,从而在模型微调或工程优化中做出数据驱动的权衡,降低试错成本。
数据集最近研究
最新研究方向
在大规模语言模型评测领域,开放大语言模型排行榜(Open LLM Leaderboard)已成为衡量模型综合能力的重要基准平台。针对Undi95/MLewd-v2.4-13B模型的评估数据集,反映了前沿研究对模型在多项任务上表现的深度剖析。该数据集聚焦于三个核心评测任务:DROP(阅读理解与数值推理)、GSM8K(数学推理)以及Winogrande(常识推理),其中Winogrande任务以74.5%的准确率展现了模型在常识理解方面的相对优势,而GSM8K仅9.78%的准确率则揭示了复杂数学推理能力的显著瓶颈。这一研究动向紧密关联着当前大语言模型在专业领域应用中的热点挑战——如何在保持常识推理能力的同时,突破数学与逻辑推理的局限。该数据集的意义在于为社区提供了标准化的评估框架,通过公开的细粒度结果(如精确匹配、F1分数及标准差),推动了模型性能的透明化比较,并引导研究者关注模型在不同认知维度上的不平衡发展,从而催生更均衡的优化策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务