遇见数据集

open-llm-leaderboard/details_l3utterfly__phi-2-layla-v1-chatml

收藏
Hugging Face2024-03-11 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是在评估模型[l3utterfly/phi-2-layla-v1-chatml](https://huggingface.co/l3utterfly/phi-2-layla-v1-chatml)时自动创建的,评估是在[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上进行的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在每个配置的特定分割中找到,分割名称使用运行的时间戳命名。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,并用于计算和显示[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的聚合指标。

该数据集是在评估模型[l3utterfly/phi-2-layla-v1-chatml](https://huggingface.co/l3utterfly/phi-2-layla-v1-chatml)时自动创建的,评估是在[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上进行的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在每个配置的特定分割中找到,分割名称使用运行的时间戳命名。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,并用于计算和显示[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集名称

  • pretty_name: Evaluation run of l3utterfly/phi-2-layla-v1-chatml

数据集描述

数据集组成

  • 包含63个配置,每个配置对应一个评估任务。
  • 数据集由1次运行创建,每次运行作为特定分割存储,分割名称使用运行的时间戳命名。
  • “train”分割始终指向最新结果。
  • 额外配置“results”存储所有运行结果的聚合结果,用于计算和显示聚合指标。

数据集加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_l3utterfly__phi-2-layla-v1-chatml", "harness_winogrande_5", split="train")

最新结果

  • 最新结果来自2024-03-11T09:16:31.575195的运行,包含多个任务的评估结果,如准确率、标准误差等。

数据集配置详情

配置列表

  • harness_arc_challenge_25
  • harness_gsm8k_5
  • harness_hellaswag_10
  • harness_hendrycksTest_5

每个配置包含特定任务的数据文件,如时间戳分割和最新分割,用于存储和访问特定评估任务的数据。

搜集汇总
数据集介绍
open-llm-leaderboard/details_l3utterfly__phi-2-layla-v1-chatml 数据集图片
构建方式
该数据集是在Open LLM Leaderboard框架下自动生成的评估记录,旨在系统性地衡量模型l3utterfly/phi-2-layla-v1-chatml在多项自然语言理解与推理任务上的表现。构建过程依托于一次完整的评估运行,将63个独立的评测任务配置逐一纳入,每个配置对应一个特定任务,如ARC挑战、HellaSwag、GSM8K及涵盖多学科的Hendrycks测试集等。数据以Parquet格式存储,每个任务的评估结果被组织为独立的分片,并以运行时间戳作为分割标识,确保每次运行的细节可追溯。此外,数据集还包含一个名为“results”的聚合配置,用于汇总所有任务的度量指标,便于整体性能的快速审视。
特点
该数据集的核心特点在于其结构化的多任务评估体系,能够从多维度揭示模型的推理与知识掌握能力。它覆盖了从常识推理、数学解题到专业学科知识等广泛领域,共计63个配置,每个配置均包含精确的准确率及其标准误差等统计指标。数据集的版本控制机制尤为突出,每次运行都会生成以时间戳命名的独立分割,而“latest”分割始终指向最近一次评估的成果,这为模型的持续迭代与性能追踪提供了便利。同时,聚合配置“results”将各任务指标统一呈现,使得跨任务对比与整体评估变得直观高效。
使用方法
使用该数据集时,可通过Hugging Face的datasets库进行加载。以加载特定任务的评估细节为例,用户需指定数据集名称、任务配置名称(如“harness_winogrande_5”)以及分割标识(如“latest”),即可获取相应任务的详细结果。代码示例如下:from datasets import load_dataset; data = load_dataset("open-llm-leaderboard/details_l3utterfly__phi-2-layla-v1-chatml", "harness_winogrande_5", split="latest")。加载后的数据包含模型在该任务上的各项性能指标,便于进行深入分析或可视化呈现。此外,用户还可通过遍历所有配置来获取完整的评估全景,从而支持模型性能的综合比较与报告生成。
背景与挑战
背景概述
随着大规模语言模型(LLM)的蓬勃发展,如何系统性地评估其多维度能力成为自然语言处理领域的核心议题。由Hugging Face团队构建的Open LLM Leaderboard应运而生,旨在为社区提供标准化、透明化的模型性能对比平台。该数据集诞生于2024年,针对phi-2-layla-v1-chatml模型在63个任务上的评估结果进行结构化存储,涵盖ARC挑战集、HellaSwag常识推理、GSM8K数学推理及涵盖57个学科的MMLU基准等。其核心研究问题在于通过统一评测框架揭示模型在推理、知识掌握与鲁棒性方面的真实表现,为后续模型优化提供参考基线。该数据集已成为衡量小参数模型(如2.7B参数的Phi-2系列)能力边界的重要资源,推动着高效语言模型的发展。
当前挑战
该数据集面临的核心挑战源于LLM评估的固有复杂性。在领域问题层面,模型需同时应对常识推理(如HellaSwag中0.746的归一化准确率)、数学解题(GSM8K中0.545的准确率)与多学科知识(MMLU中部分学科准确率低于0.4)等异构任务,暴露出小模型在需要深度推理或专业知识的场景中的局限性。构建过程中,数据集的挑战体现在:需将63个异构任务(如多项选择、生成式问答)的评估结果统一为结构化格式,并处理不同任务间评分标准(如准确率与困惑度)的兼容性问题;同时需维护多时间戳的运行记录(如2024年3月11日的评估批次),确保最新结果与历史数据的可追溯性,这对数据版本管理与存储架构提出了较高要求。
常用场景
经典使用场景
在大型语言模型评估领域,该数据集作为Open LLM Leaderboard的标准化评测产物,为phi-2-layla-v1-chatml模型提供了涵盖57项任务的细粒度性能记录。研究者可通过加载特定配置(如harness_winogrande_5)获取模型在常识推理、数学解题等维度的原始得分与置信区间,从而系统性地剖析模型在ARC挑战集、HellaSwag等基准上的表现差异。其结构化存储方式使得跨任务横向对比与纵向追踪模型迭代效果成为可能。
衍生相关工作
该数据集衍生了一系列重要的评估方法论工作,包括基于其结构化格式开发的自动化模型性能追踪工具,以及利用其多任务指标构建的模型能力雷达图可视化框架。研究者进一步借鉴其评估范式,提出了针对特定领域(如医疗、法律)的定制化评测基准,推动了从通用能力到垂直领域评估的深化。此外,其分任务存储的粒度启发了动态难度加权评估协议的设计,为更精准的模型排名算法奠定了基础。
数据集最近研究
最新研究方向
当前,以Open LLM Leaderboard为代表的标准化评测体系正成为大语言模型能力评估的核心枢纽。该数据集记录了phi-2-layla-v1-chatml模型在63项任务上的完整评测轨迹,涵盖从基础推理(ARC、HellaSwag)到多学科知识(MMLU)再到数学与常识(GSM8K、WinoGrande)的多元维度。值得注意的是,该模型在HellaSwag上展现出74.6%的归一化准确率,在GSM8K上达到54.5%的数学推理精度,但TruthfulQA的MC1得分仅31.3%,揭示了当前小参数模型在事实一致性与逻辑可靠性之间的显著张力。这一评测数据集不仅为模型迭代提供了可复现的量化基准,更推动了社区对模型能力边界与评测方法论的系统性反思。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务