遇见数据集

open-llm-leaderboard/details_chavinlo__alpaca-native

收藏
Hugging Face2023-09-21 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型chavinlo/alpaca-native进行评估时自动生成的。数据集由64个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行在每个配置中表示为特定的分割,分割名称使用运行的时间戳。train分割始终指向最新结果。一个名为results的额外配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。文件还提供了一个Python代码片段来加载运行中的详细信息,并列出了特定运行的最新结果。

This dataset was automatically generated when evaluating the model chavinlo/alpaca-native on the Open LLM Leaderboard. It consists of 64 configurations, each corresponding to one evaluation task. The dataset is generated from two experimental runs, where each run is represented as a specific split under each configuration, with the split name using the run's timestamp as its identifier. The 'train' split always points to the most recent evaluation results. An additional configuration named 'results' stores the aggregated results across all runs, which are used to calculate and display the aggregate metrics on the Open LLM Leaderboard. The accompanying file also provides a Python code snippet to load detailed run information, and lists the latest results for a specific run.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在对模型 chavinlo/alpaca-native 进行评估时自动创建的,用于 Open LLM Leaderboard。数据集包含 64 个配置,每个配置对应一个评估任务。数据集从 2 次运行中创建,每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

数据集结构

数据集包含以下配置:

  • harness_arc_challenge_25

    • 分割:2023_09_21T20_23_20.255556
    • 路径:**/details_harness|arc:challenge|25_2023-09-21T20-23-20.255556.parquet
    • 分割:latest
    • 路径:**/details_harness|arc:challenge|25_2023-09-21T20-23-20.255556.parquet
  • harness_drop_3

    • 分割:2023_09_17T15_14_48.848140
    • 路径:**/details_harness|drop|3_2023-09-17T15-14-48.848140.parquet
    • 分割:latest
    • 路径:**/details_harness|drop|3_2023-09-17T15-14-48.848140.parquet
  • harness_gsm8k_5

    • 分割:2023_09_17T15_14_48.848140
    • 路径:**/details_harness|gsm8k|5_2023-09-17T15-14-48.848140.parquet
    • 分割:latest
    • 路径:**/details_harness|gsm8k|5_2023-09-17T15-14-48.848140.parquet
  • harness_hellaswag_10

    • 分割:2023_09_21T20_23_20.255556
    • 路径:**/details_harness|hellaswag|10_2023-09-21T20-23-20.255556.parquet
    • 分割:latest
    • 路径:**/details_harness|hellaswag|10_2023-09-21T20-23-20.255556.parquet
  • harness_hendrycksTest_5

    • 分割:2023_09_21T20_23_20.255556
    • 路径:
      • **/details_harness|hendrycksTest-abstract_algebra|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-anatomy|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-astronomy|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-business_ethics|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-college_biology|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-college_chemistry|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-college_computer_science|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-college_mathematics|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-college_medicine|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-college_physics|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-computer_security|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-conceptual_physics|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-econometrics|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-electrical_engineering|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-formal_logic|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-global_facts|5_2023-09-21T20-23-20.255556.parquet
      • **/details_harness|hendrycksTest-high_school_biology|5_2023-09-21T20-23-20.255556.parquet

最新结果

以下是 2023-09-21T20:23:20.255556 运行 的最新结果:

python { "all": { "acc": 0.41927597389078103, "acc_stderr": 0.035302205782678654, "acc_norm": 0.42235476219088836, "acc_norm_stderr": 0.035290265393035695, "mc1": 0.2484700122399021, "mc1_stderr": 0.015127427096520674, "mc2": 0.3759916250814691, "mc2_stderr": 0.015396201572279763 }, "harness|arc:challenge|25": { "acc": 0.5127986348122867, "acc_stderr": 0.014606603181012538, "acc_norm": 0.5204778156996587, "acc_norm_stderr": 0.01459913135303501 }, "harness|hellaswag|10": { "acc": 0.5959968133837881, "acc_stderr": 0.004896952378506926, "acc_norm": 0.7699661422027485, "acc_norm_stderr": 0.004199941217549452 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.28, "acc_stderr": 0.04512608598542129, "acc_norm": 0.28, "acc_norm_stderr": 0.04512608598542129 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.45925925925925926, "acc_stderr": 0.04304979692464242, "acc_norm": 0.45925925925925926, "acc_norm_stderr": 0.04304979692464242 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.3618421052631579, "acc_stderr": 0.03910525752849724, "acc_norm": 0.3618421052631579, "acc_norm_stderr": 0.03910525752849724 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.46, "acc_stderr": 0.05009082659620333, "acc_norm": 0.46, "acc_norm_stderr": 0.05009082659620333 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.44150943396226416, "acc_stderr": 0.030561590426731837, "acc_norm": 0.44150943396226416, "acc_norm_stderr": 0.030561590426731837 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.3819444444444444, "acc_stderr": 0.040629907841466674, "acc_norm": 0.3819444444444444, "acc_norm_stderr": 0.040629907841466674 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.32, "acc_stderr": 0.046882617226215034, "acc_norm": 0.32, "acc_norm_stderr": 0.046882617226215034 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.41, "acc_stderr": 0.04943110704237102, "acc_norm": 0.41, "acc_norm_stderr": 0.04943110704237102 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.35, "acc_stderr": 0.047937248544110196, "acc_norm": 0.35, "acc_norm_stderr": 0.047937248544110196 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.3815028901734104, "acc_stderr": 0.03703851193099521, "acc_norm": 0.3815028901734104, "acc_norm_stderr": 0.03703851193099521 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.21568627450980393, "acc_stderr": 0.04092563958237656, "acc_norm": 0.21568627450980393, "acc_norm_stderr": 0.04092563958237656 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.54, "acc_stderr": 0.05009082659620332, "acc_norm": 0.54, "acc_norm_stderr": 0.05009082659620332 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.37446808510638296, "acc_stderr": 0.03163910665367291, "acc_norm": 0.37446808510638296, "acc_norm_stderr": 0.03163910665367291 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.2543859649122807, "acc_stderr": 0.040969851398436716, "acc_norm": 0.2543859649122807, "acc_norm_stderr": 0.040969851398436716 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.3655

搜集汇总
数据集介绍
open-llm-leaderboard/details_chavinlo__alpaca-native 数据集图片
构建方式
该数据集是在Open LLM Leaderboard评估框架下,对chavinlo/alpaca-native模型进行自动化评测过程中生成的。数据集由64个配置组成,每个配置对应一个被评估的任务。它基于两次独立的运行创建,每次运行的结果被存储为对应配置下的特定分割(split),分割名称采用运行的时间戳命名。训练分割(train)始终指向最新一次运行的结果。此外,存在一个名为'results'的额外配置,用于存储所有运行的聚合结果,并用于计算和展示Open LLM Leaderboard上的综合指标。
特点
该数据集的核心特点在于其结构化的评估记录方式。每个配置独立对应一项具体任务,如ARC挑战、HellaSwag、MMLU等多个领域,覆盖了从常识推理到专业知识的广泛测试。时间戳分割的设计使得研究者可以追溯不同时间点模型的性能变化,而'train'分割则自动指向最新结果,便于获取当前最优表现。'results'配置进一步聚合了全部运行数据,为模型整体性能的横向对比提供了便利。这种设计兼顾了历史追溯与实时更新的需求。
使用方法
使用该数据集时,可通过HuggingFace的datasets库进行加载。例如,执行'from datasets import load_dataset'后,指定数据集名称、任务配置名称(如'harness_truthfulqa_mc_0')以及分割名称(如'train')即可获取特定任务的详细结果。若需访问历史运行数据,可将分割名称替换为对应的时间戳字符串。对于聚合指标,则需加载'results'配置。这种灵活的加载方式支持对模型在单一任务或全量任务上的表现进行深入分析。
背景与挑战
背景概述
随着大规模语言模型(LLM)的蓬勃发展,如何系统、公正地评估其性能成为自然语言处理领域的关键议题。在此背景下,Hugging Face团队于2023年推出了Open LLM Leaderboard,旨在为开放语言模型提供标准化评测平台。该数据集正是为评测模型chavinlo/alpaca-native而生,由Clementine等研究人员主导创建,通过整合ARC-Challenge、HellaSwag、MMLU、TruthfulQA等多项主流基准测试,全面衡量模型在常识推理、知识理解、事实一致性等维度的能力。该数据集不仅记录了模型在64个配置下的详细评测结果,更通过聚合指标为社区提供了可复现的对比基准,推动了LLM评估范式的透明化与规范化,对开放语言模型的发展具有重要参考价值。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:语言模型评估需覆盖从逻辑推理到专业知识的广泛维度,而现有基准测试仍难以完全捕捉模型在真实场景中的泛化能力与潜在偏见。其次,构建过程中,数据需从多次评测运行中整合,不同时间戳的评测结果可能因任务覆盖不一致而产生偏差,如何确保最新结果与历史数据的可比性成为难点。此外,评测指标(如准确率、标准差)的统计稳定性受限于样本量,部分学科(如大学数学、物理学)的低准确率揭示了模型在特定领域上的薄弱环节,而数据集本身无法直接指导模型改进,仅能暴露问题。最后,评测任务的标准化与动态更新之间的平衡,以及跨模型结果的可迁移性,仍是持续存在的技术挑战。
常用场景
经典使用场景
该数据集的核心用途在于为大规模语言模型(LLM)提供标准化、多维度的性能评估基准。它围绕Open LLM Leaderboard平台设计,整合了涵盖常识推理、科学知识、数学计算、伦理判断等数十个经典评测任务(如ARC-Challenge、HellaSwag、TruthfulQA及HendrycksTest系列),使研究者能够系统性地衡量模型在零样本或少样本条件下的泛化能力与鲁棒性。通过统一的评测框架,该数据集支持对模型在不同难度、不同知识领域的表现进行细粒度对比分析,成为当前LLM领域最为权威的竞技场之一。
解决学术问题
该数据集直面大语言模型评测中缺乏标准化、可复现基准的学术困境。传统上,模型评估常因任务选择、提示格式、评分细则的差异而难以横向比较。此数据集通过固定评测配置与自动化流程,解决了跨模型、跨时间维度的公平对比难题。它使得研究者能够精准识别模型在抽象推理、事实性知识、逻辑一致性等维度的优势与短板,推动了模型能力图谱的量化描述。其意义在于为模型迭代提供了可依赖的度量标尺,加速了从模型设计到实证验证的闭环进程。
衍生相关工作
该数据集催生了多项具有影响力的衍生工作。其一,基于其评测架构,研究者提出了更细粒度的能力诊断工具,如将HendrycksTest拆解为学科知识图谱以分析模型的知识覆盖度。其二,该数据集被用于验证多种模型优化策略的有效性,包括指令微调、检索增强生成(RAG)以及思维链(Chain-of-Thought)提示方法。其三,其公开的评测日志与结果数据被广泛引用于模型技术报告(如Llama 2、Falcon系列),成为衡量开源模型性能的黄金标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务