遇见数据集

open-llm-leaderboard-old/details_ewqr2130__llama2-ppo

收藏
Hugging Face2024-01-05 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在模型ewqr2130/llama2-ppo的评估运行期间自动创建的,用于Open LLM Leaderboard的评估。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在模型ewqr2130/llama2-ppo的评估运行期间自动创建的,用于Open LLM Leaderboard的评估。数据集由63个配置组成,每个配置对应一个评估任务。数据集从1次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

数据集摘要

该数据集是在对模型 ewqr2130/llama2-ppo 进行评估运行期间自动创建的,用于 Open LLM Leaderboard。数据集包含 63 个配置,每个配置对应一个评估任务。数据集从 1 次运行中创建,每个运行的详细信息可以在每个配置中找到,使用运行的时间戳作为分割名称。"train" 分割始终指向最新的结果。

数据集结构

数据集包含多个配置,每个配置对应不同的评估任务。以下是部分配置的示例:

  • harness_arc_challenge_25

    • 分割:2024_01_05T00_23_47.259679
    • 路径:**/details_harness|arc:challenge|25_2024-01-05T00-23-47.259679.parquet
    • 分割:latest
    • 路径:**/details_harness|arc:challenge|25_2024-01-05T00-23-47.259679.parquet
  • harness_gsm8k_5

    • 分割:2024_01_05T00_23_47.259679
    • 路径:**/details_harness|gsm8k|5_2024-01-05T00-23-47.259679.parquet
    • 分割:latest
    • 路径:**/details_harness|gsm8k|5_2024-01-05T00-23-47.259679.parquet
  • harness_hellaswag_10

    • 分割:2024_01_05T00_23_47.259679
    • 路径:**/details_harness|hellaswag|10_2024-01-05T00-23-47.259679.parquet
    • 分割:latest
    • 路径:**/details_harness|hellaswag|10_2024-01-05T00-23-47.259679.parquet
  • harness_hendrycksTest_5

    • 分割:2024_01_05T00_23_47.259679
    • 路径:
      • **/details_harness|hendrycksTest-abstract_algebra|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-anatomy|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-astronomy|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-business_ethics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-college_biology|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-college_chemistry|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-college_computer_science|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-college_mathematics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-college_medicine|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-college_physics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-computer_security|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-conceptual_physics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-econometrics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-electrical_engineering|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-elementary_mathematics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-formal_logic|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-global_facts|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_biology|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_chemistry|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_computer_science|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_european_history|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_geography|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_mathematics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_microeconomics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_physics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_psychology|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_statistics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_us_history|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-high_school_world_history|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-human_aging|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-human_sexuality|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-international_law|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-jurisprudence|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-logical_fallacies|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-machine_learning|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-management|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-marketing|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-medical_genetics|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-miscellaneous|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-moral_disputes|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-moral_scenarios|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-nutrition|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-philosophy|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-prehistory|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-professional_accounting|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-professional_law|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-professional_medicine|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-professional_psychology|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-public_relations|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-security_studies|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-sociology|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-us_foreign_policy|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-virology|5_2024-01-05T00-23-47.259679.parquet
      • **/details_harness|hendrycksTest-world_religions|5_2024-01-05T00-23-47.259679.parquet

最新结果

以下是 2024-01-05T00:23:47.259679 运行 的最新结果:

python { "all": { "acc": 0.3526851673994734, "acc_stderr": 0.03310876929515637, "acc_norm": 0.35709972795834366, "acc_norm_stderr": 0.03399609567460545, "mc1": 0.22643818849449204, "mc1_stderr": 0.014651337324602597, "mc2": 0.4507763893909204, "mc2_stderr": 0.016309761592194282 }, "harness|arc:challenge|25": { "acc": 0.36177474402730375, "acc_stderr": 0.014041957945038071, "acc_norm": 0.4

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_ewqr2130__llama2-ppo 数据集图片
构建方式
在大规模语言模型的评估体系中,Open LLM Leaderboard 作为一个公开的基准平台,为模型性能的横向对比提供了标准化框架。该数据集正是针对模型 ewqr2130/llama2-ppo 在 Leaderboard 上的评估过程而自动生成的产物。其构建方式基于一次完整的评估运行,将模型在多个任务上的表现结果系统性地整理为 63 个配置项,每个配置对应一个经过精心设计的评估任务。每个运行轮次的结果被独立存储为特定的数据分割,分割名称采用运行时间戳进行标识,而 'train' 分割则始终指向最新一轮的评估结果。此外,数据集还专门设置了一个名为 'results' 的额外配置,用于聚合存储所有任务的汇总指标,这些聚合数据最终被用于 Leaderboard 上综合评分的计算与展示。
特点
该数据集最显著的特点在于其结构化的多任务组织方式与版本化追踪能力。通过将 63 个评估任务分别配置,数据集实现了对模型在 ARC、HellaSwag、MMLU、TruthfulQA、Winogrande 及 GSM8K 等多样化基准上的细粒度性能记录。每一次评估运行都被封装为一个独立的数据分割,时间戳的引入不仅确保了历史结果的可追溯性,还使得研究者能够清晰地洞察模型性能的演进轨迹。'train' 分割自动指向最新结果的机制,简化了获取最新数据的流程。而 'results' 配置则提供了宏观视角,将各任务的准确率、标准误差等关键指标汇总一处,便于进行跨任务的综合比较与分析。
使用方法
研究者可通过 Hugging Face Datasets 库便捷地加载与使用该数据集。具体而言,利用 `load_dataset` 函数并指定数据集名称、目标配置名称(如 'harness_winogrande_5')以及所需的数据分割(如 'train'),即可获取对应任务的详细评估结果。数据以 Parquet 格式存储,确保了高效读取。对于希望复现或扩展评估的研究者,可依据时间戳筛选特定运行轮次的数据,从而进行深入的性能剖析。同时,通过加载 'results' 配置,能够直接获得模型在全部任务上的聚合表现,为撰写技术报告或进行模型对比提供了坚实的数据基础。
背景与挑战
背景概述
在大型语言模型(LLM)迅猛发展的浪潮中,如何系统性地评估模型在多样化任务上的泛化能力成为学界与工业界共同关注的焦点。Hugging Face社区于2023年发起的Open LLM Leaderboard正是为应对这一需求而生的标准化评估平台,旨在通过涵盖常识推理、数学求解、知识问答等多维度的基准测试,为研究者提供透明、可复现的模型性能比较框架。该数据集作为对ewqr2130/llama2-ppo模型的一次完整评估记录,由Hugging Face团队于2024年1月创建,其核心研究问题在于量化经PPO算法微调后的Llama2模型在63个细分任务上的表现,涵盖ARC、HellaSwag、GSM8K等经典基准。该数据集不仅为模型开发者的迭代优化提供了精准的指标反馈,更通过开放共享的评估流程推动了LLM评估范式的标准化进程,对后续模型比较与学术研究产生了深远影响。
当前挑战
该数据集所解决的领域问题在于,LLM的评估长期面临任务单一、指标不一致的困境,而传统排行榜往往仅聚合宏观分数,难以深入剖析模型在具体子任务上的成败细节。构建过程中的挑战尤为显著:首先,需统一来自不同基准(如HendrycksTest的57个学科子集)的异构数据格式,并确保每个评估配置的元数据与结果文件严格对应,这要求精密的工程化处理。其次,评估运行的时间戳管理、多次运行结果的分片存储以及“最新”分片的动态指向机制,增加了数据版本控制的复杂性。此外,面对GSM8K等数学推理任务上模型仅达0.15%准确率的极端情况,如何保证统计误差的合理标注与异常值的可追溯性,亦是对数据质量保障体系的重要考验。
常用场景
经典使用场景
在大规模语言模型(LLM)蓬勃发展的浪潮中,如何系统性地评估模型的多维能力成为研究焦点。该数据集作为Open LLM Leaderboard的自动化评测产物,为模型ewqr2130/llama2-ppo在63个细分任务上的表现提供了细粒度的记录。其经典使用场景在于通过加载特定配置(如harness_winogrande_5)与时间戳划分,复现模型在常识推理、数学计算、知识问答等基准上的精确得分,从而支撑基于排行榜的横向对比研究。
衍生相关工作
该数据集衍生了多项关键工作,最典型的是支撑了Open LLM Leaderboard的持续迭代,使之成为社区公认的模型竞技场。研究者基于此类评测数据,发展出如强化学习微调策略分析、多任务学习迁移效应探究等方向。同时,其结构化存储方式启发了后续的自动化评测管线设计,推动了如lm-evaluation-harness等工具链的标准化,加速了语言模型评估从经验性报告向数据驱动范式的转变。
数据集最近研究
最新研究方向
在大型语言模型(LLM)评估领域,基于强化学习的人类反馈(PPO)微调方法正成为提升模型对齐能力的前沿热点。该数据集记录了ewqr2130/llama2-ppo模型在Open LLM Leaderboard上的完整评估结果,覆盖了ARC-Challenge、HellaSwag、MMLU(涵盖57个学科)、TruthfulQA、Winogrande及GSM8K等多样化基准任务。从结果来看,模型在Winogrande上表现相对突出(准确率约65%),而在GSM8K数学推理任务中近乎失效(准确率仅0.15%),揭示了PPO微调在增强常识推理和减轻事实偏差方面的潜力与局限。这一评估体系为社区提供了标准化、可复现的模型性能对比,推动了LLM对齐研究从单一指标向多维度、细粒度评估的范式转变,对理解PPO在安全性与能力平衡中的角色具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务