遇见数据集

open-llm-leaderboard-old/details_KnutJaegersberg__CausalLM-Platypus-14B

收藏
Hugging Face2023-12-04 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在评估模型KnutJaegersberg/CausalLM-Platypus-14B时自动创建的,评估在Open LLM Leaderboard上进行。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割以运行的时间戳命名。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型KnutJaegersberg/CausalLM-Platypus-14B时自动创建的,评估在Open LLM Leaderboard上进行。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割以运行的时间戳命名。train分割始终指向最新的结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

数据集来源

该数据集是在评估模型 KnutJaegersberg/CausalLM-Platypus-14BOpen LLM Leaderboard 上的运行过程中自动创建的。

数据集组成

数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。"train" 分割始终指向最新的结果。

额外配置

一个额外的配置 "results" 存储了所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

要加载运行的详细信息,可以使用以下代码: python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_KnutJaegersberg__CausalLM-Platypus-14B", "harness_winogrande_5", split="train")

最新结果

以下是 2023-12-04T16:51:57.127322 运行的最新结果: python { "all": { "acc": 0.6473338331104262, "acc_stderr": 0.032360970782450774, "acc_norm": 0.6510141346905667, "acc_norm_stderr": 0.033006063375479955, "mc1": 0.32558139534883723, "mc1_stderr": 0.016403989469907825, "mc2": 0.4756853442339182, "mc2_stderr": 0.014976872039741383 }, "harness|arc:challenge|25": { "acc": 0.5119453924914675, "acc_stderr": 0.014607220340597171, "acc_norm": 0.5691126279863481, "acc_norm_stderr": 0.014471133392642471 }, "harness|hellaswag|10": { "acc": 0.602867954590719, "acc_stderr": 0.004883037758919966, "acc_norm": 0.800637323242382, "acc_norm_stderr": 0.003987047047167319 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.31, "acc_stderr": 0.04648231987117316, "acc_norm": 0.31, "acc_norm_stderr": 0.04648231987117316 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6148148148148148, "acc_stderr": 0.042039210401562783, "acc_norm": 0.6148148148148148, "acc_norm_stderr": 0.042039210401562783 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6710526315789473, "acc_stderr": 0.03823428969926604, "acc_norm": 0.6710526315789473, "acc_norm_stderr": 0.03823428969926604 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.63, "acc_stderr": 0.04852365870939099, "acc_norm": 0.63, "acc_norm_stderr": 0.04852365870939099 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.6981132075471698, "acc_stderr": 0.02825420034443866, "acc_norm": 0.6981132075471698, "acc_norm_stderr": 0.02825420034443866 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7777777777777778, "acc_stderr": 0.03476590104304134, "acc_norm": 0.7777777777777778, "acc_norm_stderr": 0.03476590104304134 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.46, "acc_stderr": 0.05009082659620333, "acc_norm": 0.46, "acc_norm_stderr": 0.05009082659620333 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.5, "acc_stderr": 0.050251890762960605, "acc_norm": 0.5, "acc_norm_stderr": 0.050251890762960605 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.41, "acc_stderr": 0.049431107042371025, "acc_norm": 0.41, "acc_norm_stderr": 0.049431107042371025 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6473988439306358, "acc_stderr": 0.03643037168958548, "acc_norm": 0.6473988439306358, "acc_norm_stderr": 0.03643037168958548 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.38235294117647056, "acc_stderr": 0.04835503696107224, "acc_norm": 0.38235294117647056, "acc_norm_stderr": 0.04835503696107224 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.74, "acc_stderr": 0.04408440022768078, "acc_norm": 0.74, "acc_norm_stderr": 0.04408440022768078 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.6, "acc_stderr": 0.03202563076101735, "acc_norm": 0.6, "acc_norm_stderr": 0.03202563076101735 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.49122807017543857, "acc_stderr": 0.04702880432049615, "acc_norm": 0.49122807017543857, "acc_norm_stderr": 0.04702880432049615 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.6275862068965518, "acc_stderr": 0.04028731532947558, "acc_norm": 0.6275862068965518, "acc_norm_stderr": 0.04028731532947558 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.5105820105820106, "acc_stderr": 0.02574554227604548, "acc_norm": 0.5105820105820106, "acc_norm_stderr": 0.02574554227604548 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.5396825396825397, "acc_stderr": 0.04458029125470973, "acc_norm": 0.5396825396825397, "acc_norm_stderr": 0.04458029125470973 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.39, "acc_stderr": 0.04902071300001974, "acc_norm": 0.39, "acc_norm_stderr": 0.04902071300001974 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7677419354838709, "acc_stderr": 0.024022256130308235, "acc_norm": 0.7677419354838709, "acc_norm_stderr": 0.024022256130308235 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5911330049261084, "acc_stderr": 0.034590588158832314, "acc_norm": 0.5911330049261084, "acc_norm_stderr": 0.034590588158832314 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.68, "acc_stderr": 0.04688261722621504, "acc_norm": 0.68, "acc_norm_stderr": 0.04688261722621504 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7454545454545455, "acc_stderr": 0.03401506715249039, "acc_norm": 0.7454545454545455, "acc_norm_stderr": 0.03401506715249039 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.8484848484848485, "acc_stderr": 0.025545650426603613, "acc_norm": 0.8484848484848485, "acc_norm_stderr": 0.025545650426603613 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8393782383419689, "acc_stderr": 0.026499057701397436, "acc_norm": 0.8393782383419689, "acc_norm_stderr": 0.026499057701397436 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6512820512820513, "acc_stderr": 0.02416278028401772, "acc_norm": 0.6512820512820513, "acc_norm_stderr": 0.02416278028401772 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.35555555555555557, "acc_stderr": 0.0291857149498574, "acc_norm": 0.35555555555555557, "acc_norm_stderr":

搜集汇总
数据集介绍
构建方式
在大型语言模型评估领域,Open LLM Leaderboard为模型性能的量化分析提供了标准化平台。该数据集系针对模型KnutJaegersberg/CausalLM-Platypus-14B在Leaderboard上进行评估时自动构建而成。其构建逻辑围绕63个评估任务展开,每个任务对应一个独立的配置(config),涵盖ARC挑战赛、HellaSwag、GSM8K、WinoGrande、TruthfulQA以及涵盖57个学科的MMLU基准测试。数据集源自单次运行,每次运行的时间戳被用作特定分片(split)的标识,而'train'分片则始终指向最新一次运行的结果。此外,一个名为'results'的独立配置被用于汇总并存储所有任务的聚合指标,这些指标直接服务于Leaderboard上综合评分的计算与展示。
使用方法
使用该数据集进行模型性能分析十分便捷。研究者可通过Hugging Face的datasets库加载数据,例如使用`load_dataset("open-llm-leaderboard/details_KnutJaegersberg__CausalLM-Platypus-14B", "harness_winogrande_5", split="train")`来获取WinoGrande任务的最新评估细节。每个配置对应一个具体任务,分片名称(如'2023_12_04T16_51_57.127322'或'latest')允许用户选择历史或最新数据。'results'配置则提供了所有任务的聚合结果,可直接用于模型性能的横向对比与基准测试。这种灵活的加载方式,使得该数据集成为研究模型能力演变、复现评估结果或进行元分析的可靠资源。
背景与挑战
背景概述
随着大语言模型(LLM)领域的蓬勃发展,如何客观、全面地评估模型性能成为学术界与工业界共同关注的核心议题。在此背景下,Hugging Face团队于2023年发起了Open LLM Leaderboard项目,旨在通过标准化评测基准,追踪并比较各类开源LLM在多项自然语言理解与推理任务上的表现。该数据集正是针对KnutJaegersberg等人开发的CausalLM-Platypus-14B模型在2023年12月4日进行的评估运行记录,由Hugging Face的Clémentine Fourrier等人负责构建与维护。数据集涵盖了ARC-Challenge、HellaSwag、MMLU(涵盖57个学科)、TruthfulQA、Winogrande及GSM8K等多个维度的评测结果,精准刻画了该14B参数规模因果语言模型在常识推理、知识问答及数学解题等领域的综合能力,为社区提供了可复现的模型性能基准,推动了LLM评估体系的透明化与规范化。
当前挑战
该数据集所解决的领域问题在于,LLM评测长期面临任务碎片化、指标不统一及结果难以复现的挑战。Open LLM Leaderboard通过集成多样化评测任务,构建了标准化流水线,有效缓解了模型性能横向对比的困难。在构建过程中,团队面临多重技术挑战:其一,需为每个模型运行63个独立配置(config),涵盖不同任务与采样参数,确保数据一致性与版本可追溯性;其二,评测结果以Parquet格式存储,需设计高效的数据加载与聚合逻辑,以支持用户按任务、时间戳灵活查询;其三,模型运行结果可能因随机种子或硬件差异产生波动,需引入误差统计(如acc_stderr)以量化不确定性,确保评估结论的统计稳健性。
常用场景
经典使用场景
在大规模语言模型评估领域,该数据集作为Open LLM Leaderboard的评测结果记录,承载了KnutJaegersberg/CausalLM-Platypus-14B模型在63个任务配置上的细粒度性能数据。其经典使用场景在于通过加载特定配置(如harness_winogrande_5)的评测结果,为研究者提供模型在常识推理、数学解题、知识问答等维度上的精确指标,从而支持模型能力的横向对比与纵深分析。
解决学术问题
该数据集系统性地回应了语言模型评估标准化不足的学术困境。通过统一的评测框架,它解决了跨模型、跨任务性能难以公平比较的难题,并借助ARC-Challenge、HellaSwag、GSM8K等多样化基准,揭示了模型在推理鲁棒性、知识广度和逻辑一致性方面的真实水平。其意义在于为模型迭代提供了可量化的改进方向,推动了评估范式的规范化进程。
实际应用
在实际应用中,该数据集可作为模型选型的决策依据。开发者可依据其中记录的MMLU、TruthfulQA等任务得分,筛选出在特定领域(如医学、法律、工程)表现优异的模型,进而部署于智能客服、教育辅导或专业咨询系统。同时,其细粒度结果也为模型微调提供了反馈信号,指导数据增强与训练策略的优化。
数据集最近研究
最新研究方向
随着大语言模型能力的飞速演进,如何系统化、标准化地评估其综合性能已成为学界与工业界共同关注的核心议题。在此背景下,Open LLM Leaderboard 作为一个开放的模型评测平台,为社区提供了可复现、可比较的基准测试环境。该数据集记录了 KnutJaegersberg/CausalLM-Platypus-14B 模型在多项任务上的细粒度评测结果,涵盖常识推理、数学求解、专业知识问答等多个维度,反映了当前研究中对模型多任务泛化能力与知识广度的深度考察。尤为值得关注的是,该评测体系融合了如 ARC、HellaSwag、GSM8K 以及涵盖 57 个学科的 MMLU 等前沿基准,其评测结果不仅揭示了模型在逻辑推理与领域知识上的表现差异,也为后续模型优化与能力增强提供了关键参考。这一研究方向正推动着大模型评估从单一指标向多维度、多层次的精细化评估范式转变,对构建更可靠、更透明的 AI 系统具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务