open-llm-leaderboard-old/details_CausalLM__72B-preview-llamafied-qwen-llamafy

Name: open-llm-leaderboard-old/details_CausalLM__72B-preview-llamafied-qwen-llamafy
Creator: open-llm-leaderboard-old
Published: 2024-01-19 03:07:00
License: 暂无描述

Hugging Face2024-01-19 更新2024-06-22 收录

下载链接：

https://hf-mirror.com/datasets/open-llm-leaderboard-old/details_CausalLM__72B-preview-llamafied-qwen-llamafy

下载链接

链接失效反馈

官方服务：

资源简介：

该数据集是在模型 CausalLM/72B-preview-llamafied-qwen-llamafy 在 Open LLM Leaderboard 上的评估运行期间自动创建的。数据集由 63 个配置组成，每个配置对应一个评估任务。数据集包含 1 次运行的数据，每次运行在每个配置中表示为特定的拆分。train 拆分始终指向最新结果。此外，名为 results 的配置存储了所有运行的聚合结果，这些结果用于计算和显示 Open LLM Leaderboard 上的聚合指标。README 还提供了如何使用 Hugging Face datasets 库加载运行中的详细信息的示例。

提供机构：

open-llm-leaderboard-old

原始信息汇总

数据集概述

该数据集是在模型 CausalLM/72B-preview-llamafied-qwen-llamafy 的评估运行期间自动创建的，用于 Open LLM Leaderboard。

数据集组成

数据集包含 63 个配置，每个配置对应一个评估任务。
数据集从 1 次运行中创建，每次运行可以在每个配置中找到特定的分割，分割名称使用运行的时间戳。
"train" 分割始终指向最新的结果。
一个额外的配置 "results" 存储所有运行的聚合结果，用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_CausalLM__72B-preview-llamafied-qwen-llamafy", "harness_winogrande_5", split="train")

最新结果

以下是 2024-01-19T03:04:27.948723 运行的最新结果：

python { "all": { "acc": 0.765694970151033, "acc_stderr": 0.02794684069092645, "acc_norm": 0.769421113917392, "acc_norm_stderr": 0.02847875554958271, "mc1": 0.3671970624235006, "mc1_stderr": 0.01687480500145318, "mc2": 0.5254959632468497, "mc2_stderr": 0.014732861007836748 }, "harness|arc:challenge|25": { "acc": 0.6083617747440273, "acc_stderr": 0.014264122124938213, "acc_norm": 0.6518771331058021, "acc_norm_stderr": 0.013921008595179344 }, "harness|hellaswag|10": { "acc": 0.6477793268273252, "acc_stderr": 0.004766860907171532, "acc_norm": 0.8324039036048596, "acc_norm_stderr": 0.003727438786513392 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.39, "acc_stderr": 0.04902071300001974, "acc_norm": 0.39, "acc_norm_stderr": 0.04902071300001974 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.7407407407407407, "acc_stderr": 0.03785714465066653, "acc_norm": 0.7407407407407407, "acc_norm_stderr": 0.03785714465066653 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.9078947368421053, "acc_stderr": 0.02353268597044349, "acc_norm": 0.9078947368421053, "acc_norm_stderr": 0.02353268597044349 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.79, "acc_stderr": 0.040936018074033256, "acc_norm": 0.79, "acc_norm_stderr": 0.040936018074033256 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.8264150943396227, "acc_stderr": 0.02331058302600625, "acc_norm": 0.8264150943396227, "acc_norm_stderr": 0.02331058302600625 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.8958333333333334, "acc_stderr": 0.025545239210256917, "acc_norm": 0.8958333333333334, "acc_norm_stderr": 0.025545239210256917 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.53, "acc_stderr": 0.05016135580465919, "acc_norm": 0.53, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.64, "acc_stderr": 0.048241815132442176, "acc_norm": 0.64, "acc_norm_stderr": 0.048241815132442176 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.56, "acc_stderr": 0.04988876515698589, "acc_norm": 0.56, "acc_norm_stderr": 0.04988876515698589 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.7861271676300579, "acc_stderr": 0.031265112061730445, "acc_norm": 0.7861271676300579, "acc_norm_stderr": 0.031265112061730445 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.5392156862745098, "acc_stderr": 0.04959859966384181, "acc_norm": 0.5392156862745098, "acc_norm_stderr": 0.04959859966384181 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.84, "acc_stderr": 0.03684529491774709, "acc_norm": 0.84, "acc_norm_stderr": 0.03684529491774709 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.8, "acc_stderr": 0.026148818018424502, "acc_norm": 0.8, "acc_norm_stderr": 0.026148818018424502 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.5614035087719298, "acc_stderr": 0.04668000738510455, "acc_norm": 0.5614035087719298, "acc_norm_stderr": 0.04668000738510455 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.8, "acc_stderr": 0.0333333333333333, "acc_norm": 0.8, "acc_norm_stderr": 0.0333333333333333 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.6878306878306878, "acc_stderr": 0.023865206836972585, "acc_norm": 0.6878306878306878, "acc_norm_stderr": 0.023865206836972585 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.5476190476190477, "acc_stderr": 0.044518079590553275, "acc_norm": 0.5476190476190477, "acc_norm_stderr": 0.044518079590553275 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.53, "acc_stderr": 0.05016135580465919, "acc_norm": 0.53, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.8935483870967742, "acc_stderr": 0.01754510295165663, "acc_norm": 0.8935483870967742, "acc_norm_stderr": 0.01754510295165663 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.6600985221674877, "acc_stderr": 0.033327690684107895, "acc_norm": 0.6600985221674877, "acc_norm_stderr": 0.033327690684107895 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.77, "acc_stderr": 0.04229525846816505, "acc_norm": 0.77, "acc_norm_stderr": 0.04229525846816505 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.8606060606060606, "acc_stderr": 0.0270459488258654, "acc_norm": 0.8606060606060606, "acc_norm_stderr": 0.0270459488258654 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.9393939393939394, "acc_stderr": 0.01699999492742161, "acc_norm": 0.9393939393939394, "acc_norm_stderr": 0.01699999492742161 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.9896373056994818, "acc_stderr": 0.007308424386792194, "acc_norm": 0.9896373056994818, "acc_norm_stderr": 0.007308424386792194 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.8102564102564103, "acc_stderr": 0.019880165406588768, "acc_norm": 0.8102564102564103, "acc_norm_stderr": 0.019880165406588768 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.5185185185185185, "acc_stderr": 0.030464621718895322, "acc_norm": 0.5185185185185185, "acc_norm_stderr": 0.030464621718895322 }, "harness|hendrycks

搜集汇总

数据集介绍

构建方式

该数据集是在Open LLM Leaderboard评估框架下，针对CausalLM/72B-preview-llamafied-qwen-llamafy模型自动生成的评测记录集合。数据集包含63个配置，每个配置对应一项评估任务，这些任务涵盖了从常识推理到专业学科知识的多维度评测。数据源自单次运行，每次运行的结果以时间戳为标识存储为独立的分割（split），而“train”分割则始终指向最新的评测结果。此外，一个名为“results”的额外配置汇总了所有任务的聚合指标，用于在排行榜上计算和展示综合性能。

特点

该数据集的核心特点在于其结构化的多任务评测体系，囊括了ARC Challenge、HellaSwag、GSM8K、Winogrande以及涵盖57个学科的MMLU（HendrycksTest）等广泛基准。每个配置都提供了详细的准确率（acc）及其标准误差（acc_stderr），部分任务还包含归一化准确率（acc_norm）和多项选择指标（mc1, mc2）。这种细粒度的记录方式使得研究者能够深入分析模型在不同领域和难度层级上的表现，为模型改进提供精确的参考依据。

使用方法

使用该数据集时，可通过Hugging Face的datasets库加载特定的任务配置，例如调用load_dataset函数并指定配置名称（如"harness_winogrande_5"）和分割（如"train"）即可获取对应任务的详细结果。用户可根据时间戳选择特定运行的结果，或利用“latest”分割访问最新数据。此外，“results”配置提供了所有任务的聚合指标，便于快速评估模型的整体性能。这一设计支持灵活的细粒度分析和全局对比，适用于模型评测与学术研究。

背景与挑战

背景概述

随着大语言模型规模的急剧膨胀，如何系统性地评估其多维能力成为自然语言处理领域的核心议题。Open LLM Leaderboard由Hugging Face团队于2023年发起，旨在构建一个开放、动态的模型性能竞技场，以解决传统评测中基准不统一、结果难以复现的痛点。该数据集由Clementine等人主导创建，聚焦于CausalLM/72B-preview-llamafied-qwen-llamafy这一融合了Qwen架构与LLaMA微调策略的72B参数模型，通过63个涵盖常识推理、数学求解、科学知识等领域的子任务配置，系统揭示了该模型在HellaSwag、GSM8K等基准上的表现。其影响力在于为社区提供了细粒度的评测基准，推动了模型架构与训练方法的透明化比较。

当前挑战

该数据集所涉领域面临的核心挑战包括：其一，大模型评测的标准化难题，不同任务（如ARC-challenge的25-shot与GSM8K的5-shot设置）的评估协议差异导致分数可比性存疑，模型在MMLU等57个学科上的表现波动揭示了知识覆盖的碎片化问题；其二，构建过程中的计算与复现瓶颈，单次评估需运行多轮次推理，且结果存储依赖Parquet格式的时间戳分片，当模型迭代或任务配置变更时，历史结果与最新基准的衔接易产生语义断裂。此外，TruthfulQA等对抗性任务中mc1与mc2指标的显著落差（0.37 vs 0.53），折射出模型在事实一致性与逻辑自洽性之间的深层矛盾。

常用场景

经典使用场景

在大规模语言模型评测的学术疆域中，该数据集扮演着标准化评估基准的核心角色。它系统性地收录了CausalLM/72B-preview-llamafied-qwen-llamafy模型在Open LLM Leaderboard框架下63个评测任务的细粒度表现，涵盖ARC挑战集、HellaSwag、GSM8K、Winogrande以及涵盖57个学科的MMLU基准测试。研究者可借助该数据集精准复现模型在常识推理、数学求解、语言理解及多领域知识掌握等维度的能力剖面，为模型性能的横向对比与纵向追踪提供可靠的数据基石。

实际应用

在工业级模型选型与迭代的实战场景中，该数据集赋能开发者进行高效的能力诊断。当企业需要为特定垂直领域（如法律、医学或数学推理）挑选基座模型时，可直接查阅该数据集内MMLU子任务的细粒度得分，例如模型在临床知识、大学数学或专业法律等科目上的准确率，从而做出数据驱动的决策。此外，该数据集还能用于监控模型在持续学习或对齐微调后的能力衰退风险，确保模型在优化某一指标时不至于在关键任务上发生灾难性遗忘。

衍生相关工作

该数据集作为Open LLM Leaderboard生态的关键节点，催生了一系列关于模型评测方法论与能力解析的经典工作。研究者基于此类细粒度评测数据，开展了关于模型规模与任务难度间缩放律的实证分析，揭示了特定能力（如数学推理）对模型参数量的非线性依赖。同时，该数据集也为多任务学习中的任务干扰研究提供了量化依据，支持了诸如模型能力瓶颈定位、评测集难度校准以及基于能力的模型集成策略等前沿探索，深刻影响了后续大模型评测基准的设计哲学。

以上内容由遇见数据集搜集并总结生成