遇见数据集

open-llm-leaderboard-old/details_hydra-project__ChatHercules-2.5-Mistral-7B

收藏
Hugging Face2024-03-04 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在评估模型hydra-project/ChatHercules-2.5-Mistral-7B时自动创建的,评估过程在Open LLM Leaderboard上进行。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,一个名为"results"的配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型hydra-project/ChatHercules-2.5-Mistral-7B时自动创建的,评估过程在Open LLM Leaderboard上进行。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果存储为特定配置中的一个分割,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,一个名为"results"的配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

数据集简介

该数据集是在评估模型 hydra-project/ChatHercules-2.5-Mistral-7BOpen LLM Leaderboard 上的表现时自动创建的。

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集由 1 次运行创建,每次运行可以在每个配置中找到特定的拆分,拆分名称使用运行的时间戳。
  • "train" 拆分始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_hydra-project__ChatHercules-2.5-Mistral-7B", "harness_winogrande_5", split="train")

最新结果

以下是 2024-03-04T07:05:35.554823 运行的最新结果

python { "all": { "acc": 0.6553363670600032, "acc_stderr": 0.03173032509061873, "acc_norm": 0.6567393158065117, "acc_norm_stderr": 0.032374391455577266, "mc1": 0.31334149326805383, "mc1_stderr": 0.016238065069059605, "mc2": 0.4752375097401301, "mc2_stderr": 0.01471475431086459 }, "harness|arc:challenge|25": { "acc": 0.6117747440273038, "acc_stderr": 0.014241614207414044, "acc_norm": 0.6510238907849829, "acc_norm_stderr": 0.013928933461382501 }, "harness|hellaswag|10": { "acc": 0.6450906193985262, "acc_stderr": 0.0047750796365670966, "acc_norm": 0.8461461860187214, "acc_norm_stderr": 0.00360071170449341 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.33, "acc_stderr": 0.04725815626252606, "acc_norm": 0.33, "acc_norm_stderr": 0.04725815626252606 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6370370370370371, "acc_stderr": 0.04153948404742398, "acc_norm": 0.6370370370370371, "acc_norm_stderr": 0.04153948404742398 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.7236842105263158, "acc_stderr": 0.03639057569952929, "acc_norm": 0.7236842105263158, "acc_norm_stderr": 0.03639057569952929 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.59, "acc_stderr": 0.04943110704237102, "acc_norm": 0.59, "acc_norm_stderr": 0.04943110704237102 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.7358490566037735, "acc_stderr": 0.027134291628741713, "acc_norm": 0.7358490566037735, "acc_norm_stderr": 0.027134291628741713 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7777777777777778, "acc_stderr": 0.03476590104304134, "acc_norm": 0.7777777777777778, "acc_norm_stderr": 0.03476590104304134 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.48, "acc_stderr": 0.050211673156867795, "acc_norm": 0.48, "acc_norm_stderr": 0.050211673156867795 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.51, "acc_stderr": 0.05024183937956912, "acc_norm": 0.51, "acc_norm_stderr": 0.05024183937956912 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.35, "acc_stderr": 0.047937248544110196, "acc_norm": 0.35, "acc_norm_stderr": 0.047937248544110196 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6994219653179191, "acc_stderr": 0.0349610148119118, "acc_norm": 0.6994219653179191, "acc_norm_stderr": 0.0349610148119118 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.38235294117647056, "acc_stderr": 0.04835503696107223, "acc_norm": 0.38235294117647056, "acc_norm_stderr": 0.04835503696107223 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.78, "acc_stderr": 0.04163331998932263, "acc_norm": 0.78, "acc_norm_stderr": 0.04163331998932263 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.6127659574468085, "acc_stderr": 0.03184389265339526, "acc_norm": 0.6127659574468085, "acc_norm_stderr": 0.03184389265339526 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.4824561403508772, "acc_stderr": 0.04700708033551038, "acc_norm": 0.4824561403508772, "acc_norm_stderr": 0.04700708033551038 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5862068965517241, "acc_stderr": 0.04104269211806232, "acc_norm": 0.5862068965517241, "acc_norm_stderr": 0.04104269211806232 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.42328042328042326, "acc_stderr": 0.025446365634406783, "acc_norm": 0.42328042328042326, "acc_norm_stderr": 0.025446365634406783 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.4365079365079365, "acc_stderr": 0.04435932892851466, "acc_norm": 0.4365079365079365, "acc_norm_stderr": 0.04435932892851466 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.32, "acc_stderr": 0.046882617226215034, "acc_norm": 0.32, "acc_norm_stderr": 0.046882617226215034 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.8, "acc_stderr": 0.022755204959542943, "acc_norm": 0.8, "acc_norm_stderr": 0.022755204959542943 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5369458128078818, "acc_stderr": 0.035083705204426656, "acc_norm": 0.5369458128078818, "acc_norm_stderr": 0.035083705204426656 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.71, "acc_stderr": 0.045604802157206845, "acc_norm": 0.71, "acc_norm_stderr": 0.045604802157206845 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7818181818181819, "acc_stderr": 0.03225078108306289, "acc_norm": 0.7818181818181819, "acc_norm_stderr": 0.03225078108306289 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7777777777777778, "acc_stderr": 0.029620227874790482, "acc_norm": 0.7777777777777778, "acc_norm_stderr": 0.029620227874790482 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.9222797927461139, "acc_stderr": 0.01932180555722315, "acc_norm": 0.9222797927461139, "acc_norm_stderr": 0.01932180555722315 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.676923076923077, "acc_stderr": 0.02371088850197057, "acc_norm": 0.676923076923077, "acc_norm_stderr": 0.02371088850197057 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.3851851851851852, "acc_stderr": 0.029670906124630882, "acc_norm": 0.3851851851851852, "acc_norm_stderr": 0.02967

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_hydra-project__ChatHercules-2.5-Mistral-7B 数据集图片
构建方式
该数据集是在Open LLM Leaderboard评估框架下,针对hydra-project/ChatHercules-2.5-Mistral-7B模型进行自动化评测过程中生成的。数据集共包含63个配置项,每个配置对应一个被评估的具体任务。整个数据集源自一次完整的评估运行,每次运行的结果以时间戳为标识,作为独立的划分存储在对应配置中,其中名为“train”的划分始终指向最新一次的评测结果。此外,还设有名为“results”的独立配置,专门用于存放所有任务的聚合指标,为排行榜上综合分数的计算与展示提供支持。
特点
该数据集的结构设计体现了模块化与可追溯性的特点。63个配置项覆盖了从常识推理、数学计算到多学科知识问答等多样化的评估任务,每个任务均以独立的配置形式呈现,便于按需加载与分析。评测结果采用时间戳划分,既保留了历史评测轨迹,又通过“train”划分自动更新至最新数据,确保了数据时效性。聚合结果配置“results”则提供了全局视角,使得模型在不同维度上的表现得以综合呈现,极大便利了横向比较与性能追踪。
使用方法
加载该数据集时,可借助HuggingFace的datasets库,通过指定数据集名称、目标配置项及划分进行调用。例如,加载Winogrande任务的评测详情,可使用load_dataset函数,传入数据集名称和配置名“harness_winogrande_5”,并将split参数设为“train”以获取最新结果。用户亦可根据需要,通过时间戳划分访问特定历史运行的数据,实现对模型性能演化历程的细致分析。这种设计使得研究者能够灵活地获取细粒度评测信息,用于深入评估模型能力。
背景与挑战
背景概述
随着大语言模型(LLM)技术的迅猛发展,如何系统性地评估模型在多样化任务上的综合能力成为学术界与工业界共同关注的焦点。在此背景下,HuggingFace社区于2023年发起了Open LLM Leaderboard项目,旨在通过标准化基准测试为开源模型提供公平、透明的性能度量。该数据集诞生于2024年3月,由HuggingFace团队(主要联系人Clémentine Fourrier)主导构建,专门用于记录模型hydra-project/ChatHercules-2.5-Mistral-7B在Leaderboard上的评估细节。核心研究问题在于追踪该基于Mistral-7B微调的对话模型在ARC、HellaSwag、MMLU、TruthfulQA等63项任务上的表现,涵盖常识推理、数学求解、知识问答等多维度能力。该数据集作为Open LLM Leaderboard基础设施的一部分,推动了模型评估的可复现性与社区协作,对LLM性能比较范式的标准化产生了深远影响。
当前挑战
该数据集所解决的领域核心挑战在于大语言模型评估的碎片化与不可比性问题:不同研究采用各异的数据集与评估协议,导致模型间难以进行公平横向对比。Open LLM Leaderboard通过统一的任务集合与评估框架(基于LM Evaluation Harness)提供了标准化解决方案,但构建过程仍面临多重挑战。其一,评估任务覆盖57个MMLU子领域及ARC、GSM8K等多样化基准,需确保各任务数据格式与评估逻辑的兼容性,避免因配置差异引入偏差。其二,模型输出具有随机性,单次评估结果可能不稳定,需通过多次运行取平均来提升统计可靠性,但数据集仅记录单次运行结果,对波动性控制构成挑战。其三,数据集的维护与更新需与模型版本、Leaderboard后端同步,处理Parquet格式的多配置数据文件结构,确保用户可通过HuggingFace Datasets库灵活加载历史与最新结果,这对数据管道的持续集成提出了工程化要求。
常用场景
经典使用场景
该数据集作为Open LLM Leaderboard评估流程的标准化产物,主要用于记录和复现ChatHercules-2.5-Mistral-7B模型在63个多样化任务上的细粒度性能表现。其核心应用场景在于为研究者提供一种便捷的途径,以加载、分析和对比大语言模型在诸如ARC挑战集、HellaSwag常识推理、GSM8K数学推理、MMLU多学科知识以及TruthfulQA真实性评估等经典基准测试上的逐项得分。通过公开的Parquet格式数据文件与清晰的任务配置划分,该数据集成为了模型能力剖析与排行榜验证的基础工具。
衍生相关工作
基于该数据集的结构与内容,衍生了一系列关于大语言模型评估方法论的重要工作。其中最典型的包括对排行榜评分聚合策略的批判性分析,研究者利用这些细粒度数据揭示了单一平均得分可能掩盖的性能波动,进而提出了基于任务难度加权或能力聚类的新型排名方案。此外,该数据集还催生了对模型在MMLU等综合性知识基准上表现稳定性的纵向追踪研究,以及利用其多任务配置进行模型间相似性度量和知识迁移模式探索的工作,为理解大规模预训练模型的泛化机理提供了宝贵的量化资源。
数据集最近研究
最新研究方向
当前,大语言模型(LLM)的评估体系正从单一基准测试向多维度、细粒度的能力图谱演进。围绕ChatHercules-2.5-Mistral-7B模型在Open LLM Leaderboard上的评测数据,前沿研究聚焦于模型在常识推理(如HellaSwag、ARC-Challenge)、数学求解(GSM8K)及涵盖57个学科的大规模多任务语言理解(MMLU)等核心维度的表现。这些结果不仅揭示了7B参数级别模型在知识广度与推理深度上的最新平衡点,更通过Winogrande、TruthfulQA等对抗性测试,深入探讨了模型在消解歧义与事实一致性方面的鲁棒性瓶颈。该数据集作为标准化评估的标杆,其价值在于为模型迭代提供了可复现的横向对比基础,推动了开源社区从“追求参数规模”向“优化能力密度”的范式转移,对构建可信、高效的语言智能体具有里程碑式的指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务