遇见数据集

open-llm-leaderboard-old/details_Xenon1__Eclipse-13B-dpo

收藏
Hugging Face2024-02-15 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在模型Xenon1/Eclipse-13B-dpo的评估运行中自动创建的,包含63个配置,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置中找到,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于计算和显示在Open LLM Leaderboard上的聚合指标。README还提供了如何加载运行细节的示例代码,并展示了最新的评估结果。

该数据集是在模型Xenon1/Eclipse-13B-dpo的评估运行中自动创建的,包含63个配置,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置中找到,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于计算和显示在Open LLM Leaderboard上的聚合指标。README还提供了如何加载运行细节的示例代码,并展示了最新的评估结果。

原始信息汇总

数据集概述

数据集简介

该数据集是在对模型 Xenon1/Eclipse-13B-dpo 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集从 1 次运行中创建,每个运行可以在每个配置中找到特定的拆分,拆分名称使用运行的时间戳。
  • "train" 拆分始终指向最新的结果。
  • 额外的配置 "results" 存储所有聚合的运行结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Xenon1__Eclipse-13B-dpo", "harness_winogrande_5", split="train")

最新结果

以下是 2024-02-15T07:17:58.521396 运行的最新结果

python { "all": { "acc": 0.6518306406670916, "acc_stderr": 0.03203563731649302, "acc_norm": 0.6518870111709603, "acc_norm_stderr": 0.03270907133110334, "mc1": 0.3733170134638923, "mc1_stderr": 0.01693237055757063, "mc2": 0.5476200521634482, "mc2_stderr": 0.015129504751265304 }, "harness|arc:challenge|25": { "acc": 0.60580204778157, "acc_stderr": 0.014280522667467325, "acc_norm": 0.6459044368600683, "acc_norm_stderr": 0.01397545412275656 }, "harness|hellaswag|10": { "acc": 0.6506671977693687, "acc_stderr": 0.00475784902341196, "acc_norm": 0.8500298745269866, "acc_norm_stderr": 0.0035631244274585173 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.36, "acc_stderr": 0.04824181513244218, "acc_norm": 0.36, "acc_norm_stderr": 0.04824181513244218 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.6148148148148148, "acc_stderr": 0.04203921040156279, "acc_norm": 0.6148148148148148, "acc_norm_stderr": 0.04203921040156279 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.6842105263157895, "acc_stderr": 0.0378272898086547, "acc_norm": 0.6842105263157895, "acc_norm_stderr": 0.0378272898086547 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.61, "acc_stderr": 0.04902071300001975, "acc_norm": 0.61, "acc_norm_stderr": 0.04902071300001975 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.720754716981132, "acc_stderr": 0.027611163402399715, "acc_norm": 0.720754716981132, "acc_norm_stderr": 0.027611163402399715 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.7361111111111112, "acc_stderr": 0.03685651095897532, "acc_norm": 0.7361111111111112, "acc_norm_stderr": 0.03685651095897532 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.51, "acc_stderr": 0.05024183937956911, "acc_norm": 0.51, "acc_norm_stderr": 0.05024183937956911 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.53, "acc_stderr": 0.05016135580465919, "acc_norm": 0.53, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.37, "acc_stderr": 0.048523658709391, "acc_norm": 0.37, "acc_norm_stderr": 0.048523658709391 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.6878612716763006, "acc_stderr": 0.03533133389323657, "acc_norm": 0.6878612716763006, "acc_norm_stderr": 0.03533133389323657 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.39215686274509803, "acc_stderr": 0.048580835742663454, "acc_norm": 0.39215686274509803, "acc_norm_stderr": 0.048580835742663454 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.8, "acc_stderr": 0.04020151261036845, "acc_norm": 0.8, "acc_norm_stderr": 0.04020151261036845 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.574468085106383, "acc_stderr": 0.03232146916224468, "acc_norm": 0.574468085106383, "acc_norm_stderr": 0.03232146916224468 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.5175438596491229, "acc_stderr": 0.04700708033551038, "acc_norm": 0.5175438596491229, "acc_norm_stderr": 0.04700708033551038 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.593103448275862, "acc_stderr": 0.04093793981266236, "acc_norm": 0.593103448275862, "acc_norm_stderr": 0.04093793981266236 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.4074074074074074, "acc_stderr": 0.025305906241590632, "acc_norm": 0.4074074074074074, "acc_norm_stderr": 0.025305906241590632 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.4523809523809524, "acc_stderr": 0.044518079590553275, "acc_norm": 0.4523809523809524, "acc_norm_stderr": 0.044518079590553275 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.36, "acc_stderr": 0.04824181513244218, "acc_norm": 0.36, "acc_norm_stderr": 0.04824181513244218 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.7677419354838709, "acc_stderr": 0.024022256130308235, "acc_norm": 0.7677419354838709, "acc_norm_stderr": 0.024022256130308235 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.5172413793103449, "acc_stderr": 0.035158955511656986, "acc_norm": 0.5172413793103449, "acc_norm_stderr": 0.035158955511656986 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.68, "acc_stderr": 0.04688261722621505, "acc_norm": 0.68, "acc_norm_stderr": 0.04688261722621505 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.7515151515151515, "acc_stderr": 0.03374402644139403, "acc_norm": 0.7515151515151515, "acc_norm_stderr": 0.03374402644139403 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7676767676767676, "acc_stderr": 0.030088629490217487, "acc_norm": 0.7676767676767676, "acc_norm_stderr": 0.030088629490217487 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.8911917098445595, "acc_stderr": 0.022473253332768776, "acc_norm": 0.8911917098445595, "acc_norm_stderr": 0.022473253332768776 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.6641025641025641, "acc_stderr": 0.023946724741563976, "acc_norm": 0.6641025641025641, "acc_norm_stderr": 0.023946724741563976 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.35185185185185186, "acc_stderr": 0.02911661760608301, "acc_norm": 0.35185185185185186, "acc_norm_stderr": 0.02911

搜集汇总
数据集介绍
open-llm-leaderboard-old/details_Xenon1__Eclipse-13B-dpo 数据集图片
构建方式
在大型语言模型评测领域,Open LLM Leaderboard 作为权威的基准平台,为模型性能的量化分析提供了标准化框架。该数据集正是围绕 Xenon1/Eclipse-13B-dpo 模型的评估过程自动生成的,其构建逻辑依托于完整的评测流水线。数据集由 63 个配置组成,每个配置对应一个特定的评测任务,涵盖了从 ARC-Challenge 到 GSM8K 等多样化的能力维度。每个评估运行均被记录为一个独立的数据分割,并以运行时间戳命名,而“train”分割则始终指向最新一次运行的结果。此外,一个名为“results”的额外配置汇总了所有运行的聚合指标,用于在 Leaderboard 上展示综合性能。数据以 Parquet 格式存储,确保了高效存取与可扩展性。
特点
该数据集最鲜明的特色在于其结构化的任务覆盖与版本化追踪能力。通过将 63 个评测任务(如 HellaSwag、Winogrande 及涵盖 57 个学科的 MMLU 子集)整合为独立配置,研究者能够精准定位模型在推理、常识理解、数学解题及专业知识等领域的细微表现。每个任务配置下包含按时间戳划分的运行分割,这种设计不仅支持对单次评估结果的深入分析,还便于跨时间追踪模型性能的演变趋势。聚合的“results”配置进一步提供了归一化的宏观指标(如准确率及其标准误),使模型间的横向对比一目了然。数据的 Parquet 格式兼顾了列式存储的查询效率与压缩优势,适合大规模计算场景。
使用方法
使用该数据集时,研究者可通过 Hugging Face 的 datasets 库灵活加载所需内容。例如,调用 `load_dataset("open-llm-leaderboard/details_Xenon1__Eclipse-13B-dpo", "harness_winogrande_5", split="train")` 即可获取 Winogrande 任务的最新评估细节。若需回溯历史运行,可指定时间戳对应的分割名称(如 "2024_02_15T07_17_58.521396")以加载特定批次的数据。对于全面性能概览,加载 "results" 配置可获取所有任务的聚合指标,便于生成报告或进行模型排名分析。数据加载后,用户可利用 Pandas 或 PyTorch 等工具对 Parquet 格式的细节数据进行自定义统计或可视化,从而深度挖掘模型在各类基准上的表现差异。
背景与挑战
背景概述
随着大语言模型(LLM)技术的迅猛发展,如何公正、全面地评估模型性能成为学术界与工业界共同关注的核心议题。在此背景下,Hugging Face社区于2023年推出了Open LLM Leaderboard,旨在通过标准化评测体系衡量各类开源模型在推理、知识理解及安全性等多维度上的表现。本数据集源自对Xenon1/Eclipse-13B-dpo模型的评测运行,由Hugging Face团队于2024年2月创建,核心研究问题聚焦于通过直接偏好优化(DPO)微调后的13B参数模型在多样化任务上的泛化能力。该数据集记录了63项配置下的详细评测结果,涵盖ARC挑战集、HellaSwag、GSM8K及涵盖57个学科的MMLU基准等,为量化模型在常识推理、数学解题与专业领域知识上的表现提供了宝贵资源,对推动LLM评估标准化与模型改进具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于为LLM提供多维度的性能基准,但当前面临若干挑战。其一,评测任务覆盖范围虽广,但诸如数学推理(GSM8K准确率仅69.37%)与部分科学科目(如大学物理39.22%、高等数学37%)表现欠佳,揭示了模型在复杂逻辑推理与深度知识理解上的局限性。其二,构建过程中需应对评测结果的可重复性与一致性挑战,数据集通过记录单一运行批次的时间戳分割来追踪结果,但多次运行间的统计波动可能影响结论可靠性。其三,鉴于模型基于DPO微调,如何在偏好对齐与通用能力之间取得平衡仍是难题,例如TruthfulQA的MC1得分仅37.33%,表明模型在事实准确性上存在显著改进空间。
常用场景
经典使用场景
在大型语言模型(LLM)评估领域,该数据集作为Open LLM Leaderboard的自动化评测产物,为模型Xenon1/Eclipse-13B-dpo提供了标准化性能基准。其经典使用场景聚焦于多任务零样本评估,涵盖ARC挑战赛、HellaSwag常识推理、GSM8K数学问题求解、MMLU多学科知识(含57个学科)及TruthfulQA真实性检测等核心任务。研究者通过加载各任务配置的分片数据,可精准复现模型在推理、知识、数学及安全等维度的表现,从而进行细粒度能力剖析与横向对比。
解决学术问题
该数据集系统解决了LLM评估中普遍存在的标准化缺失与结果不可复现问题。通过结构化存储63个评测任务的详细结果(含准确率及标准差),它使得研究者能够基于同一基准验证模型在不同认知层级(如中学物理的逻辑推理与大学医学的专业知识)上的表现差异。其核心意义在于构建了可横向对比的评估生态,推动了LLM能力图谱的量化研究,尤其为DPO(直接偏好优化)等微调策略的有效性提供了实证基础,显著影响了后续模型迭代的评估范式。
衍生相关工作
该数据集衍生了多项关键工作,其中最典型的是基于Open LLM Leaderboard的模型竞技场研究,其评测结果直接催生了HuggingFace社区对LLM性能排名的动态追踪机制。此外,数据集中细粒度的任务分片(如ARC挑战赛的25-shot设置)启发了少量样本学习(few-shot)的标准化评估流程,被后续工作如LM Evaluation Harness广泛采用。围绕MMLU的57学科评测,衍生出针对领域知识增强的微调策略研究,例如通过DPO优化模型在专业法律(46.22%)与大学数学(37%)等薄弱环节的补救方案。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务