遇见数据集

open-llm-leaderboard-old/details_kodonho__Momo-70b-DPO-mixed

收藏
Hugging Face2024-01-18 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型kodonho/Momo-70b-DPO-mixed进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行创建,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在Open LLM Leaderboard上对模型kodonho/Momo-70b-DPO-mixed进行评估时自动创建的。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行创建,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

数据集简介

该数据集是在模型 kodonho/Momo-70b-DPO-mixed 的评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集结构

  • 配置数量:63个配置,每个配置对应一个评估任务。
  • 数据来源:数据集从1次运行中创建,每个运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • 最新结果:"train" 分割总是指向最新的结果。
  • 结果汇总:一个额外的配置 "results" 存储所有运行的汇总结果,用于计算和显示在 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_kodonho__Momo-70b-DPO-mixed", "harness_winogrande_5", split="train")

最新结果

以下是 2024-01-18T12:09:45.590059 运行 的最新结果:

python { "all": { "acc": 0.2318376299932094, "acc_stderr": 0.02998135076289475, "acc_norm": 0.23146455622350848, "acc_norm_stderr": 0.03077051926756787, "mc1": 0.2350061199510404, "mc1_stderr": 0.014843061507731603, "mc2": 0.48846362378663954, "mc2_stderr": 0.016303812688575184 }, "harness|arc:challenge|25": { "acc": 0.2235494880546075, "acc_stderr": 0.012174896631202609, "acc_norm": 0.2627986348122867, "acc_norm_stderr": 0.012862523175351335 }, "harness|hellaswag|10": { "acc": 0.2577175861382195, "acc_stderr": 0.004364838000335622, "acc_norm": 0.24975104560844452, "acc_norm_stderr": 0.004319842107724391 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.22, "acc_stderr": 0.04163331998932268, "acc_norm": 0.22, "acc_norm_stderr": 0.04163331998932268 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.22962962962962963, "acc_stderr": 0.0363338441407346, "acc_norm": 0.22962962962962963, "acc_norm_stderr": 0.0363338441407346 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.17763157894736842, "acc_stderr": 0.031103182383123398, "acc_norm": 0.17763157894736842, "acc_norm_stderr": 0.031103182383123398 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.3, "acc_stderr": 0.046056618647183814, "acc_norm": 0.3, "acc_norm_stderr": 0.046056618647183814 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.22641509433962265, "acc_stderr": 0.02575755989310675, "acc_norm": 0.22641509433962265, "acc_norm_stderr": 0.02575755989310675 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.2569444444444444, "acc_stderr": 0.03653946969442099, "acc_norm": 0.2569444444444444, "acc_norm_stderr": 0.03653946969442099 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.2, "acc_stderr": 0.04020151261036845, "acc_norm": 0.2, "acc_norm_stderr": 0.04020151261036845 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.26, "acc_stderr": 0.0440844002276808, "acc_norm": 0.26, "acc_norm_stderr": 0.0440844002276808 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.21, "acc_stderr": 0.040936018074033256, "acc_norm": 0.21, "acc_norm_stderr": 0.040936018074033256 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.20809248554913296, "acc_stderr": 0.030952890217749874, "acc_norm": 0.20809248554913296, "acc_norm_stderr": 0.030952890217749874 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.21568627450980393, "acc_stderr": 0.04092563958237654, "acc_norm": 0.21568627450980393, "acc_norm_stderr": 0.04092563958237654 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.28, "acc_stderr": 0.045126085985421276, "acc_norm": 0.28, "acc_norm_stderr": 0.045126085985421276 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.26382978723404255, "acc_stderr": 0.028809989854102973, "acc_norm": 0.26382978723404255, "acc_norm_stderr": 0.028809989854102973 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.23684210526315788, "acc_stderr": 0.039994238792813365, "acc_norm": 0.23684210526315788, "acc_norm_stderr": 0.039994238792813365 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.2413793103448276, "acc_stderr": 0.03565998174135302, "acc_norm": 0.2413793103448276, "acc_norm_stderr": 0.03565998174135302 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.20899470899470898, "acc_stderr": 0.02094048156533486, "acc_norm": 0.20899470899470898, "acc_norm_stderr": 0.02094048156533486 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.29365079365079366, "acc_stderr": 0.04073524322147126, "acc_norm": 0.29365079365079366, "acc_norm_stderr": 0.04073524322147126 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.18, "acc_stderr": 0.038612291966536934, "acc_norm": 0.18, "acc_norm_stderr": 0.038612291966536934 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.1774193548387097, "acc_stderr": 0.02173254068932927, "acc_norm": 0.1774193548387097, "acc_norm_stderr": 0.02173254068932927 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.15270935960591134, "acc_stderr": 0.02530890453938063, "acc_norm": 0.15270935960591134, "acc_norm_stderr": 0.02530890453938063 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.25, "acc_stderr": 0.04351941398892446, "acc_norm": 0.25, "acc_norm_stderr": 0.04351941398892446 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.21818181818181817, "acc_stderr": 0.03225078108306289, "acc_norm": 0.21818181818181817, "acc_norm_stderr": 0.03225078108306289 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.18181818181818182, "acc_stderr": 0.027479603010538797, "acc_norm": 0.18181818181818182, "acc_norm_stderr": 0.027479603010538797 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.19689119170984457, "acc_stderr": 0.028697873971860664, "acc_norm": 0.19689119170984457, "acc_norm_stderr": 0.028697873971860664 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.19743589743589743, "acc_stderr": 0.02018264696867484, "acc_norm": 0.19743589743589743, "acc_norm_stderr": 0.02018264696867484 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.2111111111111111, "acc_stderr": 0.024882116857

搜集汇总
数据集介绍
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 作为一个权威的评测平台,为模型性能的横向对比提供了标准化框架。该数据集正是在对 kodonho/Momo-70b-DPO-mixed 模型进行自动化评估的过程中生成的。其构建方式基于一次完整的评估运行,涵盖了 63 个不同的评测任务配置,每个配置对应一个特定的评估任务。数据集的每个配置均包含以运行时间戳命名的分割,其中 'train' 分割始终指向最新一次的评估结果,而 'results' 配置则专门存储所有任务的聚合指标,用于在排行榜上计算并展示综合性能。
使用方法
研究者可通过 HuggingFace Datasets 库便捷地加载该数据集以进行深入分析。例如,使用 `load_dataset` 函数指定数据集名称和具体的任务配置(如 'harness_winogrande_5'),并通过 `split='train'` 参数获取最新一次的评估细节数据。对于需要访问特定历史运行结果的情况,可以依据时间戳命名的分割来加载对应的 Parquet 文件。此外,通过加载 'results' 配置,用户能够直接获取所有任务的宏观聚合指标,便于快速对比模型在不同维度上的表现。
背景与挑战
背景概述
该数据集源自HuggingFace社区发起的Open LLM Leaderboard评测项目,由HuggingFace团队于2024年创建,旨在系统性地评估大规模语言模型在多样化自然语言理解与生成任务上的表现。核心研究问题聚焦于如何通过标准化、可复现的评测框架,客观衡量如kodonho/Momo-70b-DPO-mixed这类经过直接偏好优化(DPO)的70亿参数级模型的综合能力。数据集覆盖了从常识推理(如HellaSwag、ARC-Challenge)到数学求解(GSM8K)、知识问答(MMLU的57个学科)及对抗性真实性检测(TruthfulQA)等63项具体任务,为模型性能的横向对比提供了细粒度指标。作为Open LLM Leaderboard的基础设施组成部分,该数据集不仅促进了社区对模型优缺点的透明认知,还推动了语言模型评测标准的演进,成为衡量大语言模型领域进步的重要参考基准。
当前挑战
该数据集所面临的挑战首先体现在领域问题的复杂性上:语言模型评测需覆盖从基础常识到专业学术的多层次知识,而如GSM8K任务中模型得分为0.0的结果,暴露了当前模型在数学推理等需要严谨逻辑链的任务上存在显著短板。此外,构建过程中需应对评测任务多样性与数据一致性间的平衡——例如MMLU的57个学科各自具有独特的领域术语和评估粒度,整合为统一格式时需确保评分标准不产生偏差。另一个关键挑战是评测结果的可复现性,由于模型输出受采样参数和硬件环境波动影响,数据集通过存储每次运行的完整细节(如时间戳分割)来缓解这一问题,但如何定义“最新结果”与历史版本间的可比性仍是持续优化的方向。最后,面对快速迭代的模型架构,该数据集需不断更新任务集以覆盖新兴能力维度(如多轮对话、代码生成),这对评测框架的可扩展性提出了更高要求。
常用场景
经典使用场景
在大规模语言模型(LLM)性能评估领域,该数据集作为Open LLM Leaderboard的评估记录,承载了模型kodonho/Momo-70b-DPO-mixed在63个任务配置上的详细评测结果。其经典使用场景在于为研究者提供模型在ARC-Challenge、HellaSwag、MMLU(涵盖57个学科)、TruthfulQA、Winogrande及GSM8K等基准测试中的细粒度性能数据,从而支持对模型推理、常识理解、多领域知识掌握及数学能力等维度的系统化分析与比较。
解决学术问题
该数据集解决了大语言模型评估中结果可复现性与透明度不足的学术难题。通过结构化存储每项任务的准确率、标准差及归一化指标,它使研究者能够精准定位模型在特定学科(如抽象代数、临床知识)或推理任务(如常识推理、数学解题)中的优劣,进而揭示不同训练策略(如DPO混合优化)对模型能力的影响。其意义在于构建了标准化的评估框架,推动了LLM性能对比的规范化与科学化。
实际应用
在实际应用中,该数据集为模型选型与优化提供了关键决策依据。开发者可通过分析Momo-70b-DPO-mixed在Winogrande(51.7%准确率)与GSM8K(0%准确率)上的极端表现,快速识别模型在句法消歧与数学推理上的短板,从而针对性地调整训练数据或算法。此外,它还被用于自动化评估流水线,支持社区对模型迭代版本进行持续监控,确保部署前的性能可靠性。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在开放排行榜上的多任务评估体系,涵盖了从常识推理(如HellaSwag、Winogrande)到数学推理(GSM8K)以及涵盖57个学科的专业知识测试(MMLU)。当前前沿研究方向集中在如何通过DPO(直接偏好优化)等对齐技术提升70B参数级模型的综合能力,尤其是平衡其在逻辑推理、科学知识与伦理判断等维度的表现。这一评估框架为模型在真实世界应用中的稳健性提供了重要基准,其意义在于推动语言模型从单纯追求参数规模转向关注细粒度能力提升与安全对齐,反映了业界对可泛化、可信赖AI系统的迫切需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务