遇见数据集

open-llm-leaderboard-old/details_liuda1__dm7b_sft_gpt88w_merge

收藏
Hugging Face2023-12-29 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在模型[liuda1/dm7b_sft_gpt88w_merge](https://huggingface.co/liuda1/dm7b_sft_gpt88w_merge)在[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的评估运行期间自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳命名。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置存储了所有运行的聚合结果,并用于计算和显示[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的聚合指标。

该数据集是在模型[liuda1/dm7b_sft_gpt88w_merge](https://huggingface.co/liuda1/dm7b_sft_gpt88w_merge)在[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的评估运行期间自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳命名。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置存储了所有运行的聚合结果,并用于计算和显示[Open LLM Leaderboard](https://huggingface.co/spaces/HuggingFaceH4/open_llm_leaderboard)上的聚合指标。

原始信息汇总

数据集概述

数据集信息

  • 数据集名称: Evaluation run of liuda1/dm7b_sft_gpt88w_merge
  • 数据集来源: 自动创建于模型 liuda1/dm7b_sft_gpt88w_merge 在 Open LLM Leaderboard 的评估运行中。
  • 数据集组成: 包含 63 个配置,每个配置对应一个评估任务。
  • 数据集创建: 从 1 次运行中创建,每个运行在每个配置中作为一个特定的分割存在,分割名称使用运行的时间戳。"train" 分割始终指向最新结果。
  • 额外配置: "results" 配置存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_liuda1__dm7b_sft_gpt88w_merge", "harness_winogrande_5", split="train")

最新结果

  • 最新结果来源: 2023-12-29T13:58:07.444331
  • 结果示例: python { "all": { "acc": 0.6127437181058283, "acc_stderr": 0.0327777601045524, "acc_norm": 0.6172340800294932, "acc_norm_stderr": 0.03343821473181721, "mc1": 0.37454100367197063, "mc1_stderr": 0.016943535128405338, "mc2": 0.5332886572328565, "mc2_stderr": 0.014981874154728991 }, "harness|arc:challenge|25": { "acc": 0.5844709897610921, "acc_stderr": 0.014401366641216386, "acc_norm": 0.6228668941979523, "acc_norm_stderr": 0.014163366896192601 }, ... }

配置信息

  • 配置名称: harness_arc_challenge_25

    • 数据文件:
      • 分割: 2023_12_29T13_58_07.444331
        • 路径: **/details_harness|arc:challenge|25_2023-12-29T13-58-07.444331.parquet
      • 分割: latest
        • 路径: **/details_harness|arc:challenge|25_2023-12-29T13-58-07.444331.parquet
  • 配置名称: harness_gsm8k_5

    • 数据文件:
      • 分割: 2023_12_29T13_58_07.444331
        • 路径: **/details_harness|gsm8k|5_2023-12-29T13-58-07.444331.parquet
      • 分割: latest
        • 路径: **/details_harness|gsm8k|5_2023-12-29T13-58-07.444331.parquet
  • 配置名称: harness_hellaswag_10

    • 数据文件:
      • 分割: 2023_12_29T13_58_07.444331
        • 路径: **/details_harness|hellaswag|10_2023-12-29T13-58-07.444331.parquet
      • 分割: latest
        • 路径: **/details_harness|hellaswag|10_2023-12-29T13-58-07.444331.parquet
  • 配置名称: harness_hendrycksTest_5

    • 数据文件:
      • 分割: 2023_12_29T13_58_07.444331
        • 路径:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2023-12-29T13-58-07.444331.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2023-12-29T13-58-07.444331.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2023-12-29T13-58-07.444331.parquet
          • ...
搜集汇总
数据集介绍
open-llm-leaderboard-old/details_liuda1__dm7b_sft_gpt88w_merge 数据集图片
构建方式
该数据集是在Open LLM Leaderboard评测框架下,针对liuda1/dm7b_sft_gpt88w_merge模型自动生成的评估记录。其构建过程基于一次完整的评测运行,涵盖了63个不同的任务配置,每个配置对应一项被评估的基准测试。数据集以时间戳命名分割,每个运行轮次的结果独立存储于对应配置的split中,而'train'分割则始终指向最新一次运行的结果。此外,一个名为'results'的额外配置汇总了所有任务的聚合指标,用于在排行榜上计算和展示综合性能。
特点
数据集的显著特点在于其结构化与动态更新机制。它通过63个独立配置分别存储不同任务(如ARC-Challenge、HellaSwag、GSM8K等)的详细评估结果,每个配置包含准确率及其标准误差等关键指标。'results'配置提供了全局聚合数据,便于快速获取模型整体表现。时间戳分割的设计允许用户追溯历史运行结果,而'train'分割自动指向最新数据,确保了评估信息的时效性与可比较性。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据。例如,使用load_dataset函数指定数据集名称和目标任务配置(如'harness_winogrande_5'),并选择'train'分割即可获取最新结果。若需访问历史运行数据,可依据时间戳名称(如'2023_12_29T13_58_07.444331')加载对应split。数据以Parquet格式存储,支持高效的列式读取和分析,适用于后续的性能比较或模型改进研究。
背景与挑战
背景概述
随着大语言模型(LLMs)的迅猛发展,如何系统性地评估其在不同自然语言理解与推理任务上的表现,成为学术界与工业界共同关注的焦点。Open LLM Leaderboard由HuggingFace团队于2023年发起,旨在为开源社区提供一个标准化、透明化的模型性能评测平台。该数据集作为Leaderboard的组成部分,记录了模型liuda1/dm7b_sft_gpt88w_merge在2023年12月29日的单次评估结果,涵盖ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande及GSM8K等数十项任务。其核心研究问题在于通过多维度、细粒度的指标(如准确率与标准差)量化模型在常识推理、数学计算、知识问答等场景中的能力边界,为后续模型优化与对比提供可靠基准。该数据集的创建显著推动了大语言模型评估的规范化进程,成为社区广泛引用的参考标准之一。
当前挑战
该数据集所解决的领域问题在于,大语言模型在开放域任务中缺乏统一的性能度量体系,不同研究间的结果难以直接比较。具体挑战包括:其一,模型在MMLU的抽象代数、大学数学等专业领域准确率仅28%至39%,暴露出对复杂逻辑与符号推理的薄弱性;其二,在TruthfulQA的mc1指标上仅达37.45%,表明模型在事实性与真实性判断上仍存在显著偏差;其三,构建过程中需处理63个不同任务配置的标准化数据格式,以及多时间戳运行结果的版本管理,确保最新结果与历史数据的一致性与可追溯性。此外,各任务间的样本量差异与随机误差(如acc_stderr值波动)也增加了评估结果的置信度分析难度。
常用场景
经典使用场景
在大型语言模型(LLM)的评估体系中,该数据集作为Open LLM Leaderboard的标准化评测记录,承载着对模型liuda1/dm7b_sft_gpt88w_merge在63个细分任务上性能的细致刻画。其经典使用场景在于为研究者提供一份结构化、可复现的测评快照,涵盖ARC挑战集、HellaSwag常识推理、GSM8K数学问题以及涵盖57个学科的MMLU基准等核心任务。通过加载特定配置如“harness_winogrande_5”,用户能够精准获取模型在代词消歧任务上的逐项表现,从而深入剖析其语言理解能力的边界。
衍生相关工作
该数据集衍生了一系列围绕LLM评估标准化与细粒度分析的研究工作。例如,基于其63个任务配置的架构,研究者开发了跨模型性能对比的可视化工具,并催生了针对特定学科(如医学、法律)的专项评测基准。此外,该数据集的时序拆分设计——保留每次运行的时间戳——启发了对模型性能随时间波动的追踪研究,进而推动了模型版本控制与持续评测框架的构建,为Open LLM Leaderboard生态的扩展奠定了数据基础。
数据集最近研究
最新研究方向
该数据集记录了模型liuda1/dm7b_sft_gpt88w_merge在Open LLM Leaderboard上的评估结果,涵盖63个任务配置,包括ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande和GSM8K等主流基准。当前研究前沿聚焦于大语言模型在多任务泛化能力上的系统性评测,该数据集揭示了模型在常识推理(如HellaSwag的acc_norm达0.82)与数学问题求解(GSM8K的acc为0.42)上的显著差异,为理解模型短板提供了量化依据。其意义在于推动模型在知识密集型任务(如MMLU中marketing准确率0.88)与逻辑推理任务间的平衡发展,呼应了业界对更鲁棒、更可信AI系统的追求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务