遇见数据集

open-llm-leaderboard/details_Corianas__1.3b

收藏
Hugging Face2023-10-15 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在模型Corianas/1.3b的评估运行期间自动创建的,用于在Open LLM Leaderboard上进行评估。数据集由64个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行都可以在特定配置中找到,分割名称使用运行的时间戳。train分割始终指向最新结果。此外,results配置存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

This dataset was automatically generated during the evaluation run of the model Corianas/1.3b, and is designed for evaluation on the Open LLM Leaderboard. It comprises 64 configurations, each corresponding to one evaluation task. The dataset is created from two separate runs, each accessible under a specific configuration, with the split names utilizing the timestamp of the corresponding run. The "train" split always references the most recent results. Additionally, the "results" configuration stores the aggregated results across all runs, and is used to compute and display the aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

该数据集是在对模型 Corianas/1.3b 进行评估运行期间自动创建的,用于 Open LLM Leaderboard

数据集组成

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集由 2 次运行创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Corianas__1.3b", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-15T03:40:11.445495 运行 的最新结果:

python { "all": { "em": 0.0019924496644295304, "em_stderr": 0.00045666764626669994, "f1": 0.045740352348993464, "f1_stderr": 0.001213536763017523, "acc": 0.2659515202794684, "acc_stderr": 0.007549145093989003 }, "harness|drop|3": { "em": 0.0019924496644295304, "em_stderr": 0.00045666764626669994, "f1": 0.045740352348993464, "f1_stderr": 0.001213536763017523 }, "harness|gsm8k|5": { "acc": 0.001516300227445034, "acc_stderr": 0.0010717793485492606 }, "harness|winogrande|5": { "acc": 0.5303867403314917, "acc_stderr": 0.014026510839428746 } }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|arc:challenge|25_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|arc:challenge|25_2023-08-18T07:03:11.668296.parquet
  • harness_drop_3

    • 分割:2023_10_15T03_40_11.445495
    • 路径:**/details_harness|drop|3_2023-10-15T03-40-11.445495.parquet
    • 分割:latest
    • 路径:**/details_harness|drop|3_2023-10-15T03-40-11.445495.parquet
  • harness_gsm8k_5

    • 分割:2023_10_15T03_40_11.445495
    • 路径:**/details_harness|gsm8k|5_2023-10-15T03-40-11.445495.parquet
    • 分割:latest
    • 路径:**/details_harness|gsm8k|5_2023-10-15T03-40-11.445495.parquet
  • harness_hellaswag_10

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hellaswag|10_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hellaswag|10_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-08-18T07:03:11.668296.parquet 等 42 个文件
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-08-18T07:03:11.668296.parquet 等 42 个文件
  • harness_hendrycksTest_abstract_algebra_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-abstract_algebra|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_anatomy_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-anatomy|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_astronomy_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-astronomy|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_business_ethics_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-business_ethics|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_clinical_knowledge_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-clinical_knowledge|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_college_biology_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_biology|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_college_chemistry_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_chemistry|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_college_computer_science_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_computer_science|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_college_mathematics_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_mathematics|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_college_medicine_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_medicine|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_college_physics_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-college_physics|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_computer_security_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-computer_security|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_conceptual_physics_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-conceptual_physics|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_econometrics_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:**/details_harness|hendrycksTest-econometrics|5_2023-08-18T07:03:11.668296.parquet
  • harness_hendrycksTest_electrical_engineering_5

    • 分割:2023_08_18T07_03_11.668296
    • 路径:**/details_harness|hendrycksTest-electrical_engineering|5_2023-08-18T07:03:11.668296.parquet
    • 分割:latest
    • 路径:`**/details_harness|hendrycksTest-electrical_engineering|5
搜集汇总
数据集介绍
open-llm-leaderboard/details_Corianas__1.3b 数据集图片
构建方式
在大型语言模型评估的领域中,该数据集专为记录模型Corianas/1.3b在Open LLM Leaderboard上的评测结果而构建。数据集由64个配置组成,每个配置对应一项被评估的任务,涵盖如ARC挑战、DROP、GSM8K、HellaSwag及涵盖57个学科的HendrycksTest等多个基准。数据源自两次独立的运行,每次运行的结果被存储为特定时间戳命名的分割,而'train'分割则始终指向最新一次运行的结果。此外,一个名为'results'的额外配置汇集了所有运行的聚合指标,用于在排行榜上计算和展示综合性能。所有数据均以Parquet格式存储,确保了高效的数据访问与处理。
特点
该数据集的核心特点在于其结构化的多任务评估体系,每个配置独立封装一项任务的详细评测数据,便于研究者针对特定能力进行深入分析。时间戳分割的设计使得模型性能的演变轨迹得以追溯,而'train'分割自动指向最新结果,简化了持续追踪的流程。'results'配置则提供了跨任务的聚合指标,包括准确率、F1分数等,并附带标准误差,为模型整体表现提供了统计可靠的量化视图。这种设计不仅支持细粒度的任务级分析,也便于进行宏观的性能比较,充分体现了LLM评估中对全面性与可重复性的追求。
使用方法
使用该数据集时,可通过Hugging Face的datasets库便捷加载。例如,要获取Winogrande任务的最近一次评测细节,可执行'load_dataset("open-llm-leaderboard/details_Corianas__1.3b", "harness_winogrande_5", split="train")'。加载时需指定任务对应的配置名称(如'harness_gsm8k_5')及所需的分割(如'train'代表最新结果,或使用具体时间戳如'2023_10_15T03_40_11.445495'访问历史数据)。对于需要跨任务聚合分析的需求,可加载'results'配置,该配置以JSON格式存储了所有运行的综合指标,便于直接用于模型性能的汇总报告或可视化展示。
背景与挑战
背景概述
在大型语言模型(LLM)能力评估领域,Open LLM Leaderboard由Hugging Face团队于2023年创建,旨在为开源模型提供标准化、可复现的评测基准。该数据集源于对模型Corianas/1.3b的评估运行,由Clementine Fourrier等研究人员主导,核心研究问题在于如何通过多任务、多维度指标(如准确率、F1分数等)量化1.3B参数级别模型的综合性能。数据集涵盖64个配置,对应ARC、HellaSwag、MMLU等经典评测任务,其影响力体现在为社区提供了细粒度的模型性能对比工具,推动了小规模语言模型的透明化评估进程。
当前挑战
该数据集面临的挑战首先源于领域问题:当前评测基准如GSM8K(数学推理)和DROP(阅读理解)上,1.3B模型表现极低(如GSM8K准确率仅0.15%),揭示小模型在复杂推理任务中的根本性局限。构建过程中,自动化评估流水线需处理异构任务格式(如MMLU的57个子领域),且时间戳分片设计(如2023-08-18与2023-10-15两次运行)增加了版本兼容与结果复现的复杂性。此外,评测指标如准确率的标准差(如Winogrande任务中为1.4%)提示模型在特定样本上的不稳定性,暴露出小规模参数下泛化能力与统计可靠性的权衡难题。
常用场景
经典使用场景
在大型语言模型的评估与比较研究中,该数据集扮演着基准测试平台的核心角色。通过对模型Corianas/1.3b在诸如ARC挑战、DROP、GSM8K、HellaSwag、WinoGrande及涵盖57个学科的MMLU等多样化任务上的表现进行系统记录,它为研究者提供了细粒度的性能指标,包括准确率、F1分数与标准误差。这一数据集特别适用于复现模型评估流程、分析模型在不同难度任务上的优劣,以及进行跨模型的横向对比,从而推动语言模型能力的量化研究。
解决学术问题
该数据集有效解决了大语言模型评估中缺乏标准化、可复现的细粒度结果记录的问题。通过结构化存储每次评估运行的详细结果,它使得研究者能够精确分析模型在常识推理、数学计算、阅读理解及多领域知识问答等学术任务上的能力边界。其意义在于为模型性能的纵向追踪和横向比较提供了可靠的数据基础,促进了评估方法的透明化与可验证性,进而支撑了关于模型泛化能力、鲁棒性及知识覆盖深度的深入探讨。
衍生相关工作
该数据集衍生了一系列关于语言模型评估标准化的重要工作。其存储格式与评估流程启发了后续对Open LLM Leaderboard的扩展研究,包括如何设计更全面的评估套件、如何聚合多次运行结果以降低评估方差,以及如何利用结构化数据自动生成可视化报告。此外,基于该数据集的细粒度结果,研究者进一步开展了针对模型在不同子任务上失败模式的分析工作,推动了模型偏差检测和针对性改进方法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务