遇见数据集

open-llm-leaderboard/details_beomi__KoRWKV-6B

收藏
Hugging Face2023-10-26 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是在模型beomi/KoRWKV-6B的评估运行期间自动创建的,用于Open LLM Leaderboard的评估。数据集由64个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果作为特定配置中的一个分割,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

This dataset was automatically generated during the evaluation runs of the beomi/KoRWKV-6B model for evaluations on the Open LLM Leaderboard. It comprises 64 configurations, each corresponding to one evaluation task. The dataset is created from two separate runs, where the results of each run serve as a split within its respective configuration, with the split name being the timestamp of the corresponding run. The 'train' split always points to the most recent results. Additionally, a configuration named 'results' stores the aggregated results from all runs, which is used to calculate and display the aggregated metrics on the Open LLM Leaderboard.

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集是在评估模型 beomi/KoRWKV-6BOpen LLM Leaderboard 上的运行过程中自动创建的。

数据集组成

  • 数据集包含 64 个配置,每个配置对应一个评估任务。
  • 数据集从 2 次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train" 分割始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示在 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_beomi__KoRWKV-6B", "harness_winogrande_5", split="train")

最新结果

以下是 2023-10-26T04:59:46.486302 运行 的最新结果: python { "all": { "em": 0.018246644295302015, "em_stderr": 0.001370668245281319, "f1": 0.05829278523489933, "f1_stderr": 0.0018688501996275634, "acc": 0.2557221783741121, "acc_stderr": 0.007024402099929661 }, "harness|drop|3": { "em": 0.018246644295302015, "em_stderr": 0.001370668245281319, "f1": 0.05829278523489933, "f1_stderr": 0.0018688501996275634 }, "harness|gsm8k|5": { "acc": 0.0, "acc_stderr": 0.0 }, "harness|winogrande|5": { "acc": 0.5114443567482242, "acc_stderr": 0.014048804199859322 } }

配置详情

  • harness_arc_challenge_25

    • 分割:2023_10_04T17_42_58.699001
      • 路径:**/details_harness|arc:challenge|25_2023-10-04T17-42-58.699001.parquet
    • 分割:latest
      • 路径:**/details_harness|arc:challenge|25_2023-10-04T17-42-58.699001.parquet
  • harness_drop_3

    • 分割:2023_10_26T04_59_46.486302
      • 路径:**/details_harness|drop|3_2023-10-26T04-59-46.486302.parquet
    • 分割:latest
      • 路径:**/details_harness|drop|3_2023-10-26T04-59-46.486302.parquet
  • harness_gsm8k_5

    • 分割:2023_10_26T04_59_46.486302
      • 路径:**/details_harness|gsm8k|5_2023-10-26T04-59-46.486302.parquet
    • 分割:latest
      • 路径:**/details_harness|gsm8k|5_2023-10-26T04-59-46.486302.parquet
  • harness_hellaswag_10

    • 分割:2023_10_04T17_42_58.699001
      • 路径:**/details_harness|hellaswag|10_2023-10-04T17-42-58.699001.parquet
    • 分割:latest
      • 路径:**/details_harness|hellaswag|10_2023-10-04T17-42-58.699001.parquet
  • harness_hendrycksTest_5

    • 分割:2023_10_04T17_42_58.699001
      • 路径:
        • **/details_harness|hendrycksTest-abstract_algebra|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-anatomy|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-astronomy|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-business_ethics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-college_biology|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-college_chemistry|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-college_computer_science|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-college_mathematics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-college_medicine|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-college_physics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-computer_security|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-conceptual_physics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-econometrics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-electrical_engineering|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-formal_logic|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-global_facts|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_biology|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_european_history|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_geography|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_physics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_psychology|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_statistics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_us_history|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-high_school_world_history|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-human_aging|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-human_sexuality|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-international_law|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-jurisprudence|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-logical_fallacies|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-machine_learning|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-management|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-marketing|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-medical_genetics|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-miscellaneous|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-moral_disputes|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-moral_scenarios|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-nutrition|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-philosophy|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-prehistory|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-professional_accounting|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-professional_law|5_2023-10-04T17-42-58.699001.parquet
        • **/details_harness|hendrycksTest-professional_medicine|5_2023-10-04T17-42-58.699001.parquet
        • `**/details_harness|hendrycksTest-professional_psychology
搜集汇总
数据集介绍
open-llm-leaderboard/details_beomi__KoRWKV-6B 数据集图片
构建方式
在大型语言模型评测领域,Open LLM Leaderboard为模型性能的量化分析提供了标准化平台。该数据集专为评估模型beomi/KoRWKV-6B而构建,其构建方式依托于HuggingFace的评测框架,通过两次独立的评估运行自动生成。数据集包含64个配置,每个配置对应一个特定的评测任务,如ARC挑战、DROP、GSM8K等。每次运行的结果以时间戳命名并作为独立分割存储,其中“train”分割始终指向最新结果。此外,另设“results”配置用于汇总所有运行的聚合指标,为模型在排行榜上的表现提供计算依据。
特点
该数据集展现出鲜明的结构化与动态更新特性。其核心特点在于多配置设计,覆盖从常识推理到数学求解的广泛任务,如Winogrande与HellaSwag,全面反映模型的多维能力。每次评估运行均保留为独立分割,支持历史结果追溯与对比分析,而“latest”分割的自动指向机制确保了数据实时性。数据以Parquet格式存储,兼顾高效读写与压缩性能,适配大规模评测场景。这种设计不仅便于研究者追踪模型性能演进,也为后续模型迭代提供了可复现的基准参照。
使用方法
研究者可通过HuggingFace Datasets库便捷调用该数据集。以加载Winogrande任务的详细信息为例,使用load_dataset函数指定数据集名称、配置名(如“harness_winogrande_5”)及分割(如“train”)即可获取最新结果。对于历史数据的访问,可通过时间戳分割名称实现,例如引用特定运行的具体Parquet文件。该数据集支持直接解析JSON格式的聚合结果,其中包含准确率、F1分数等关键指标及其标准误差,便于快速集成到性能分析流程或可视化工具中,从而高效支撑模型评估与对比研究。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的浪潮中,韩国语境的模型评估体系仍显薄弱。由韩国研究者beomi团队于2023年开发的KoRWKV-6B模型,基于RWKV架构并针对韩语进行了深度优化,旨在探索非Transformer架构在非英语语言上的表现力。该模型通过Open LLM Leaderboard平台进行系统性评估,数据集由HuggingFace团队(联系人clementine@hf.co)于2023年10月创建,覆盖了ARC-Challenge、DROP、GSM8K、HellaSwag、MMLU和WinoGrande等多样化的推理与知识任务。这一评估数据集不仅填补了韩语LLM在标准化基准上的空白,更为跨语言模型性能比较提供了关键参考,推动了多语言NLP研究的公平性与可复现性。
当前挑战
KoRWKV-6B评估数据集面临的核心挑战在于多维度性能瓶颈的破解。领域问题层面,模型在GSM8K数学推理任务上准确率为0%,暴露出韩语模型在符号推理与数值计算上的根本性缺陷;DROP阅读理解任务中F1分数仅5.8%,凸显了复杂上下文信息提取能力的不足。构建过程中,评估体系需应对64个任务配置的异构性,从MMLU的57个学科到WinoGrande的歧义消解,每个子任务对韩语形态句法的敏感度各异,导致结果聚合时难以形成统一的性能度量标准。此外,数据集仅包含两轮运行记录,时间跨度从2023年10月4日至26日,采样稀疏性限制了模型改进方向的精确诊断,亟需更密集的迭代评估来追踪性能演化轨迹。
常用场景
经典使用场景
在大规模语言模型评估领域,Open LLM Leaderboard数据集为模型性能的标准化评测提供了不可或缺的基准。该数据集整合了涵盖常识推理、数学求解、阅读理解等多维度的任务,例如ARC挑战赛、HellaSwag和GSM8K等,使得研究者能够系统性地衡量模型在零样本或少样本条件下的泛化能力。其经典使用场景在于,通过加载特定任务的配置(如winogrande或drop),科研人员可以精确复现模型的评估结果,从而对比不同架构、训练策略或参数规模下的模型表现,为语言模型的迭代优化奠定实证基础。
衍生相关工作
该数据集衍生了一系列重要的后续工作,其中最具代表性的是基于其评测框架的模型优化研究。许多团队利用该数据集的细分任务结果,针对性地设计训练策略,如通过对抗训练提升模型在DROP上的精确匹配分数,或通过思维链提示增强GSM8K的解题能力。此外,该数据集还催生了关于评估指标鲁棒性的探讨,例如分析随机种子对HellaSwag结果的影响,进而推动了更严谨的评测方法论。这些工作共同构成了围绕大模型评测的活跃研究生态。
数据集最近研究
最新研究方向
在大型语言模型评估领域,Open LLM Leaderboard已成为衡量模型综合能力的重要基准平台。针对韩语RWKV模型KoRWKV-6B的评估数据集,其研究前沿聚焦于多任务异构评估框架的构建与细粒度性能剖析。该数据集整合了涵盖常识推理(如Winogrande)、数学推理(GSM8K)、阅读理解(DROP)及多学科知识(MMLU)等64项配置任务,揭示了非自回归架构在非英语语言场景下的表现边界。尤其值得注意的是,模型在Winogrande任务上接近随机水平的准确率(51.1%),以及在GSM8K上完全失效的零分表现,突显了当前RWKV架构在复杂推理与符号计算方面的结构性短板。这一系统性评估不仅为韩语大模型的迭代优化提供了量化标尺,更推动了多语言、多维度评测范式的标准化进程,对构建更具鲁棒性的通用语言模型具有重要启示。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务