遇见数据集

open-llm-leaderboard-old/details_BELLE-2__BELLE-Llama2-13B-chat-0.4M

收藏
Hugging Face2023-10-26 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在模型BELLE-2/BELLE-Llama2-13B-chat-0.4M在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。它由2次运行创建,每次运行在每个配置中作为一个特定的分割找到。train分割始终指向最新的结果。一个额外的配置results存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了一个如何使用`load_dataset`函数加载运行细节的示例。

该数据集是在模型BELLE-2/BELLE-Llama2-13B-chat-0.4M在Open LLM Leaderboard上的评估运行期间自动创建的。数据集由64个配置组成,每个配置对应一个评估任务。它由2次运行创建,每次运行在每个配置中作为一个特定的分割找到。train分割始终指向最新的结果。一个额外的配置results存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了一个如何使用`load_dataset`函数加载运行细节的示例。

原始信息汇总

数据集概述

数据集简介

该数据集是在评估模型BELLE-2/BELLE-Llama2-13B-chat-0.4MOpen LLM Leaderboard上的运行过程中自动创建的。

数据集结构

  • 数据集包含64个配置,每个配置对应一个评估任务。
  • 数据集从2次运行中创建,每次运行可以在每个配置中找到特定的分割,分割名称使用运行的时间戳。
  • "train"分割始终指向最新的结果。
  • 一个额外的配置"results"存储所有运行的聚合结果,用于计算和显示在Open LLM Leaderboard上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_BELLE-2__BELLE-Llama2-13B-chat-0.4M", "harness_winogrande_5", split="train")

最新结果

以下是来自2023-10-26T14:37:54.228887运行的最新结果: python { "all": { "em": 0.28492030201342283, "em_stderr": 0.004622517599527834, "f1": 0.36695364932886015, "f1_stderr": 0.004514579216323901, "acc": 0.4496880334950361, "acc_stderr": 0.010877118313612513 }, "harness|drop|3": { "em": 0.28492030201342283, "em_stderr": 0.004622517599527834, "f1": 0.36695364932886015, "f1_stderr": 0.004514579216323901 }, "harness|gsm8k|5": { "acc": 0.14404852160727824, "acc_stderr": 0.009672110973065286 }, "harness|winogrande|5": { "acc": 0.755327545382794, "acc_stderr": 0.012082125654159738 } }

配置详情

以下是部分配置及其数据文件路径:

配置:harness_arc_challenge_25

  • 分割:2023_10_01T13_36_40.123057
    • 路径:**/details_harness|arc:challenge|25_2023-10-01T13-36-40.123057.parquet
  • 分割:latest
    • 路径:**/details_harness|arc:challenge|25_2023-10-01T13-36-40.123057.parquet

配置:harness_drop_3

  • 分割:2023_10_26T14_37_54.228887
    • 路径:**/details_harness|drop|3_2023-10-26T14-37-54.228887.parquet
  • 分割:latest
    • 路径:**/details_harness|drop|3_2023-10-26T14-37-54.228887.parquet

配置:harness_gsm8k_5

  • 分割:2023_10_26T14_37_54.228887
    • 路径:**/details_harness|gsm8k|5_2023-10-26T14-37-54.228887.parquet
  • 分割:latest
    • 路径:**/details_harness|gsm8k|5_2023-10-26T14-37-54.228887.parquet

配置:harness_hellaswag_10

  • 分割:2023_10_01T13_36_40.123057
    • 路径:**/details_harness|hellaswag|10_2023-10-01T13-36-40.123057.parquet
  • 分割:latest
    • 路径:**/details_harness|hellaswag|10_2023-10-01T13-36-40.123057.parquet

配置:harness_hendrycksTest_5

  • 分割:2023_10_01T13_36_40.123057
    • 路径:
      • **/details_harness|hendrycksTest-abstract_algebra|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-anatomy|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-astronomy|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-business_ethics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-clinical_knowledge|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-college_biology|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-college_chemistry|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-college_computer_science|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-college_mathematics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-college_medicine|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-college_physics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-computer_security|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-conceptual_physics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-econometrics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-electrical_engineering|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-elementary_mathematics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-formal_logic|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-global_facts|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_biology|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_chemistry|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_computer_science|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_european_history|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_geography|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_mathematics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_microeconomics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_physics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_psychology|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_statistics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_us_history|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-high_school_world_history|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-human_aging|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-human_sexuality|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-international_law|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-jurisprudence|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-logical_fallacies|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-machine_learning|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-management|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-marketing|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-medical_genetics|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-miscellaneous|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-moral_disputes|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-moral_scenarios|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-nutrition|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-philosophy|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-prehistory|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-professional_accounting|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-professional_law|5_2023-10-01T13-36-40.123057.parquet
      • **/details_harness|hendrycksTest-professional_medicine|5_2023-10-01T13-36-40.123057.parquet
      • `**/details_harness|
搜集汇总
数据集介绍
构建方式
在大语言模型评估领域,Open LLM Leaderboard 作为一个权威的基准平台,系统化地追踪模型性能的演进。该数据集正是针对 BELLE-2/BELLE-Llama2-13B-chat-0.4M 模型在 Leaderboard 上的评估过程自动生成的产物,其构建逻辑围绕评估任务的多样性展开。数据集由 64 个配置组成,每个配置对应一项被评估的特定任务,如 ARC Challenge、DROP、GSM8K 等,覆盖常识推理、数学计算与知识问答等多个维度。数据来源于两次独立的评估运行,每次运行的结果被存储为对应配置下的独立分割(split),分割名称以运行时间戳命名,而 'train' 分割则始终指向最新一次运行的结果。此外,一个名为 'results' 的额外配置聚合了所有运行的综合指标,用于在 Leaderboard 上计算和展示模型的整体表现。所有数据以 Parquet 格式存储,确保高效读取与处理。
特点
该数据集的核心特点在于其结构化与版本化设计,精准服务于模型评估的可追溯性与可复现性。每个配置下的分割以时间戳区分,使得研究者能够回溯模型在不同时间点的性能变化,这在大模型快速迭代的背景下尤为珍贵。数据集覆盖了从基础推理(如 HellaSwag、WinoGrande)到复杂数学(GSM8K)再到多学科知识(MMLU 的 57 个学科)的广泛任务,体现了评估的全面性与细粒度。'results' 配置提供了聚合后的关键指标,如准确率(acc)、精确匹配率(em)与 F1 分数,并附带标准误差,为模型间的横向对比提供了统计依据。数据以 Parquet 格式存储,具备列式存储的高压缩比与快速查询优势,适合大规模分析与机器学习工作流。
使用方法
使用该数据集时,研究者可通过 HuggingFace 的 datasets 库便捷加载。具体而言,调用 load_dataset 函数并指定数据集名称与目标配置(如 'harness_winogrande_5'),即可获取对应任务的评估细节。通过设置 split 参数为 'train' 可获取最新结果,或使用时间戳名称(如 '2023_10_26T14_37_54.228887')加载历史运行数据,便于进行时间序列分析或复现实验。对于需要全局性能概览的场景,可直接加载 'results' 配置,其中包含了所有任务的聚合指标。数据加载后,可利用 Pandas 或 Dask 等工具对 Parquet 格式的 DataFrame 进行筛选、统计与可视化,从而深入分析模型在不同任务上的优势与不足,为模型优化提供数据驱动的洞察。
背景与挑战
背景概述
随着大语言模型(LLM)技术的迅猛发展,模型能力的量化评估成为推动该领域进步的关键环节。在此背景下,Hugging Face社区于2023年发起了Open LLM Leaderboard项目,旨在通过标准化基准测试对各类开源模型进行横向比较。本数据集即为此项目中对BELLE-2/BELLE-Llama2-13B-chat-0.4M模型进行自动化评测的产物,由Hugging Face团队主导创建,核心联系人Clementine Fourrier负责维护。该数据集聚焦于评估基于Llama2架构、经中文指令微调的13B参数对话模型在多项自然语言理解与推理任务上的表现,涵盖ARC挑战集、DROP、GSM8K、HellaSwag及MMLU等广泛采用的基准。其研究价值在于为中文大模型的性能对标提供了可复现的量化依据,并为后续模型优化与开源生态的透明度建设奠定了数据基础。
当前挑战
该数据集所解决的领域问题在于如何系统性地评估大语言模型在多样复杂任务上的泛化能力,尤其是针对中文语境下指令微调模型的性能瓶颈。具体挑战包括:1)模型在数学推理任务(如GSM8K)上准确率仅达14.4%,暴露出对符号逻辑与多步推导能力的显著不足;2)在需要深层语义理解的DROP阅读理解任务中,F1分数仅为36.7%,表明模型在处理离散实体关系与数值推理时存在局限;3)数据集构建过程中面临多轮评测结果的一致性维护难题,需通过时间戳分片管理不同运行版本,并确保“latest”分片始终指向最新结果,对数据版本控制提出了高要求。
常用场景
经典使用场景
在大型语言模型(LLM)评估领域,该数据集作为Open LLM Leaderboard的标准化评测记录载体,核心用于量化模型在多样化自然语言理解与推理任务上的表现。其经典使用模式为:研究者通过加载特定配置(如harness_winogrande_5)中的最新运行结果,获取模型在常识推理、数学求解(如GSM8K)、文本理解(如DROP)等基准上的精确指标,从而实现对BELLE-Llama2-13B-chat-0.4M这类中文优化模型性能的系统性比较与复现。
衍生相关工作
该数据集衍生了一系列关于LLM评测基准的优化与拓展工作。基于其结构化结果,研究者开发了自动化分析工具,用于跨模型比较各任务上的方差与置信区间。此外,该数据集的配置设计(如harness_hendrycksTest系列涵盖57个学科)启发了后续多领域知识评测体系的构建,如中文领域MMLU的本地化适配。其‘latest’分片机制也成为其他Leaderboard数据集(如LMSYS Chatbot Arena)采纳的模板,推动了评测数据版本管理的规范化。
数据集最近研究
最新研究方向
在大型语言模型评测领域,Open LLM Leaderboard已成为衡量模型综合能力的重要基准平台。针对BELLE-Llama2-13B-chat-0.4M这一中文对话模型的评估数据集,前沿研究方向聚焦于多维度、细粒度的能力剖析。该数据集通过集成DROP、GSM8K、Winogrande等多样化任务,不仅考察模型的文本理解与推理能力,还深入评估其在数学问题求解、常识推理和知识问答等核心维度的表现。最新研究趋势强调从单一指标向多任务联合评估的范式转变,通过记录每次运行的详细结果与误差范围,为模型迭代提供精确的量化反馈。这一评测体系的意义在于推动中文大语言模型从能力展示走向可复现、可比较的标准化评估,为学术界和工业界提供了透明、客观的模型性能参照,进而加速了语言模型在复杂真实场景中的落地应用与优化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务