遇见数据集

open-llm-leaderboard/details_Azure99__blossom-v5-llama3-8b

收藏
Hugging Face2024-04-20 更新2024-06-12 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型Azure99/blossom-v5-llama3-8b进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集包含一次运行的结果,每次运行在每个配置中表示为特定的分割,train分割始终指向最新结果。此外,名为results的配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用`datasets`库中的`load_dataset`函数加载运行细节的示例。还包括了2024年4月20日运行的最新结果,显示了不同任务的各种准确率指标。

该数据集是在Open LLM Leaderboard上对模型Azure99/blossom-v5-llama3-8b进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集包含一次运行的结果,每次运行在每个配置中表示为特定的分割,train分割始终指向最新结果。此外,名为results的配置存储了所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。README还提供了如何使用`datasets`库中的`load_dataset`函数加载运行细节的示例。还包括了2024年4月20日运行的最新结果,显示了不同任务的各种准确率指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集名称

  • pretty_name: Evaluation run of Azure99/blossom-v5-llama3-8b

数据集描述

数据集组成

  • 包含63个配置,每个配置对应一个评估任务。
  • 数据集由1次运行创建,每次运行以时间戳命名的特定分割形式存在。
  • “train”分割始终指向最新结果。
  • 额外配置“results”存储所有运行结果的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

数据集加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Azure99__blossom-v5-llama3-8b", "harness_winogrande_5", split="train")

最新结果

数据集配置详情

配置列表

  • config_name: harness_arc_challenge_25

    • data_files:
      • split: 2024_04_20T13_22_39.661617
        • path: **/details_harness|arc:challenge|25_2024-04-20T13-22-39.661617.parquet
      • split: latest
        • path: **/details_harness|arc:challenge|25_2024-04-20T13-22-39.661617.parquet
  • config_name: harness_gsm8k_5

    • data_files:
      • split: 2024_04_20T13_22_39.661617
        • path: **/details_harness|gsm8k|5_2024-04-20T13-22-39.661617.parquet
      • split: latest
        • path: **/details_harness|gsm8k|5_2024-04-20T13-22-39.661617.parquet
  • config_name: harness_hellaswag_10

    • data_files:
      • split: 2024_04_20T13_22_39.661617
        • path: **/details_harness|hellaswag|10_2024-04-20T13-22-39.661617.parquet
      • split: latest
        • path: **/details_harness|hellaswag|10_2024-04-20T13-22-39.661617.parquet
  • config_name: harness_hendrycksTest_5

    • data_files:
      • split: 2024_04_20T13_22_39.661617
        • path:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-astronomy|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-business_ethics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-clinical_knowledge|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-college_biology|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-college_chemistry|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-college_computer_science|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-college_mathematics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-college_medicine|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-college_physics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-computer_security|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-conceptual_physics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-econometrics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-electrical_engineering|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-elementary_mathematics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-formal_logic|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-global_facts|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_biology|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_chemistry|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_computer_science|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_european_history|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_geography|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_government_and_politics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_macroeconomics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_mathematics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_microeconomics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_physics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_psychology|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_statistics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_us_history|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-high_school_world_history|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-human_aging|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-human_sexuality|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-international_law|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-jurisprudence|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-logical_fallacies|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-machine_learning|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-management|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-marketing|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-medical_genetics|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-miscellaneous|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-moral_disputes|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-moral_scenarios|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-nutrition|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-philosophy|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-prehistory|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-professional_accounting|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-professional_law|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-professional_medicine|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-professional_psychology|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-public_relations|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-security_studies|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-sociology|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-us_foreign_policy|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-virology|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-world_religions|5_2024-04-20T13-22-39.661617.parquet
      • split: latest
        • path:
          • **/details_harness|hendrycksTest-abstract_algebra|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hendrycksTest-anatomy|5_2024-04-20T13-22-39.661617.parquet
          • **/details_harness|hend
搜集汇总
数据集介绍
构建方式
在大型语言模型的性能评估领域,Open LLM Leaderboard 作为一个标准化的评测平台,为模型提供了多维度的能力检验。该数据集是模型 Azure99/blossom-v5-llama3-8b 在 Open LLM Leaderboard 上进行评估时自动生成的副产品,涵盖了 63 个评测任务配置,每个配置对应一项特定的评估任务。数据集的构建基于单次运行,每次运行的详细结果以时间戳命名的分割形式存储于各配置中,而 'train' 分割则始终指向最新一次评估的产出。此外,一个名为 'results' 的额外配置汇集了所有聚合指标,用于在排行榜上呈现模型的综合表现。
特点
该数据集的核心特色在于其系统化与结构化的组织方式。它囊括了从常识推理(如 ARC-Challenge、HellaSwag)到数学问题求解(GSM8K)、从多学科知识(HendrycksTest 系列涵盖 57 个学科)到语言理解(Winogrande)等广泛的能力测试。每个任务配置内部以 Parquet 格式存储细粒度的评估细节,包括准确率及其标准差等统计量,为深入分析模型在不同维度上的优劣提供了可靠数据。这种多任务、多配置的设计使得研究者能够一站式获取模型在数十项基准上的完整评估档案。
使用方法
用户可通过 Hugging Face 的 datasets 库便捷地加载该数据集。例如,若要获取模型在 Winogrande 任务上的详细评估结果,只需执行 `load_dataset("open-llm-leaderboard/details_Azure99__blossom-v5-llama3-8b", "harness_winogrande_5", split="train")`,即可获得最新的评估数据。对于希望查看历史运行结果的用户,可通过指定具体时间戳分割来追溯特定批次的表现。此外,'results' 配置提供了汇总的聚合指标,便于快速获取模型在全部任务上的整体性能概览。
背景与挑战
背景概述
该数据集由Hugging Face社区于2024年4月创建,旨在系统评估Azure99团队开发的blossom-v5-llama3-8b模型在开放大语言模型排行榜(Open LLM Leaderboard)上的综合性能。作为llama3架构的衍生变体,blossom-v5-llama3-8b聚焦于中文语境下的多任务推理能力,其评估体系涵盖ARC挑战赛、HellaSwag常识推理、GSM8K数学问题及涵盖57个学科的MMLU基准测试等核心任务。该数据集通过标准化评测框架,为研究社区提供了可复现的模型性能基准,尤其在大规模语言模型的横向对比与领域适应性分析中具有重要参考价值,推动了中文大模型生态的透明化评估进程。
当前挑战
当前数据集面临的挑战主要体现在三个层面:其一,模型在数学推理(GSM8K准确率44.4%)与抽象代数(MMLU子项仅32%)等逻辑密集型任务上表现薄弱,揭示了大语言模型在符号计算与形式化推理领域的系统性局限;其二,评测过程中需处理63个异构配置的标准化集成问题,包括任务格式差异、评估指标多样性(如acc_norm与mc2的统计一致性)及时间戳管理带来的版本控制复杂性;其三,数据构建面临多源基准的分词策略冲突与few-shot范例选择的敏感性挑战,例如HellaSwag任务中acc与acc_norm的显著差异(63% vs 83%)暗示了归一化策略对评估结果的非平凡影响。
常用场景
经典使用场景
该数据集作为Open LLM Leaderboard评估框架的核心组成部分,系统性地记录了Azure99/blossom-v5-llama3-8b模型在63项标准任务上的细粒度表现。经典使用场景涵盖多维度能力测评,包括常识推理(如ARC-Challenge、HellaSwag)、数学求解(GSM8K)、知识问答(MMLU涵盖57个学科子集)以及反事实推理(TruthfulQA)等。研究者可通过加载特定配置下的parquet文件,精准复现模型在每项任务中的准确率与标准误差,为模型性能的横向对比与纵向追踪提供可靠数据支撑。
衍生相关工作
围绕该数据集衍生了一系列模型优化与评估方法论研究。基于其公开的评估结果,研究者提出了针对blossom-v5-llama3-8b的知识蒸馏策略,通过分析其在不同学科MMLU子集上的表现差异,设计出学科自适应微调框架。此外,数据集中的细粒度错误分布已被用于构建模型能力诊断图,启发后续工作如基于任务难度的课程学习策略与多任务协同训练方法,显著提升了模型在低分任务(如大学数学30%准确率)上的泛化性能。
数据集最近研究
最新研究方向
在大型语言模型评测领域,blossom-v5-llama3-8b模型在Open LLM Leaderboard上的评估数据集揭示了当前前沿研究方向正聚焦于多维度、细粒度的能力量化。该数据集通过63个配置覆盖了从常识推理(如HellaSwag、Winogrande)到数学求解(GSM8K)、多学科知识(MMLU)及事实一致性(TruthfulQA)等任务,反映出业界对模型泛化能力与鲁棒性的深度关注。结合Llama 3系列模型发布后引发的开源社区热潮,此类系统化评测不仅为模型迭代提供了可复现的基准,更推动了透明化、标准化评估范式的建立,对构建可信赖的大模型生态具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务