遇见数据集

open-llm-leaderboard/details_hamxea__Llama-2-7b-chat-hf-activity-fine-tuned-v4

收藏
Hugging Face2024-03-31 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是在Open LLM Leaderboard上对模型hamxea/Llama-2-7b-chat-hf-activity-fine-tuned-v4进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果存储在不同的分割中,分割名称使用运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

该数据集是在Open LLM Leaderboard上对模型hamxea/Llama-2-7b-chat-hf-activity-fine-tuned-v4进行评估时自动创建的。数据集由63个配置组成,每个配置对应一个评估任务。数据集由2次运行生成,每次运行的结果存储在不同的分割中,分割名称使用运行的时间戳命名。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,用于在Open LLM Leaderboard上计算和显示聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集名称

  • pretty_name: Evaluation run of hamxea/Llama-2-7b-chat-hf-activity-fine-tuned-v4

数据集描述

数据集组成

  • 数据结构: 包含63个配置,每个配置对应一个评估任务。
  • 数据来源: 数据集由2次运行创建,每次运行对应一个特定的分割,分割名称使用运行的时间戳命名。
  • 特殊配置: “results”配置存储所有运行的聚合结果,用于计算和显示Open LLM Leaderboard上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_hamxea__Llama-2-7b-chat-hf-activity-fine-tuned-v4", "harness_winogrande_5", split="train")

最新结果

  • 结果来源: 来自2024-03-31T18:33:35.231026的运行。
  • 结果内容: 包含多个任务的评估结果,如准确率(acc)、标准误差(acc_stderr)等。

数据集配置详情

配置列表

  • config_name: harness_arc_challenge_25

    • data_files:
      • split: 2024_03_31T18_32_16.094801
        • path: /details_harness|arc:challenge|25_2024-03-31T18-32-16.094801.parquet
      • split: 2024_03_31T18_33_35.231026
        • path: /details_harness|arc:challenge|25_2024-03-31T18-33-35.231026.parquet
      • split: latest
        • path: /details_harness|arc:challenge|25_2024-03-31T18-33-35.231026.parquet
  • config_name: harness_gsm8k_5

    • data_files:
      • split: 2024_03_31T18_32_16.094801
        • path: /details_harness|gsm8k|5_2024-03-31T18-32-16.094801.parquet
      • split: 2024_03_31T18_33_35.231026
        • path: /details_harness|gsm8k|5_2024-03-31T18-33-35.231026.parquet
      • split: latest
        • path: /details_harness|gsm8k|5_2024-03-31T18-33-35.231026.parquet
  • config_name: harness_hellaswag_10

    • data_files:
      • split: 2024_03_31T18_32_16.094801
        • path: /details_harness|hellaswag|10_2024-03-31T18-32-16.094801.parquet
      • split: 2024_03_31T18_33_35.231026
        • path: /details_harness|hellaswag|10_2024-03-31T18-33-35.231026.parquet
      • split: latest
        • path: /details_harness|hellaswag|10_2024-03-31T18-33-35.231026.parquet
  • config_name: harness_hendrycksTest_5

    • data_files:
      • split: 2024_03_31T18_32_16.094801
        • path: /details_harness|hendrycksTest-abstract_algebra|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-anatomy|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-astronomy|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-business_ethics|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-clinical_knowledge|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-college_biology|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-college_chemistry|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-college_computer_science|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-college_mathematics|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-college_medicine|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-college_physics|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-computer_security|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-conceptual_physics|5_2024-03-31T18-32-16.094801.parquet
        • path: /details_harness|hendrycksTest-econometrics|5_2024-03-31T18-32-16.094801.parquet
搜集汇总
数据集介绍
构建方式
该数据集源于对模型 hamxea/Llama-2-7b-chat-hf-activity-fine-tuned-v4 在 Open LLM Leaderboard 上的自动化评测过程。数据集由 63 个配置组成,每个配置对应一项被评测的任务,涵盖 ARC、HellaSwag、GSM8K、TruthfulQA、Winogrande 以及涵盖 57 个学科的 MMLU 子任务。评测共执行了两次运行,每次运行的结果以时间戳命名作为独立的数据分割(split),其中 'train' 分割始终指向最新一次运行的结果。此外,还包含一个名为 'results' 的配置,用于存储所有运行的聚合指标,支撑排行榜上综合得分的计算与展示。
使用方法
研究人员可通过 Hugging Face Datasets 库便捷地加载和使用该数据集。例如,使用 'load_dataset' 函数指定数据集名称 'open-llm-leaderboard/details_hamxea__Llama-2-7b-chat-hf-activity-fine-tuned-v4',并选择具体任务配置(如 'harness_winogrande_5')及分割(如 'train'),即可获取对应评测的详细数据。这种设计支持对单个任务或跨任务的模型表现进行深入分析,便于复现评测结果或开展比较研究。
背景与挑战
背景概述
随着大语言模型(LLM)在自然语言处理领域的广泛应用,如何系统性地评估其多维度能力成为学术界与工业界关注的焦点。Open LLM Leaderboard由Hugging Face团队于2023年发起,旨在为社区提供一个开放、标准化的模型性能对比平台。该数据集记录了hamxea/Llama-2-7b-chat-hf-activity-fine-tuned-v4模型在2024年3月31日进行的两次评估运行结果,覆盖ARC-Challenge、HellaSwag、GSM8K、TruthfulQA、Winogrande及涵盖57个学科的MMLU基准测试。研究团队通过63个配置项精细捕捉模型在常识推理、数学求解、事实一致性及专业知识等维度的表现,其核心研究问题在于量化指令微调对Llama-2-7B基座模型在多样化任务上的影响。该数据集为后续模型优化提供了可复现的评估基线,推动了LLM评测标准的透明化进程。
当前挑战
该数据集所解决的领域问题聚焦于大语言模型评估的标准化与细粒度化挑战。传统单一指标难以反映模型在复杂推理、知识广度与安全性等维度的真实能力,而该数据集通过整合多项基准测试,揭示了模型在抽象代数(30%)与高中物理(29.8%)等学科上的明显短板,以及在道德场景推理(20.7%)中的脆弱性。构建过程中面临的核心挑战包括:多源基准测试的任务格式统一与结果对齐,需确保不同评估框架(如harness)的输出指标具有可比性;时间戳驱动的版本管理要求每次运行结果独立存储,同时维护latest split指向最新数据,增加了数据架构的复杂性;此外,对57个MMLU子任务的高效并发评估对计算资源与调度策略提出了严苛要求。
常用场景
经典使用场景
在大型语言模型评估的学术语境中,该数据集作为Open LLM Leaderboard的标准化评测产物,被广泛应用于对微调后模型(如hamxea/Llama-2-7b-chat-hf-activity-fine-tuned-v4)进行多维度能力检验。其经典使用场景涵盖常识推理(HellaSwag)、科学知识(MMLU系列)、数学求解(GSM8K)及对抗性文本理解(Winogrande)等核心任务,通过记录模型在63个配置下的逐项性能指标,为研究者提供了细粒度的模型行为剖析工具。
解决学术问题
该数据集系统性地解决了大语言模型评估中普遍存在的可复现性与标准化缺失问题。通过统一评测框架(LM Evaluation Harness)生成的结构化结果,它使学术界能够客观比较不同微调策略对模型在推理、知识记忆与鲁棒性方面的实际影响。其意义在于为模型迭代提供了量化基准,推动了从主观定性分析向数据驱动评估范式的转变,并揭示了微调后模型在特定学科(如医学、法学)与通用常识任务之间的性能权衡。
实际应用
在实际应用中,该数据集为AI系统的质量保障与部署决策提供了关键参考。企业或研究机构可依据其评测结果,筛选在特定领域(如教育辅导、医疗问答)表现最优的模型版本,例如基于MML子集得分判断模型在医学知识上的掌握程度。同时,其细粒度错误分析功能有助于开发者定位模型在数学推理或事实性知识上的薄弱环节,从而针对性地优化训练数据或微调策略,降低部署后产生错误输出的风险。
数据集最近研究
最新研究方向
当前,大语言模型的性能评估正从单一指标向多维度、细粒度的基准体系演进。本研究围绕Open LLM Leaderboard上对Llama-2-7b-chat-hf活动微调版本的评估数据展开,数据集涵盖ARC挑战赛、HellaSwag、GSM8K、MMLU及TruthfulQA等63项任务配置,系统性地追踪模型在常识推理、数学求解、知识理解与事实一致性等关键维度的表现。这一评估框架不仅为模型迭代提供了可复现的量化依据,更推动了开源社区对微调策略有效性的深入探讨。随着多任务评测成为衡量模型泛化能力的核心手段,该数据集所反映的细粒度性能剖面,正成为指导后续模型优化与对齐研究的重要风向标。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务