遇见数据集

open-llm-leaderboard/details_OpenBuddy__openbuddy-qwen1.5-32b-v21.2-32k

收藏
Hugging Face2024-04-15 更新2024-06-12 收录
官方服务:

资源简介:

该数据集是在评估模型OpenBuddy/openbuddy-qwen1.5-32b-v21.2-32k时自动创建的,评估是在Open LLM Leaderboard上进行的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置中找到,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型OpenBuddy/openbuddy-qwen1.5-32b-v21.2-32k时自动创建的,评估是在Open LLM Leaderboard上进行的。数据集由63个配置组成,每个配置对应一个评估任务。数据集是从1次运行中创建的,每次运行都可以在特定配置中找到,分割名称使用运行的时间戳。"train"分割始终指向最新的结果。此外,还有一个名为"results"的配置,存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集名称

  • pretty_name: Evaluation run of OpenBuddy/openbuddy-qwen1.5-32b-v21.2-32k

数据集描述

数据集组成

  • 数据结构: 包含63个配置,每个配置对应一个评估任务。
  • 数据来源: 数据集由1次运行创建,每次运行在每个配置中作为一个特定的分割存在,分割名称使用运行的时间戳命名。
  • 特殊配置: 存在一个名为"results"的额外配置,用于存储所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

数据加载示例

  • 加载代码: python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_OpenBuddy__openbuddy-qwen1.5-32b-v21.2-32k", "harness_winogrande_5", split="train")

最新结果

  • 结果来源: 最新结果来自run 2024-04-15T21:59:46.714800
  • 结果内容: 包括多个任务的评估结果,如准确率(acc)、标准误差(acc_stderr)等。

数据集配置详情

  • 配置列表:
    • config_name: harness_arc_challenge_25
    • config_name: harness_gsm8k_5
    • config_name: harness_hellaswag_10
    • config_name: harness_hendrycksTest_5
  • 数据文件路径: 每个配置包含多个数据文件,路径根据不同的分割(如时间戳分割和最新分割)进行组织。
搜集汇总
数据集介绍
open-llm-leaderboard/details_OpenBuddy__openbuddy-qwen1.5-32b-v21.2-32k 数据集图片
构建方式
在大规模语言模型评估领域,Open LLM Leaderboard 作为权威基准平台,其评估数据集构建遵循严谨的自动化流程。该数据集专为评估 OpenBuddy/openbuddy-qwen1.5-32b-v21.2-32k 模型而生,源自 Leaderboard 的一次完整评估运行。数据集由 63 个配置构成,每个配置对应一项被评估的任务,例如 ARC-Challenge、HellaSwag、GSM8K 等。每个运行结果被存储为特定时间戳命名的分割(split),而“train”分割始终指向最新运行结果,确保数据时效性。此外,额外配置“results”汇总了所有任务的聚合指标,用于在 Leaderboard 界面上展示模型的综合性能。
特点
该数据集的核心特点在于其结构化的多任务评估体系与版本管理机制。它涵盖了从常识推理、数学问题到多学科知识问答的广泛任务,如 Winogrande 的代词消解、TruthfulQA 的诚实性测试以及 MMLU 中 57 个学科的子任务,能够全面衡量模型在零样本或少样本场景下的能力。每个配置均包含详细的准确性指标及其标准误差,为研究者提供细粒度的性能分析。时间戳分割的设计允许用户追溯历史评估结果,便于追踪模型迭代过程中的性能演变,而“latest”分割则保证了数据引用的便捷性。
使用方法
研究者可通过 Hugging Face Datasets 库便捷地加载该数据集。例如,使用 `load_dataset` 函数指定数据集名称和配置名称(如 `"harness_winogrande_5"`),并选择 `split="train"` 即可获取最新评估结果。数据集以 Parquet 格式存储,支持高效读取。用户可根据需求选取特定任务配置,或利用“results”配置获取全局聚合指标。此外,通过修改分割参数为时间戳字符串(如 `"2024_04_15T21_59_46.714800"`),可回溯历史运行数据,为模型对比分析提供灵活支持。
背景与挑战
背景概述
在大型语言模型(LLM)迅猛发展的浪潮中,如何系统性地评估模型的多维度能力已成为学界与工业界共同关注的核心议题。Open LLM Leaderboard由HuggingFace团队于2023年发起,旨在为开源LLM提供标准化、可复现的评测框架,其影响力迅速辐射至全球AI社区。本研究聚焦于OpenBuddy团队于2024年4月提交的openbuddy-qwen1.5-32b-v21.2-32k模型评测数据,该模型基于Qwen1.5-32B架构,通过对话微调与32k上下文扩展技术,致力于在通用知识与推理任务上取得突破。该数据集记录了模型在63项细分任务上的表现,涵盖ARC挑战赛、HellaSwag常识推理、GSM8K数学推理及涵盖57个学科的大规模多任务语言理解(MMLU)测试,其评测结果不仅揭示了模型在专业领域(如医学、法律)的潜力,也为后续模型优化提供了关键基准。
当前挑战
该数据集所反映的核心挑战在于:1)领域问题层面,LLM在数学推理(GSM8K准确率仅15.5%)与抽象代数(准确率39%)等逻辑密集型任务上表现羸弱,暴露了当前模型在符号运算与多步推理方面的结构性短板;2)构建过程中,评测框架需同时兼容57个MMLU子任务与7类基础能力测试,导致配置管理复杂度激增——数据集包含63个独立配置,每个配置需对应不同任务模板与评估指标(如acc、acc_norm、mc1等),且需处理多次运行结果的时间戳分片,这对数据版本控制与结果复现构成了严峻挑战;3)模型在TruthfulQA上的mc1准确率仅42.8%,揭示了生成内容事实一致性不足的深层问题,这要求评测数据不仅关注精度,更需纳入对抗性样本与幻觉检测机制。
常用场景
经典使用场景
在大型语言模型(LLM)迅猛发展的时代背景下,OpenBuddy/openbuddy-qwen1.5-32b-v21.2-32k的评估数据集应运而生,为模型性能的量化评测提供了标准化基准。该数据集最经典的使用场景是在Open LLM Leaderboard框架下,对模型在63个多样化任务上的表现进行系统性评估。这些任务涵盖常识推理(如ARC-Challenge、HellaSwag)、数学求解(GSM8K)、多学科知识(MMLU)以及语言理解(Winogrande)等核心维度,研究者可借助该数据集剖析模型在零样本或少样本条件下的泛化能力与鲁棒性。
衍生相关工作
该数据集衍生了一系列具有深远影响的经典工作。Open LLM Leaderboard本身即成为模型评测的标杆平台,催生了诸如HuggingFaceH4等组织对评测流程的持续优化。围绕该数据集,研究者提出了多种改进型评估策略,例如引入任务难度加权、探索少样本示例的选取方式,以及分析模型在不同学科知识上的表现模式。这些工作进一步深化了对LLM能力结构的理解,并推动了更精细化的评测工具与基准测试集的开发。
数据集最近研究
最新研究方向
在大型语言模型(LLM)评估领域,OpenBuddy团队开源的Qwen1.5-32B-v21.2-32k模型通过Open LLM Leaderboard的标准化评测,揭示了当前多任务泛化能力的前沿进展。该模型在ARC-Challenge、HellaSwag、MMLU等57项涵盖科学、人文、数学等领域的基准测试中展现了均衡的性能,尤其在HellaSwag常识推理任务上达到83.2%的准确率,在MMLU的微观经济学与市场营销子集上分别取得82.4%和93.6%的优异成绩。这些结果不仅验证了基于Qwen架构的32B参数模型在知识密集型任务上的竞争力,更凸显了开源社区推动长上下文理解与多领域知识融合的显著成效。该数据集的持续迭代与公开评估,为研究者提供了可复现的对比基准,加速了LLM在复杂推理与专业问答场景中的落地验证。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务