遇见数据集

open-llm-leaderboard-old/details_Qwen__Qwen1.5-4B-Chat

收藏
Hugging Face2024-02-12 更新2024-06-22 收录
官方服务:

资源简介:

该数据集是在评估模型Qwen/Qwen1.5-4B-Chat时自动创建的,主要用于在Open LLM Leaderboard上进行评估。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

该数据集是在评估模型Qwen/Qwen1.5-4B-Chat时自动创建的,主要用于在Open LLM Leaderboard上进行评估。数据集包含63个配置,每个配置对应一个评估任务。数据集由1次运行生成,每次运行的结果作为一个特定的分割存储,分割名称使用运行的时间戳。train分割始终指向最新的结果。此外,还有一个名为results的配置,存储了所有运行的聚合结果,并用于计算和显示Open LLM Leaderboard上的聚合指标。

原始信息汇总

数据集概述

数据集名称

Evaluation run of Qwen/Qwen1.5-4B-Chat

数据集描述

该数据集是在模型 Qwen/Qwen1.5-4B-ChatOpen LLM Leaderboard 上的评估运行期间自动创建的。

数据集组成

  • 数据集包含 63 个配置,每个配置对应一个评估任务。
  • 数据集从 1 次运行中创建,每个运行可以在每个配置中作为一个特定的分片找到,分片名称使用运行的时间戳。
  • "train" 分片始终指向最新的结果。
  • 一个额外的配置 "results" 存储所有运行的聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

数据加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_Qwen__Qwen1.5-4B-Chat", "harness_winogrande_5", split="train")

最新结果

以下是 2024-02-12T18:02:11.797174 运行的最新结果

python { "all": { "acc": 0.5452693175035633, "acc_stderr": 0.033961232333256236, "acc_norm": 0.555864434515964, "acc_norm_stderr": 0.03480885079816102, "mc1": 0.29253365973072215, "mc1_stderr": 0.015925597445286165, "mc2": 0.4479029862950014, "mc2_stderr": 0.015185042808380176 }, "harness|arc:challenge|25": { "acc": 0.4044368600682594, "acc_stderr": 0.014342036483436175, "acc_norm": 0.4325938566552901, "acc_norm_stderr": 0.014478005694182528 }, "harness|hellaswag|10": { "acc": 0.5170284803823939, "acc_stderr": 0.004986886806565644, "acc_norm": 0.6972714598685521, "acc_norm_stderr": 0.004584997935360418 }, "harness|hendrycksTest-abstract_algebra|5": { "acc": 0.37, "acc_stderr": 0.048523658709391, "acc_norm": 0.37, "acc_norm_stderr": 0.048523658709391 }, "harness|hendrycksTest-anatomy|5": { "acc": 0.43703703703703706, "acc_stderr": 0.04284958639753399, "acc_norm": 0.43703703703703706, "acc_norm_stderr": 0.04284958639753399 }, "harness|hendrycksTest-astronomy|5": { "acc": 0.5986842105263158, "acc_stderr": 0.039889037033362836, "acc_norm": 0.5986842105263158, "acc_norm_stderr": 0.039889037033362836 }, "harness|hendrycksTest-business_ethics|5": { "acc": 0.64, "acc_stderr": 0.04824181513244218, "acc_norm": 0.64, "acc_norm_stderr": 0.04824181513244218 }, "harness|hendrycksTest-clinical_knowledge|5": { "acc": 0.5962264150943396, "acc_stderr": 0.03019761160019795, "acc_norm": 0.5962264150943396, "acc_norm_stderr": 0.03019761160019795 }, "harness|hendrycksTest-college_biology|5": { "acc": 0.5138888888888888, "acc_stderr": 0.04179596617581, "acc_norm": 0.5138888888888888, "acc_norm_stderr": 0.04179596617581 }, "harness|hendrycksTest-college_chemistry|5": { "acc": 0.47, "acc_stderr": 0.05016135580465919, "acc_norm": 0.47, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_computer_science|5": { "acc": 0.47, "acc_stderr": 0.05016135580465919, "acc_norm": 0.47, "acc_norm_stderr": 0.05016135580465919 }, "harness|hendrycksTest-college_mathematics|5": { "acc": 0.32, "acc_stderr": 0.04688261722621504, "acc_norm": 0.32, "acc_norm_stderr": 0.04688261722621504 }, "harness|hendrycksTest-college_medicine|5": { "acc": 0.5433526011560693, "acc_stderr": 0.03798106566014498, "acc_norm": 0.5433526011560693, "acc_norm_stderr": 0.03798106566014498 }, "harness|hendrycksTest-college_physics|5": { "acc": 0.3431372549019608, "acc_stderr": 0.04724007352383888, "acc_norm": 0.3431372549019608, "acc_norm_stderr": 0.04724007352383888 }, "harness|hendrycksTest-computer_security|5": { "acc": 0.72, "acc_stderr": 0.045126085985421276, "acc_norm": 0.72, "acc_norm_stderr": 0.045126085985421276 }, "harness|hendrycksTest-conceptual_physics|5": { "acc": 0.44680851063829785, "acc_stderr": 0.0325005368436584, "acc_norm": 0.44680851063829785, "acc_norm_stderr": 0.0325005368436584 }, "harness|hendrycksTest-econometrics|5": { "acc": 0.35964912280701755, "acc_stderr": 0.045144961328736334, "acc_norm": 0.35964912280701755, "acc_norm_stderr": 0.045144961328736334 }, "harness|hendrycksTest-electrical_engineering|5": { "acc": 0.5517241379310345, "acc_stderr": 0.041443118108781526, "acc_norm": 0.5517241379310345, "acc_norm_stderr": 0.041443118108781526 }, "harness|hendrycksTest-elementary_mathematics|5": { "acc": 0.4312169312169312, "acc_stderr": 0.0255064816981382, "acc_norm": 0.4312169312169312, "acc_norm_stderr": 0.0255064816981382 }, "harness|hendrycksTest-formal_logic|5": { "acc": 0.3253968253968254, "acc_stderr": 0.04190596438871136, "acc_norm": 0.3253968253968254, "acc_norm_stderr": 0.04190596438871136 }, "harness|hendrycksTest-global_facts|5": { "acc": 0.35, "acc_stderr": 0.047937248544110196, "acc_norm": 0.35, "acc_norm_stderr": 0.047937248544110196 }, "harness|hendrycksTest-high_school_biology|5": { "acc": 0.6612903225806451, "acc_stderr": 0.026923446059302837, "acc_norm": 0.6612903225806451, "acc_norm_stderr": 0.026923446059302837 }, "harness|hendrycksTest-high_school_chemistry|5": { "acc": 0.43842364532019706, "acc_stderr": 0.03491207857486519, "acc_norm": 0.43842364532019706, "acc_norm_stderr": 0.03491207857486519 }, "harness|hendrycksTest-high_school_computer_science|5": { "acc": 0.6, "acc_stderr": 0.04923659639173309, "acc_norm": 0.6, "acc_norm_stderr": 0.04923659639173309 }, "harness|hendrycksTest-high_school_european_history|5": { "acc": 0.6666666666666666, "acc_stderr": 0.036810508691615486, "acc_norm": 0.6666666666666666, "acc_norm_stderr": 0.036810508691615486 }, "harness|hendrycksTest-high_school_geography|5": { "acc": 0.7575757575757576, "acc_stderr": 0.030532892233932022, "acc_norm": 0.7575757575757576, "acc_norm_stderr": 0.030532892233932022 }, "harness|hendrycksTest-high_school_government_and_politics|5": { "acc": 0.7668393782383419, "acc_stderr": 0.03051611137147602, "acc_norm": 0.7668393782383419, "acc_norm_stderr": 0.03051611137147602 }, "harness|hendrycksTest-high_school_macroeconomics|5": { "acc": 0.5256410256410257, "acc_stderr": 0.025317649726448663, "acc_norm": 0.5256410256410257, "acc_norm_stderr": 0.025317649726448663 }, "harness|hendrycksTest-high_school_mathematics|5": { "acc": 0.36666666666666664, "acc_stderr": 0.029381620726465076, "acc_norm": 0.36666

搜集汇总
数据集介绍
构建方式
在大型语言模型评估领域,Open LLM Leaderboard 作为一个标准化评测平台,其评估结果的数据集构建至关重要。本数据集系针对 Qwen/Qwen1.5-4B-Chat 模型在 Open LLM Leaderboard 上进行评估时自动生成的产物。数据集由 63 个配置组成,每个配置对应一项被评估的任务,涵盖了从常识推理到专业知识问答的广泛维度。数据来源于单次运行,每次运行的结果以时间戳命名作为特定分割,而 'train' 分割则始终指向最新一次的评估结果。此外,还设有 'results' 配置,用于存储所有任务的聚合成绩,为排行榜上综合指标的展示提供基础。
特点
该数据集的结构设计展现出高度的系统性与灵活性。其核心特色在于以任务为单位的配置划分,使得研究者可以精准定位特定任务的评估细节,例如 ARC Challenge、HellaSwag、GSM8K 及涵盖 57 个学科的 MMLU 测试。每次评估运行都作为一个独立的分割被保留,便于进行历史结果的追溯与对比,而 'latest' 分割则确保了数据的新鲜度。数据集记录的指标丰富,包括准确率(acc)、标准化准确率(acc_norm)以及 TruthfulQA 任务特有的 mc1 和 mc2 得分,并附带了标准差(stderr),为模型性能的统计显著性分析提供了坚实的数据基础。
使用方法
研究人员可通过 HuggingFace 的 datasets 库便捷地加载与使用本数据集。加载时需指定任务对应的配置名称,例如 'harness_winogrande_5',并通过 split 参数选择具体的时间戳分割或 'train' 分割以获取最新结果。数据集以高效的 Parquet 格式存储,支持大规模数据的快速读取。通过遍历不同任务的配置,用户可以复现模型在 Open LLM Leaderboard 上的全部评估结果,或针对特定能力维度进行深入的性能剖析,从而为模型优化与迭代提供量化依据。
背景与挑战
背景概述
在大型语言模型(LLM)蓬勃发展的浪潮中,如何系统、公正地评估模型的综合能力成为学术界与工业界共同关注的焦点。Open LLM Leaderboard作为HuggingFace社区发起的一项标杆性评估平台,旨在通过标准化测试集对主流开源模型进行多维度性能度量。该数据集记录了对阿里云Qwen团队于2024年2月发布的Qwen1.5-4B-Chat模型的详细评估结果,由HuggingFace研究团队(主要联系人Clémentine)主导创建。其核心研究问题在于量化该4B参数规模对话模型在常识推理(如ARC、HellaSwag)、数学解题(GSM8K)、知识问答(MMLU的57个学科)及安全性(TruthfulQA)等任务上的表现。该数据集不仅为开发者提供了模型优化方向的实证依据,更推动了社区对LLM评估标准化进程的深入思考,成为衡量中等规模开源模型能力的重要参照。
当前挑战
该数据集所解决的领域挑战在于构建一个覆盖多学科、多难度的统一评估框架,以克服传统单一任务评测的片面性。具体而言,Qwen1.5-4B-Chat在GSM8K数学推理任务上准确率仅2.43%,暴露出当前模型在符号推理与多步计算方面的显著短板;在MMLU的大学数学、形式逻辑等子集上表现欠佳(准确率低于40%),揭示了模型对抽象逻辑与高阶专业知识的理解深度不足。数据集构建过程中面临的挑战包括:如何确保57个MMLU子任务间评分标准的一致性,如何平衡各任务采样数量以避免统计偏差,以及如何通过Parquet格式高效存储数十万条评估样本的细粒度结果。此外,不同评测时间戳的分裂设计虽便于追踪模型迭代,但也增加了数据版本管理的复杂性。
常用场景
经典使用场景
在自然语言处理与大型语言模型评估的学术前沿,Open LLM Leaderboard 上针对 Qwen1.5-4B-Chat 的评测数据集,为研究者提供了一套标准化、多维度的模型能力度量体系。该数据集涵盖了从常识推理(如 ARC-Challenge、HellaSwag)到数学求解(GSM8K)、从知识问答(MMLU 涵盖 57 个学科)到对抗性真实性检测(TruthfulQA)的经典任务,共计 63 个配置项。研究者可借此系统性地剖析模型在零样本或少样本设定下的泛化能力、知识广度与逻辑推理水平,从而在公平基准上比较不同架构与训练策略的优劣。
解决学术问题
该数据集核心解决了大语言模型评估中缺乏统一、细粒度评测基准的学术困境。通过整合 ARC、HellaSwag、MMLU、TruthfulQA 及 Winogrande 等权威测试集,它使研究者能够精准定位模型在知识记忆、常识推理、数学计算与事实一致性等维度的能力边界。例如,Qwen1.5-4B-Chat 在 GSM8K 上仅获 2.4% 的准确率,揭示了小型对话模型在复杂数学推理上的显著瓶颈。这些细粒度结果促进了针对模型薄弱环节的专项优化研究,推动了鲁棒性与可解释性评估方法论的演进。
衍生相关工作
该数据集催生了一系列围绕大模型能力剖析与改进的经典工作。基于其评测结果,研究者提出了针对数学推理的 Chain-of-Thought 微调策略,显著提升了模型在 GSM8K 上的表现;同时,MMLU 的学科级得分推动了知识增强型预训练方法的探索,例如通过领域数据混合训练来弥补模型在抽象代数、形式逻辑等弱项上的不足。此外,TruthfulQA 的细粒度错误分析启发了事实性对齐技术(如 RLAIF)的发展,这些工作共同构成了从诊断到干预的闭环研究范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务