遇见数据集

open-llm-leaderboard/details_azarafrooz__Mistral-7B-Instruct-v0.2-Selfplay-v0

收藏
Hugging Face2024-03-11 更新2024-06-11 收录
官方服务:

资源简介:

该数据集是在模型 azarafrooz/Mistral-7B-Instruct-v0.2-Selfplay-v0 在 Open LLM Leaderboard 上的评估运行期间自动创建的。它由 63 个配置组成,每个配置对应一个被评估的任务。数据集是从 1 次运行中创建的,每次运行在每个配置中作为一个特定的分割找到,分割名称使用运行的时间戳。train 分割始终指向最新的结果。一个额外的配置 results 存储了运行的所有聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

该数据集是在模型 azarafrooz/Mistral-7B-Instruct-v0.2-Selfplay-v0 在 Open LLM Leaderboard 上的评估运行期间自动创建的。它由 63 个配置组成,每个配置对应一个被评估的任务。数据集是从 1 次运行中创建的,每次运行在每个配置中作为一个特定的分割找到,分割名称使用运行的时间戳。train 分割始终指向最新的结果。一个额外的配置 results 存储了运行的所有聚合结果,用于计算和显示 Open LLM Leaderboard 上的聚合指标。

提供机构:
open-llm-leaderboard
原始信息汇总

数据集概述

数据集名称: Evaluation run of azarafrooz/Mistral-7B-Instruct-v0.2-Selfplay-v0

数据集描述: 该数据集是在评估模型azarafrooz/Mistral-7B-Instruct-v0.2-Selfplay-v0时自动创建的,用于Open LLM Leaderboard

数据集组成:

  • 配置数量: 63个
  • 每个配置: 对应一个评估任务
  • 数据来源: 来自1次运行
  • 数据分割: 每个配置中的数据根据运行时间戳命名,"train"分割指向最新结果
  • 额外配置: "results",存储所有聚合结果,用于计算和显示聚合指标

数据集加载示例

python from datasets import load_dataset data = load_dataset("open-llm-leaderboard/details_azarafrooz__Mistral-7B-Instruct-v0.2-Selfplay-v0", "harness_winogrande_5", split="train")

最新结果

提供了各个任务的最新评估结果,包括准确率(acc)、标准误差(acc_stderr)等指标。具体结果请参考数据集详情中的JSON文件。

搜集汇总
数据集介绍
open-llm-leaderboard/details_azarafrooz__Mistral-7B-Instruct-v0.2-Selfplay-v0 数据集图片
构建方式
在大规模语言模型评估领域,Open LLM Leaderboard作为权威的基准平台,为模型性能比较提供了标准化框架。该数据集正是为记录与复现模型azarafrooz/Mistral-7B-Instruct-v0.2-Selfplay-v0在Leaderboard上的评估过程而自动生成的。其构建方式基于一次完整的评估运行,将评估任务拆解为63个独立的配置,每个配置对应一个具体的评测任务,如ARC挑战赛、HellaSwag、GSM8K等。每个运行结果以时间戳命名的分割形式存储于各配置之中,而“train”分割则始终指向最新一次运行的结果。此外,数据集还专门设立了一个名为“results”的配置,用于汇总所有任务的聚合指标,并支撑Leaderboard上综合得分的计算与展示。
特点
该数据集最显著的特征在于其结构化与可追溯性。它并非静态的样本集合,而是动态评估过程的完整快照,涵盖了从原始任务配置到细粒度指标(如准确率及其标准误差)的全方位信息。数据集中每一配置下的分割均与特定时间戳的评估运行严格对应,确保了结果的可复现性。特别地,对于HendrycksTest等包含众多子领域的综合性评测,数据集通过统一的配置名称“harness_hendrycksTest_5”将抽象代数、解剖学等57个学科的子任务聚合在一起,展现了其在多维度知识评估上的组织能力。同时,每项指标均附带了标准误差,为量化模型性能的不确定性提供了坚实依据。
使用方法
研究人员可通过Hugging Face的datasets库便捷地加载该数据集。具体而言,调用load_dataset函数并指定数据集名称及目标配置(如“harness_winogrande_5”),即可获取对应评测任务的详细结果。配置名称遵循“harness_任务名称_样本数”的命名规则,便于用户按需检索。每个配置下的分割名称为评估运行的时间戳,用户可通过指定分割参数来访问特定历史运行的结果,而“latest”分割则始终指向最新数据。对于需要分析聚合性能的场景,加载“results”配置即可获得模型在所有任务上的综合指标,从而支持深入的比较与复现研究。
背景与挑战
背景概述
自大规模语言模型(LLM)技术兴起以来,如何系统性地评估其推理、常识与知识水平成为学术与工业界共同关注的焦点。Open LLM Leaderboard由HuggingFace团队于2023年发起,旨在为开源大语言模型提供标准化、可复现的评测基准。该数据集正是针对模型azarafrooz/Mistral-7B-Instruct-v0.2-Selfplay-v0的一次完整评测记录,由Clementine等人主导创建,涵盖ARC-Challenge、HellaSwag、MMLU、TruthfulQA、Winogrande及GSM8K等多项核心任务。研究问题聚焦于衡量该7B参数指令微调模型在零样本与少样本设定下的多维度能力,其评测结果对理解自我博弈(Self-play)微调策略在提升模型推理与事实一致性方面的效果具有重要参考价值。该数据集为社区提供了透明、精细的模型性能快照,推动了开源LLM的可信评估生态建设。
当前挑战
该数据集所解决的领域挑战在于:大语言模型在常识推理、数学计算与知识问答等任务上表现参差不齐,缺乏统一、细粒度的多任务评测框架。具体而言,模型在GSM8K(数学推理)上仅获得40.26%的准确率,凸显出数值逻辑推理能力的薄弱;在MMLU的高中数学子集上准确率低至30.37%,表明复杂学科知识掌握不足;同时,TruthfulQA的MC1得分仅为52.39%,揭示出事实一致性仍是重大瓶颈。在构建过程中,数据集面临两大挑战:一是需将模型在63个不同配置下的评测结果进行标准化整理,确保各任务间指标可比;二是需处理多次运行的时间戳对齐与版本管理,以保证“latest”分片始终指向最新结果,避免数据碎片化。这些挑战的克服使得该数据集成为评估LLM综合能力的可靠工具。
常用场景
经典使用场景
在大型语言模型的评估体系中,该数据集作为Open LLM Leaderboard的标准化评测工具,被广泛用于衡量Mistral-7B-Instruct-v0.2-Selfplay-v0等模型在多样化任务上的表现。其核心场景涵盖常识推理、知识问答与数学解题,例如通过ARC-Challenge、HellaSwag、Winogrande等基准测试评估模型的逻辑推理与语义理解能力,同时利用GSM8K检验其数学计算水平。研究者可便捷加载各任务配置,获取模型在57个学科维度(如医学、法律、物理学)的细粒度性能指标,从而实现对模型能力的全方位诊断与横向对比。
实际应用
在实际产业应用中,该数据集为模型选型与部署提供了关键决策依据。企业可参照其在法律文书理解、医学诊断辅助、教育问答系统等垂直领域的评测结果,筛选最适合特定业务场景的模型版本。例如,在需要高精度事实性回答的医疗咨询场景中,模型在MMLU临床知识子集上的表现直接决定了其可用性。同时,数据集支持持续追踪模型迭代过程中的性能变化,帮助开发团队在模型压缩、量化部署等环节中监控能力衰减,确保生产环境下的可靠性。
衍生相关工作
该数据集催生了多项影响深远的研究工作,包括基于其细粒度评测结果提出的自对弈强化学习训练方法(Self-play),以及针对模型在数学推理与常识理解间能力权衡的深入分析。后续研究者利用该数据集的标准化接口,开发了自动化模型评估流水线,并衍生出多语言扩展版本与少量样本学习场景下的适配基准。这些工作不仅深化了对Mistral-7B系列模型能力光谱的认知,更推动了开源大模型评测生态的繁荣,使社区能够系统性地追踪语言模型在知识广度与推理深度上的进化轨迹。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务